全球 AI 聊天室 · 现在 16 人在线 进去聊聊
DIRECTORY / 02

AI 模型广场|开源大模型与 LLM 目录

开源大模型和多模态模型目录:看能力、参数规模、许可证、下载量和来源页,方便对比 Qwen、Llama 等怎么选、怎么部署。PromptCube 模型广场持续收录。

比较模型为你的下一个工作流找到合适的选择
目录概览
839
已收录条目
24 个主题分类持续更新
02 / MODEL INDEX

找到适合任务的模型

先看清楚,再做选择。每个条目都保留关键上下文。

精选目录839 个结果

Whisper Small 模型

OpenAI
244M

Whisper Small 是 OpenAI 推出的轻量化语音识别模型,在性能与资源消耗之间找到了极佳的平衡点。相比于参数量巨大的 Large 版本,Small 模型仅有 2.44 亿参数,这意味着它不仅推理速度极快,而且对硬件要求极低,非常适合部署在个人电脑、移动端甚至各类边缘计算设备上。它在处理日常对话、播客转录以及视频字幕生成等任务时,准确度依然能维持在较高水准。对于开发者而言,它是一个理想的“生产力工具”,既能保证识别的鲁棒性,又不会像大模型那样让算力成本飙升,是构建实时语音交互应用或离线转录工具的首选基座。

automatic speech recognitionMIT
3.8K 星标查看详情

Flan-T5 Large

Google
780M

...

text2text generationApache 2.0
3.8K 星标查看详情

GLM-4 9B 对话版

Tsinghua
9B

GLM-4 9B Chat 是由清华系智谱 AI 推出的轻量化开源大模型,在保持极高中文理解能力的同事,兼顾了中英双语的逻辑转换。虽然参数规模仅为 9B,但它在指令遵循和对话连贯性上表现出色,非常适合开发者在有限的算力资源下进行本地部署或微调。相比于动辄千亿参数的巨型模型,它上手门槛极低,通过消费级显卡即可流畅运行。无论是作为个人知识库的底座,还是集成到自动化工作流中处理日常文本任务,它都能提供非常稳健的性能,是目前国产轻量化模型中的佼佼者。

text generationGLM-4
3.8K 星标查看详情

Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive

HauhauCS
模型

这款由 HauhauCS 基于 Qwen 系列架构微调而成的多模态模型,走的是一条极具“性格”的技术路线。它不仅继承了通义千问强大的图文理解底座,更通过 Uncensored 处理,移除了传统模型中常见的过度防御性限制,在回答逻辑上表现得更加直接、硬核。对于开发者而言,它不再是那个只会说‘作为一个 AI 助手,我不能回答这个问题’的复读机,而是能更深入地解析复杂指令。由于采用了 A3B 架构优化,它在保持 35B 级别逻辑能力的同时,兼顾了推理效率。如果你正在寻找一个能够处理复杂多模态任务、且不希望在内容表达上受到过多刻板限制的本地化部署方案,这款模型非常值得尝试。

image text to textapache-2.0
3.8K 星标查看详情

speaker-diarization-3.1

pyannote
Not specified

Speaker Diarization 3.1 是由 pyannote 团队推出的专业级“说话人日志”模型,简单来说就是解决“谁在什么时候说了什么”的问题。它不同于传统的语音转文字(ASR),而是专注于音频中的身份切分。对于需要处理多人会议记录、访谈转录的开发者来说,它是极佳的预处理工具,可以与 Whisper 等 ASR 模型配合使用,将原本混在一起的文字流精准地标注出不同发言人。该模型采用 MIT 协议,上手难度中等,适合集成到自动化办公或智能录音分析工作流中。

automatic speech recognitionmit
3.7K 星标查看详情

Janus-Pro-7B

deepseek-ai
模型

Janus-Pro-7B 是由 DeepSeek 推出的多模态“全能型”模型,其核心亮点在于实现了真正的 Any-to-Any 能力。不同于传统的只能“看图说话”的模型,它能够处理图像与文本之间的双向转换,既能深度理解复杂的视觉信息,也能高质量地生成图像。对于开发者而言,7B 的参数量在性能与部署成本之间取得了极佳平衡,非常适合集成到需要视觉理解与生成能力的端侧应用或轻量化工作流中。无论你是想构建一个能读图写代码的助手,还是一个能通过文字精准绘图的智能体,Janus-Pro 都能提供比单一模态模型更丝滑的交互体验,是目前开源社区中极具潜力的多模态基座。

any to anymit
3.7K 星标查看详情

e5-large-v2

intfloat
Not specified

e5-large-v2 是一款高性能的文本向量化模型,专注于将自然语言转化为高质量的语义向量。对于开发者而言,它不是用来聊天的对话模型,而是构建 RAG(检索增强生成)系统的核心组件。它在语义相似度计算和文本检索方面表现出色,能有效将用户查询与知识库中的相关片段精准匹配。由于其基于 MIT 协议开源且推理开销相对可控,非常适合部署在本地环境,作为向量数据库的前端编码器,替代或优化传统的关键词检索。

sentence similaritymit
3.6K 星标查看详情

Yi-1.5 34B

01.AI
34B

Yi-1.5 34B 是由零一万物(01.AI)推出的高性能中英双语大模型。在 34B 这个参数量级上,它精准地平衡了推理能力与运行效率,非常适合开发者在有限的显存资源下进行本地部署或微调。相比于参数量巨大的模型,它的响应速度更快,且在中文语境的理解、逻辑推理及文本创作方面表现扎实,能有效应对复杂的指令遵循任务。如果你正在寻找一个既能处理高质量中英翻译,又能作为智能助手或垂直领域知识库底座的开源模型,Yi-1.5 34B 是一个性价比极高的进阶选择,上手门槛适中,对现有开源生态支持友好。

text generationApache 2.0
3.6K 星标查看详情

Edge0-35B-A3B-preview

Edge0
模型

Edge0-35B-A3B-preview 是由 Edge0 推出的一个极具性价比的文本生成模型。从命名规格来看,它采用了 MoE(混合专家)架构,虽然总参数量在 35B 左右,但在推理时仅激活约 3B 参数,这使得它在保持较高逻辑能力的同时,极大地降低了对显存和计算资源的门槛。对于开发者而言,这意味着你可以在消费级显卡上更流畅地运行它,实现低延迟的对话或文本处理任务。相比于动辄百亿参数的全量模型,它更适合作为端侧应用或轻量级 Agent 的底层大脑,在处理日常文案、代码辅助及逻辑推理时,能提供非常平衡的性能表现,是追求推理效率与成本平衡的开发者值得关注的预览版模型。

text generationapache-2.0
3.6K 星标查看详情

phi-2

microsoft
模型

微软推出的 Phi-2 是一款极具“小钢炮”气质的轻量化语言模型。虽然参数规模远小于 GPT-4 等巨头,但它在逻辑推理、代码编写和数学解题等硬核任务上表现惊人,充分证明了高质量训练数据的重要性。对于开发者而言,Phi-2 的最大优势在于“低门槛、高性能”:你不需要昂贵的 A100 集群,在消费级显卡甚至高性能笔记本上就能流畅运行。它非常适合作为端侧 AI 的核心,或者用于构建特定领域的垂直应用,是研究模型蒸馏、轻量化部署以及构建个人知识库工具的理想基座。

text generationmit
3.5K 星标查看详情

OpenJourney v4

PromptHero
860M

如果你在寻找一种无需订阅 Midjourney 就能获得类似质感的生成方案,OpenJourney v4 是一个非常值得尝试的 Stable Diffusion 微调模型。它通过在 PromptHero 的大规模数据集上进行深度训练,精准捕捉了 Midjourney 那种极具艺术感、光影细腻且构图考究的视觉风格。相比于原版 SD 模型,它在理解艺术指令和色彩氛围上表现得更加“懂行”。对于开发者和创作者来说,它的上手难度极低,可以直接集成在 WebUI 或 ComfyUI 等主流工具链中使用,非常适合用于快速生成高质量的插画、概念设计或社交媒体配图,是低成本复刻顶级 AI 绘画审美的高效路径。

text to imageCreativeML Open RAIL++-M
3.5K 星标查看详情

gemma-7b

google
模型

Gemma-7b 是 Google 基于 Gemini 技术栈打造的轻量化开源模型。虽然只有 7B 的参数规模,但它在逻辑推理和文本生成上的表现相当惊艳,甚至能与一些更大规模的模型一较高下。对于开发者来说,它的核心优势在于“小而强”:你可以轻松地在消费级显卡甚至高性能笔记本上进行本地部署,非常适合用于构建私有化的知识库、智能助手或进行特定任务的微调。相比于庞大的 GPT 系列,Gemma 的上手门槛更低,且由于其开源特性,你可以更自由地探索其在垂直领域的应用潜力。如果你正在寻找一个既能保证响应速度,又具备较强逻辑能力的端侧或轻量化模型,Gemma-7b 是一个非常值得尝试的选择。

text generationgemma
3.4K 星标查看详情

bge large en v1.5

BAAI
模型

bge-large-en-v1.5 是由北京智源人工智能研究院(BAAI)推出的高性能英文文本向量模型。它并非用于对话的 LLM,而是将文本转化为高维向量的特征提取工具,在检索增强生成(RAG)架构中扮演关键角色。该模型在语义匹配和文档检索方面表现强劲,能有效将用户查询与知识库内容进行精准对齐。对于开发者而言,它能无缝集成到 Milvus 或 FAISS 等向量数据库中,上手难度低,是构建英文专业知识库、语义搜索系统的理想底层组件。

feature-extractionmit
3.4K 星标查看详情

树皮 / 犬吠

Suno
1.2B

Bark 是由 Suno 团队推出的开源音频生成模型,它不仅仅是一个简单的文字转语音(TTS)工具,更像是一个能“演戏”的音频生成器。基于 Transformer 架构,Bark 的核心能力在于它能模拟出极其自然的非言语声音,比如笑声、叹息、哭泣,甚至能根据文本语境自动生成背景音乐和环境音。对于开发者和内容创作者来说,它非常适合用于制作有情感表现力的播客配音、游戏 NPC 对话或短视频音效。虽然 1.2B 的参数量对本地显存有一定要求,但凭借 MIT 开源协议,你可以非常灵活地进行二次开发或私有化部署,是构建沉浸式音频应用的高性价比选择。

text to audioMIT
3.4K 星标查看详情

DeepSeek-OCR

deepseek-ai
模型

DeepSeek OCR 是一款由 DeepSeek 推出的高性能文档识别模型,旨在将图像中的文本精准转化为结构化数据。不同于传统的 OCR 仅做文字识别,它更强调对复杂排版、表格以及文档结构的深度理解,能够有效处理扫描件或拍照文档中的噪声干扰。对于开发者而言,该模型上手门槛低,可快速集成到自动化办公或知识库构建流程中,是替代传统 OCR 插件、提升 RAG(检索增强生成)数据清洗质量的理想选择。

image text to textmit
3.4K 星标查看详情

Mistral-7B-Instruct-v0.2

mistralai
模型

Mistral-7B-Instruct-v0.2 是由 Mistral AI 推出的高性能轻量化指令微调模型。在开源社区中,它以极高的“能效比”著称,虽然参数规模仅为 7B,但在逻辑推理、代码编写和多轮对话的稳定性上,表现足以硬刚许多参数量翻倍的模型。对于开发者而言,它最大的优势在于对硬件极其友好,单张消费级显卡即可流畅运行,非常适合作为本地知识库(RAG)的底层引擎或构建轻量化 Agent。相比于 Llama 系列,它的指令遵循能力更细腻,上手门槛低,是目前追求本地化部署与响应速度平衡的首选方案之一。

text generationapache-2.0
3.2K 星标查看详情

BART Large CNN

Facebook
406M

BART Large CNN 是由 Meta (Facebook) 开发的一款经典文本生成模型,专门针对 CNN/Daily Mail 新闻数据集进行了微调,使其在自动摘要任务上表现出色。它采用了典型的 Encoder-Decoder 架构,擅长将长篇幅的文章精炼为简洁的摘要,且能较好地保持语义连贯性。对于开发者而言,该模型在 Hugging Face 等社区支持极佳,上手难度低,是构建新闻摘要、会议纪要缩减或长文本快读工具的理想基准模型。虽然参数量在当前大模型时代不算大,但在特定摘要场景下依然高效且稳定。

summarizationApache 2.0
3.2K 星标查看详情

DeepSeek-V3-0324

deepseek-ai
模型

DeepSeek-V3-0324 是国产大模型之光 DeepSeek 推出的最新迭代版本。作为一款高性能的通用文本生成模型,它在逻辑推理、代码编写以及中文语境理解上表现出了极强的竞争力,足以媲美国际主流的一线闭源模型。对于开发者而言,它不仅能胜任复杂的指令遵循任务,在处理长文本分析和结构化数据生成时也十分稳健。由于采用了开源协议,你可以非常灵活地将其集成到自己的应用流中,无论是作为智能对话助手、自动化编程插件,还是构建垂直领域的知识库,它的上手门槛都很低,是目前国内开发者构建 AI 应用时非常值得关注的“平替”甚至“优选”方案。

text generationmit
3.2K 星标查看详情

CodeQwen 7B

Alibaba
7B

CodeQwen 7B 是阿里巴巴通义千问团队推出的代码专项模型,在 7B 这个轻量化量级上展现了极强的代码理解与生成能力。它针对中英文双语注释和需求进行了深度优化,非常适合中国开发者在处理中文注释、理解中文业务逻辑文档时使用。相比于动辄几十 GB 的巨型模型,CodeQwen 对显存要求极低,即便是在消费级显卡甚至本地笔记本上也能流畅运行,是构建个人编程助手或轻量级 IDE 插件的理想底座。如果你正在寻找一个上手门槛低、响应速度快,且能精准理解中文开发语境的开源代码模型,它是一个非常务实的选择。

code generationApache 2.0
3.1K 星标查看详情

LocateAnything-3B

nvidia
模型

LocateAnything-3B 是由 NVIDIA 推出的轻量化多模态模型,专门针对图像中的物体定位任务进行了优化。不同于传统的检测模型,它采用‘图像-文本-文本’的交互模式,这意味着你不再需要预定义固定的标签类别,而是可以直接用自然语言描述想要寻找的目标(例如‘那个穿红衣服的人手中的杯子’),模型会精准地返回坐标。3B 的参数规模使其在保持较高识别精度的同时,兼顾了推理效率,非常适合集成到对实时性有要求的端侧应用或视觉助手中。对于开发者来说,它的上手门槛较低,能够很好地作为现有视觉流水线中的‘语义定位层’,弥补传统目标检测在开放世界语义理解上的不足。

image text to textother
3.1K 星标查看详情

Llama-3.3-70B-Instruct

meta-llama
模型

Llama-3.3-70B-Instruct 是 Meta 推出的重磅升级版模型,它最核心的价值在于用 70B 的参数规模,实现了以往需要更大参数量(如 405B)才能达到的性能水平。对于开发者来说,这意味着你可以在保持较低推理成本和响应速度的同时,获得接近顶级闭源模型的逻辑推理、指令遵循和复杂任务处理能力。它非常适合集成到智能客服、自动化代码助手或复杂的 RAG(检索增强生成)工作流中。相比于早期的 Llama 系列,它的语言理解更加细腻,能够更精准地理解中文语境下的复杂指令,是目前开源社区中兼顾性价比与高性能的“全能选手”。

text generationllama3.3
3.0K 星标查看详情

Kimi-K2-Instruct

moonshotai
模型

Kimi-K2-Instruct 是月之暗面(Moonshot AI)推出的新一代指令遵循模型,延续了 Kimi 系列在长文本处理和逻辑推理上的核心优势。相比前代,K2 在复杂指令的理解精度和对话连贯性上有了显著提升,非常适合需要深度思考、长文档分析或复杂任务拆解的开发者。对于习惯使用 Kimi 网页版或 App 的用户来说,这款模型在底层逻辑上更加硬核,能够更精准地执行多步指令。上手门槛极低,通过 Hugging Face 即可直接调用或部署,是构建高智能 AI Agent(智能体)或长文本知识库应用的理想底座。

text generationother
3.0K 星标查看详情

starcoder

bigcode
模型

StarCoder 是由 BigCode 项目开源的一款专注于代码生成的语言模型。对于开发者来说,它不仅仅是一个简单的代码补全工具,更像是一个理解编程逻辑的智能助手。它在训练过程中学习了大量主流编程语言,能够胜任从函数编写、算法实现到代码重构等多种开发任务。相比于通用的聊天模型,StarCoder 的优势在于其对代码语境的深度理解,非常适合集成到 IDE 插件或自动化流水线中,作为 GitHub Copilot 的高性能开源替代方案。上手难度较低,只要熟悉 Hugging Face 生态,开发者可以轻松将其部署在本地环境,实现私有化、高安全性的编程辅助体验。

text generationbigcode-openrail-m
3.0K 星标查看详情

QwQ-32B

Qwen
模型

QwQ-32B 是通义千问团队推出的强化学习推理模型,它不再只是简单的“文本接龙”,而是具备了类似 OpenAI o1 的深度思考能力。通过在训练中引入大规模强化学习,模型在面对复杂数学题、逻辑谜题或高难度编程任务时,会通过“思维链”进行自我博弈和推理,从而显著提升解决问题的准确率。对于开发者而言,32B 的参数量在性能与部署成本之间找到了极佳的平衡点,既能通过本地显卡或轻量化云端环境跑起来,又能处理逻辑严密的专业工作流。如果你需要一个能帮你 debug 复杂逻辑或推导数学公式的 AI 助手,QwQ 是目前开源界非常值得关注的选择。

text generationapache-2.0
3.0K 星标查看详情