全球 AI 聊天室 · 现在 16 人在线 进去聊聊
DIRECTORY / 02

AI 模型广场|开源大模型与 LLM 目录

开源大模型和多模态模型目录:看能力、参数规模、许可证、下载量和来源页,方便对比 Qwen、Llama 等怎么选、怎么部署。PromptCube 模型广场持续收录。

比较模型为你的下一个工作流找到合适的选择
目录概览
839
已收录条目
24 个主题分类持续更新
02 / MODEL INDEX

找到适合任务的模型

先看清楚,再做选择。每个条目都保留关键上下文。

精选目录839 个结果

Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled

Jackrong
模型

这款模型是一个非常有意思的“缝合”实验产物,它基于 Qwen3.5-27B 的底座,通过蒸馏技术引入了 Claude 4.6 Opus 的推理逻辑。简单来说,它试图在保持 Qwen 系列优秀中文理解能力和多模态(图文输入)优势的同时,通过蒸馏手段“借用”顶尖模型的高阶逻辑推理思维。对于开发者而言,它在处理复杂的图文推理、逻辑分析任务时,表现会比原生的 27B 模型更加细腻。虽然参数量级处于中等水平,但在推理深度上有望实现跨级挑战。上手难度极低,由于采用了 Apache-2.0 开源协议,非常适合作为本地部署的逻辑增强型多模态助手,用来替代一些响应较慢的大型闭源模型。

image text to textapache-2.0
2.9K 星标查看详情

bge-m3

BAAI
Not specified

BGE-M3 是由北京智源人工智能研究院(BAAI)推出的全能型向量模型,旨在解决传统 Embedding 模型在多语言支持和检索长度上的痛点。它最大的特色是“三合一”能力,同时支持稠密检索、稀疏检索和多向量检索,能够极大地提升 RAG(检索增强生成)系统的召回精度。对于开发者而言,它不仅支持 100 多种语言,还拥有 8192 tokens 的超长上下文窗口,上手门槛低,且与 LangChain、LlamaIndex 等主流 AI 框架无缝衔接,是构建企业级知识库的理想选择。

sentence similaritymit
2.9K 星标查看详情

百川2 13B

Baichuan
13B

百川智能推出的 Baichuan2-13B 是一款在中文语境下表现均衡的轻量化大模型。相比于动辄百亿、千亿参数的巨型模型,13B 的参数规模意味着它对硬件的要求更加亲民,开发者甚至可以在消费级显卡上实现高效部署。该模型的核心优势在于扎实的中文常识推理能力,能够流畅处理日常对话、文本创作及逻辑问答。对于想要在本地搭建私有化知识库、进行垂直领域微调,或者在资源有限的情况下追求中文理解效果的开发者来说,这是一个非常务实且高性价比的选择。它不仅能作为通用聊天助手,也是构建轻量级 AI 应用的理想基座。

text generationApache 2.0
2.9K 星标查看详情

Qwen3.6-35B-A3B

Qwen
模型

Qwen3.6 35B A3B 是阿里 Qwen 团队推出的一款高性能多模态模型,主打图文理解与生成。它在保持 35B 参数量级带来的强大推理能力的同时,通过 A3B 架构优化了计算效率,使得在处理复杂视觉任务(如文档分析、图表解读)时响应更快。对于国内开发者而言,该模型在中文语境下的视觉识别精度极高,非常适合集成到自动化办公、智能客服或多模态 RAG 系统中。上手难度低,兼容主流推理框架,是寻找 GPT-4o 级别视觉能力且希望私有化部署的理想选择。

image text to textapache-2.0
2.9K 星标查看详情

Kimi-K2.5

moonshotai
模型

Kimi-K2.5 是由 Moonshot AI 推出的多模态理解模型,主打“图文理解”能力。不同于纯文本模型,它能像人类一样‘看图说话’,通过融合视觉与文本信息,实现对复杂图像内容的深度解析。对于开发者来说,它非常适合集成到需要处理文档扫描件、复杂图表分析或视觉问答的业务场景中。相比于传统的 OCR 工具,Kimi-K2.5 的优势在于不仅能‘认字’,更能‘理解’图片背后的逻辑关系。上手难度较低,在 Hugging Face 上即可直接调用或部署,是构建智能视觉助手、自动化数据提取流程的有力工具。

image text to textother
2.9K 星标查看详情

SigLIP SO400M

Google
400M

...

image text to textApache 2.0
2.8K 星标查看详情

StarCoder2 15B

BigCode
15B

StarCoder2 15B 是由 BigCode 团队推出的高性能开源代码大模型,基于海量的 The Stack v2 数据集训练而成。相比于前代,15B 版本在逻辑推理和复杂语法理解上有了显著提升,能够精准处理多种主流编程语言。对于开发者而言,它不仅是一个能写代码的助手,更是一个优秀的补全引擎,非常适合集成到 VS Code 或 JetBrains 等 IDE 插件中实现实时代码建议。它的上手门槛较低,既可以通过本地部署来保障代码隐私,也能通过 API 调用快速接入现有工作流。如果你正在寻找一个既有专业深度、又具备开源生态灵活性的代码生成工具,StarCoder2 是目前 15B 参数量级中的有力竞争者。

code generationBigCode OpenRAIL-M
2.8K 星标查看详情

SVD 图像转视频

Stability AI
1.5B

...

image to videoStability AI NC
2.8K 星标查看详情

Qwythos-9B-Claude-Mythos-5-1M-GGUF

empero-ai
模型

Qwythos-9B 是一款基于多模态架构的小参数量视觉语言模型,它将图像理解与文本生成能力结合在一起。该模型特别针对长文本处理进行了优化(支持高达 1M 的上下文窗口),这意味着你可以尝试让它“读完”一整本图文并茂的书,或者分析超长序列的视觉信息。虽然参数量仅为 9B,但通过 GGUF 格式的量化处理,它对个人开发者的硬件要求非常友好,即便在消费级显卡甚至部分高配笔记本上也能流畅运行。它非常适合用于复杂的图文问答、长文档视觉解析以及需要极高上下文容量的创意写作场景,是本地部署多模态应用的理想轻量化选择。

image text to textapache-2.0
2.8K 星标查看详情

Qwen-Image

Qwen
Not specified

Qwen Image 是由阿里通义千问团队推出的文本生成图像模型。它延续了 Qwen 系列在中文语义理解上的深厚积淀,能够精准捕捉中文提示词中的微妙语境,有效解决了许多开源模型在处理中文描述时容易出现的“理解偏差”问题。无论是生成写实风格的商业素材,还是具有中国文化元素的艺术创作,它都能提供较高的出图质量。对于开发者而言,得益于 Apache-2.0 协议,该模型在部署和商业化上非常灵活,上手难度低,是替代部分闭源绘图工具、构建自有图像生成管线的理想选择。

text to imageapache-2.0
2.6K 星标查看详情

GLM-5.3-Flash

zai-org
模型

GLM-5.3-Flash 是由 zai-org 推出的轻量化多模态模型,核心能力聚焦于“图文理解”到“文本输出”的转化。简单来说,它能像人类一样‘看图说话’,无论是识别图片中的复杂物体、解析图表数据,还是根据视觉信息进行逻辑推理,表现都相当稳健。得益于 Flash 系列的命名定位,该模型在推理速度和响应延迟上做了深度优化,非常适合集成到需要实时反馈的移动端应用或高频交互的聊天机器人中。对于开发者而言,它采用 MIT 开源协议,上手门槛极低,可以无缝接入现有的多模态工作流,是追求高性能与低成本平衡的理想选择。

image text to textmit
2.6K 星标查看详情

XTTS v2

Coqui AI
1.6B

XTTS v2 是由 Coqui AI 开发的一款高性能跨语言语音克隆模型,核心优势在于其强大的“少样本”克隆能力。开发者只需提供一段短短几秒钟的目标人物音频,模型就能精准捕捉音色、语调甚至情感特征,并将其应用到多种语言的文本转语音任务中。相比于传统的 TTS 工具,它不仅解决了语种切换时的音色漂移问题,在自然度和情感表达上也更接近真人。虽然 1.6B 的参数量对本地部署的显存有一定的要求,但对于追求高拟真度、需要实现多语言角色配音或个性化语音助手的开发者来说,它是目前开源社区中最值得关注的重量级方案之一。

text to speechCPML
2.5K 星标查看详情

NLLB-200 600M

Meta
600M

NLLB-200 600M 是 Meta 推出的“No Language Left Behind”系列中的轻量化版本。虽然只有 6 亿参数,但它最核心的竞争力在于其极其恐怖的语种覆盖能力,支持多达 200 种语言的翻译,甚至包括许多极其稀缺的低资源语种。对于开发者来说,这个 600M 版本非常友好:它对显存要求极低,甚至可以在消费级显卡甚至移动端设备上流畅运行。如果你正在构建需要处理小众语种、或者对推理延迟和成本非常敏感的翻译应用,NLLB-200 是比通用大模型更专业、更具性价比的选择。上手难度不高,通过 Hugging Face 即可快速部署。

translationCC BY-NC 4.0
2.4K 星标查看详情

Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF

DavidAU
模型

这是一个基于 Qwen 系列进行深度微调的社区量化版本,采用了 GGUF 格式,旨在通过多种融合技术提升模型的逻辑推理与创意表达能力。该模型在保持 Qwen 强大中文底座能力的同时,通过特定数据集的优化,弱化了原厂过于死板的回复限制,使对话风格更自然、更具灵活性。对于开发者而言,由于其 GGUF 格式,可以非常方便地在本地通过 llama.cpp 或 Ollama 部署,无需昂贵的显卡即可在消费级硬件上运行,非常适合需要高度自定义对话风格的本地化 AI 应用场景。

image text to textapache-2.0
2.4K 星标查看详情

Qwen3.6-27B

Qwen
模型

Qwen3.6-27B 是阿里通义千问团队推出的一个平衡性能与规模的视觉语言模型。它采用了 image-text-to-text 架构,能够高效处理图文混合输入,在 OCR 文字识别、复杂图表分析以及视觉常识推理方面表现出色。对于开发者而言,27B 的参数量使其在保持强大理解能力的同时,对硬件显存的要求比超大模型更友好,非常适合部署在私有化服务器中作为企业级视觉助手或自动化数据提取工具。它不仅能接替传统的 OCR 插件,更能通过自然语言对话直接分析图像深层含义。

image text to textapache-2.0
2.3K 星标查看详情

Ternary-Bonsai-2-27B-gguf

prism-ml
模型

Ternary-Bonsai-2-27B 是一款针对效率优化的文本生成模型,采用了独特的量化技术,将参数压缩到了极致。对于开发者而言,它最大的吸引力在于“以小博大”:虽然参数量级在 27B 左右,但通过三值化(Ternary)等技术处理,极大地降低了显存占用,让普通消费级显卡甚至高性能笔记本也能流畅运行。它的逻辑推理和文本创作能力在同尺寸模型中表现均衡,非常适合作为本地知识库(RAG)的后端引擎,或者集成到个人 AI 工作流中。上手难度低,配合 llama.cpp 等主流 GGUF 工具即可实现开箱即用,是追求本地化部署与低成本推理的进阶玩家首选。

text generationapache-2.0
2.3K 星标查看详情

Qwen2.5-7B-Instruct

Qwen
模型

Qwen2.5-7B-Instruct 是阿里巴巴通义千问团队推出的新一代主力尺寸模型。它在保持 7B 轻量级参数量的同时,大幅强化了代码编写、数学推理和指令遵循能力,性能在同量级模型中处于顶尖水平。对于开发者而言,该模型非常适合部署在消费级显卡上,作为本地知识库的推理引擎或自动化工作流的调度核心。相比于之前的版本,它在中文语境下的理解力更细腻,能更精准地执行复杂格式要求,是目前替代闭源 API 实现私有化部署的理想选择。

text generationapache-2.0
2.2K 星标查看详情

detr resnet 50

facebook
模型

DETR (Detection Transformer) 是由 Facebook 提出的开创性目标检测模型,它彻底改变了传统检测任务对 Anchor(锚框)和 NMS(非极大值抑制)的依赖。该版本采用 ResNet-50 作为骨干网络提取特征,通过 Transformer 的全局注意力机制直接预测目标边界框和类别。对于开发者而言,DETR 将目标检测简化为了一个端到端的集预测问题,极大地简化了后处理流程。虽然其训练收敛速度较慢,但在处理大物体检测和减少冗余框方面具有显著优势,是研究现代视觉 Transformer 的必经之路。

object-detectionapache-2.0
2.2K 星标查看详情

i2vgen xl

ali-vilab
模型

i2vgen-xl 是由阿里视觉实验室 (Ali-Vilab) 开源的一款高质量图生视频模型。与常见的文生视频工具不同,它专注于将静态图像转化为流畅的动态视频,能有效保持原图的视觉一致性,避免在生成过程中出现严重的形变。对于开发者而言,该模型采用 MIT 协议,部署门槛较低,非常适合用于将电商产品图动态化、给 AI 绘画作品添加氛围感或构建简单的短视频生成管线。它在处理光影变化和物体自然运动方面表现出色,是目前开源社区中极具竞争力的图生视频方案。

text-to-videomit
2.2K 星标查看详情

MMS 文本转语音(英文)

Meta
1B

...

text to speechCC BY-NC 4.0
2.1K 星标查看详情

Qwen3.5-9B

Qwen
模型

Qwen3.5 9B 是阿里通义千问家族的最新轻量化多模态模型。它在保持 9B 参数规模的同时,显著增强了对图像和文本的综合理解能力。对于中国开发者而言,该模型最大的优势在于其极高的推理能效比,能够轻松部署在消费级显卡上,同时在中文语境的视觉分析、文档解析和图表理解方面表现出色。它不是为了取代超大规模模型,而是为需要快速响应、低成本私有化部署的视觉助手或自动化办公场景提供了极佳的平衡点。

image text to textapache-2.0
2.1K 星标查看详情

GLM-OCR

zai-org
Not specified

GLM OCR 是一款基于 GLM 视觉能力构建的轻量化文字识别模型。不同于传统的 OCR 仅能输出纯文本,它更像是一个能“读懂”图片的 AI,能够精准处理复杂排版、表格以及手写文字,并将识别结果直接转化为结构化文本。对于开发者而言,它极大地简化了从图像到数据的预处理流程,无需再编写复杂的后处理逻辑来修正识别错误。无论你是想快速数字化文档,还是构建自动化数据抓取工具,它都提供了极低的上门门槛,是替代传统 OCR 引擎的理想选择。

image to textmit
2.1K 星标查看详情

gemma-3-27b-it

google
模型

Gemma 3-27b-it 是 Google 推出的新一代多模态轻量化模型,核心亮点在于其强大的‘图文理解’能力。它不再局限于纯文本对话,而是能像人类一样‘看图说话’,无论是解析复杂的图表、识别图片中的细节,还是根据图像内容进行逻辑推理,表现都非常出色。27B 的参数规模在性能与部署成本之间找到了极佳的平衡点:它比超大规模模型更轻快,比纯文本模型更聪明。对于开发者来说,如果你想在本地设备或中等算力的服务器上构建视觉问答、自动化图像标注或智能文档分析应用,它是目前市面上极具竞争力的开源首选。上手门槛低,与 Hugging Face 生态兼容性极佳。

image text to textgemma
2.0K 星标查看详情

Qwen3-8B

Qwen
模型

Qwen3-8B 是阿里通义千问系列的最新中量级模型。在保持 8B 参数量带来的极高推理效率的同时,它在中文语境理解、逻辑推理以及代码编写能力上有了显著提升。对于开发者而言,它非常适合部署在消费级显卡上,用于构建本地知识库、自动化工作流或作为轻量级 Agent 的大脑。相比于大型模型,它在响应速度和成本上优势明显,且由于采用了 Apache-2.0 协议,企业级落地更加灵活,是目前替代闭源 API 或构建私有化 AI 应用的理想选择。

text generationapache-2.0
2.0K 星标查看详情