全球 AI 聊天室 · 现在 18 人在线 进去聊聊
DIRECTORY / 02

AI 模型广场|开源大模型与 LLM 目录

开源大模型和多模态模型目录:看能力、参数规模、许可证、下载量和来源页,方便对比 Qwen、Llama 等怎么选、怎么部署。PromptCube 模型广场持续收录。

比较模型为你的下一个工作流找到合适的选择
目录概览
67
已收录条目
24 个主题分类持续更新
02 / MODEL INDEX

找到适合任务的模型

先看清楚,再做选择。每个条目都保留关键上下文。

精选目录67 个结果

Qwen3.8-27B

Qwen
模型

Qwen3.8-27B 是通义千问团队推出的新一代多模态大模型,主打强大的图文理解与跨模态推理能力。不同于纯文本模型,它能直接“看懂”图片并结合上下文进行深度对话。27B 的参数规模在性能与推理成本之间取得了极佳的平衡,非常适合开发者将其集成到需要视觉识别、文档解析或复杂图像问答的应用场景中。对于习惯使用 GPT-4V 的用户来说,Qwen 系列在中文语境下的图像理解表现往往更具本土化优势。模型采用 Apache-2.0 开源协议,对商业化部署非常友好,上手门槛适中,通过 Hugging Face 即可快速调用或进行微调。

image text to textapache-2.0
16.6K 星标查看详情

Kimi-K3

moonshotai
模型

Kimi-K3 是由月之暗面(Moonshot AI)推出的多模态大模型,专门针对“图文理解”这一核心能力进行了深度优化。不同于单纯的文本对话模型,K3 能够像人类一样“看懂”图片并结合上下文进行逻辑推理。对于开发者而言,它在处理复杂的图文交互任务时表现出色,无论是解析复杂的流程图、识别图片中的细微文字,还是进行基于视觉信息的创意写作,都能提供极高的准确度。该模型目前托管在 Hugging Face 上,上手门槛较低,非常适合希望在现有应用中集成视觉理解能力的开发者,是构建智能视觉助手或自动化文档处理工具的理想选择。

image text to textother
11.5K 星标查看详情

Qwen3.8-Flash-Next

Qwen
模型

Qwen3.8-Flash-Next 是通义千问团队推出的新一代多模态轻量化模型,主打“快”与“灵”。它不仅能读懂文字,更具备出色的图文理解能力,能够直接通过图像内容进行逻辑推理和对话。相比于参数庞大的巨型模型,Flash 系列在保持极高响应速度的同时,大幅降低了推理成本,非常适合需要实时视觉反馈的应用场景,比如移动端视觉助手、自动化文档扫描或实时图像内容识别。对于开发者而言,它的上手门槛极低,通过 Hugging Face 即可快速集成,是构建高性价比多模态应用、替代传统 OCR 或复杂视觉任务的理想选择。

image text to textother
5.8K 星标查看详情

Unlimited-OCR

baidu
模型

Unlimited OCR 是由百度推出的一款开源图像文本识别模型,旨在解决复杂场景下的文字提取痛点。不同于传统的 OCR 工具,它在处理非结构化排版、多语言混排以及低质量图像时具有更强的鲁棒性。对于开发者而言,由于采用了 MIT 许可,该模型非常适合集成到企业内部的文档数字化流程或自动化办公插件中。其上手门槛较低,能够快速将图片、扫描件转化为可编辑的文本,是构建 RAG(检索增强生成)知识库时高效处理 PDF 和图片数据的理想预处理组件。

image text to textmit
4.3K 星标查看详情

LLaVA 1.5 7B

LLaVA
7B

LLaVA 1.5 7B 是多模态大模型领域的“平民英雄”。它通过将视觉编码器与 Llama 2 语言模型进行指令微调,实现了极高的图文交互效率。对于开发者来说,它最大的价值在于用较小的参数规模(7B),完成了从“看图识物”到“理解图意”的跨越。你可以用它来进行复杂的图像描述、视觉问答,甚至是基于图片的逻辑推理。相比于动辄参数量巨大的闭源多模态模型,LLaVA 1.5 的上手门槛极低,对显存要求友好,非常适合作为本地化部署、垂直领域微调或构建轻量级视觉助手的基础底座。

image text to textLlama 2
4.1K 星标查看详情

gemma-4-31B-it

google
模型

Gemma 4 31B-it 是 Google 推出的一款高性能开源多模态模型。它在保持中等参数规模的同时,显著增强了对图像和文本的综合理解能力,能够高效处理复杂的图文分析任务。对于中国开发者而言,该模型采用 Apache-2.0 协议,部署门槛低且灵活,非常适合作为企业级 RAG 应用或多模态助手的基础底座。相比于超大规模模型,它在推理速度和资源占用之间取得了较好平衡,是构建垂直领域视觉问答或文档解析工具的理想选择。

image text to textapache-2.0
4.0K 星标查看详情

DeepSeek-V4.1-Flash

deepseek-ai
模型

DeepSeek-V4.1-Flash 是 DeepSeek 推出的轻量化多模态模型,主打“图文理解”的高效处理能力。它不再局限于纯文本对话,而是进化成了能“看懂”图片的智能体。对于开发者而言,这款模型的核心优势在于极高的响应速度和极低的推理成本,非常适合需要实时处理图像信息的应用场景,比如自动化图片内容审核、视觉问答(VQA)或复杂的文档图表解析。相比于参数量巨大的旗舰模型,Flash 版本在保持了较强视觉感知能力的同时,大幅降低了上手门槛和硬件压力,是构建高性价比视觉 AI 应用的理想选择。

image text to textmit
3.9K 星标查看详情

Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive

HauhauCS
模型

这款由 HauhauCS 基于 Qwen 系列架构微调而成的多模态模型,走的是一条极具“性格”的技术路线。它不仅继承了通义千问强大的图文理解底座,更通过 Uncensored 处理,移除了传统模型中常见的过度防御性限制,在回答逻辑上表现得更加直接、硬核。对于开发者而言,它不再是那个只会说‘作为一个 AI 助手,我不能回答这个问题’的复读机,而是能更深入地解析复杂指令。由于采用了 A3B 架构优化,它在保持 35B 级别逻辑能力的同时,兼顾了推理效率。如果你正在寻找一个能够处理复杂多模态任务、且不希望在内容表达上受到过多刻板限制的本地化部署方案,这款模型非常值得尝试。

image text to textapache-2.0
3.8K 星标查看详情

DeepSeek-OCR

deepseek-ai
模型

DeepSeek OCR 是一款由 DeepSeek 推出的高性能文档识别模型,旨在将图像中的文本精准转化为结构化数据。不同于传统的 OCR 仅做文字识别,它更强调对复杂排版、表格以及文档结构的深度理解,能够有效处理扫描件或拍照文档中的噪声干扰。对于开发者而言,该模型上手门槛低,可快速集成到自动化办公或知识库构建流程中,是替代传统 OCR 插件、提升 RAG(检索增强生成)数据清洗质量的理想选择。

image text to textmit
3.4K 星标查看详情

LocateAnything-3B

nvidia
模型

LocateAnything-3B 是由 NVIDIA 推出的轻量化多模态模型,专门针对图像中的物体定位任务进行了优化。不同于传统的检测模型,它采用‘图像-文本-文本’的交互模式,这意味着你不再需要预定义固定的标签类别,而是可以直接用自然语言描述想要寻找的目标(例如‘那个穿红衣服的人手中的杯子’),模型会精准地返回坐标。3B 的参数规模使其在保持较高识别精度的同时,兼顾了推理效率,非常适合集成到对实时性有要求的端侧应用或视觉助手中。对于开发者来说,它的上手门槛较低,能够很好地作为现有视觉流水线中的‘语义定位层’,弥补传统目标检测在开放世界语义理解上的不足。

image text to textother
3.1K 星标查看详情

Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled

Jackrong
模型

这款模型是一个非常有意思的“缝合”实验产物,它基于 Qwen3.5-27B 的底座,通过蒸馏技术引入了 Claude 4.6 Opus 的推理逻辑。简单来说,它试图在保持 Qwen 系列优秀中文理解能力和多模态(图文输入)优势的同时,通过蒸馏手段“借用”顶尖模型的高阶逻辑推理思维。对于开发者而言,它在处理复杂的图文推理、逻辑分析任务时,表现会比原生的 27B 模型更加细腻。虽然参数量级处于中等水平,但在推理深度上有望实现跨级挑战。上手难度极低,由于采用了 Apache-2.0 开源协议,非常适合作为本地部署的逻辑增强型多模态助手,用来替代一些响应较慢的大型闭源模型。

image text to textapache-2.0
2.9K 星标查看详情

Qwen3.6-35B-A3B

Qwen
模型

Qwen3.6 35B A3B 是阿里 Qwen 团队推出的一款高性能多模态模型,主打图文理解与生成。它在保持 35B 参数量级带来的强大推理能力的同时,通过 A3B 架构优化了计算效率,使得在处理复杂视觉任务(如文档分析、图表解读)时响应更快。对于国内开发者而言,该模型在中文语境下的视觉识别精度极高,非常适合集成到自动化办公、智能客服或多模态 RAG 系统中。上手难度低,兼容主流推理框架,是寻找 GPT-4o 级别视觉能力且希望私有化部署的理想选择。

image text to textapache-2.0
2.9K 星标查看详情

Kimi-K2.5

moonshotai
模型

Kimi-K2.5 是由 Moonshot AI 推出的多模态理解模型,主打“图文理解”能力。不同于纯文本模型,它能像人类一样‘看图说话’,通过融合视觉与文本信息,实现对复杂图像内容的深度解析。对于开发者来说,它非常适合集成到需要处理文档扫描件、复杂图表分析或视觉问答的业务场景中。相比于传统的 OCR 工具,Kimi-K2.5 的优势在于不仅能‘认字’,更能‘理解’图片背后的逻辑关系。上手难度较低,在 Hugging Face 上即可直接调用或部署,是构建智能视觉助手、自动化数据提取流程的有力工具。

image text to textother
2.9K 星标查看详情

SigLIP SO400M

Google
400M

...

image text to textApache 2.0
2.8K 星标查看详情

Qwythos-9B-Claude-Mythos-5-1M-GGUF

empero-ai
模型

Qwythos-9B 是一款基于多模态架构的小参数量视觉语言模型,它将图像理解与文本生成能力结合在一起。该模型特别针对长文本处理进行了优化(支持高达 1M 的上下文窗口),这意味着你可以尝试让它“读完”一整本图文并茂的书,或者分析超长序列的视觉信息。虽然参数量仅为 9B,但通过 GGUF 格式的量化处理,它对个人开发者的硬件要求非常友好,即便在消费级显卡甚至部分高配笔记本上也能流畅运行。它非常适合用于复杂的图文问答、长文档视觉解析以及需要极高上下文容量的创意写作场景,是本地部署多模态应用的理想轻量化选择。

image text to textapache-2.0
2.8K 星标查看详情

GLM-5.3-Flash

zai-org
模型

GLM-5.3-Flash 是由 zai-org 推出的轻量化多模态模型,核心能力聚焦于“图文理解”到“文本输出”的转化。简单来说,它能像人类一样‘看图说话’,无论是识别图片中的复杂物体、解析图表数据,还是根据视觉信息进行逻辑推理,表现都相当稳健。得益于 Flash 系列的命名定位,该模型在推理速度和响应延迟上做了深度优化,非常适合集成到需要实时反馈的移动端应用或高频交互的聊天机器人中。对于开发者而言,它采用 MIT 开源协议,上手门槛极低,可以无缝接入现有的多模态工作流,是追求高性能与低成本平衡的理想选择。

image text to textmit
2.6K 星标查看详情

Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF

DavidAU
模型

这是一个基于 Qwen 系列进行深度微调的社区量化版本,采用了 GGUF 格式,旨在通过多种融合技术提升模型的逻辑推理与创意表达能力。该模型在保持 Qwen 强大中文底座能力的同时,通过特定数据集的优化,弱化了原厂过于死板的回复限制,使对话风格更自然、更具灵活性。对于开发者而言,由于其 GGUF 格式,可以非常方便地在本地通过 llama.cpp 或 Ollama 部署,无需昂贵的显卡即可在消费级硬件上运行,非常适合需要高度自定义对话风格的本地化 AI 应用场景。

image text to textapache-2.0
2.4K 星标查看详情

Qwen3.6-27B

Qwen
模型

Qwen3.6-27B 是阿里通义千问团队推出的一个平衡性能与规模的视觉语言模型。它采用了 image-text-to-text 架构,能够高效处理图文混合输入,在 OCR 文字识别、复杂图表分析以及视觉常识推理方面表现出色。对于开发者而言,27B 的参数量使其在保持强大理解能力的同时,对硬件显存的要求比超大模型更友好,非常适合部署在私有化服务器中作为企业级视觉助手或自动化数据提取工具。它不仅能接替传统的 OCR 插件,更能通过自然语言对话直接分析图像深层含义。

image text to textapache-2.0
2.3K 星标查看详情

Qwen3.5-9B

Qwen
模型

Qwen3.5 9B 是阿里通义千问家族的最新轻量化多模态模型。它在保持 9B 参数规模的同时,显著增强了对图像和文本的综合理解能力。对于中国开发者而言,该模型最大的优势在于其极高的推理能效比,能够轻松部署在消费级显卡上,同时在中文语境的视觉分析、文档解析和图表理解方面表现出色。它不是为了取代超大规模模型,而是为需要快速响应、低成本私有化部署的视觉助手或自动化办公场景提供了极佳的平衡点。

image text to textapache-2.0
2.1K 星标查看详情

gemma-3-27b-it

google
模型

Gemma 3-27b-it 是 Google 推出的新一代多模态轻量化模型,核心亮点在于其强大的‘图文理解’能力。它不再局限于纯文本对话,而是能像人类一样‘看图说话’,无论是解析复杂的图表、识别图片中的细节,还是根据图像内容进行逻辑推理,表现都非常出色。27B 的参数规模在性能与部署成本之间找到了极佳的平衡点:它比超大规模模型更轻快,比纯文本模型更聪明。对于开发者来说,如果你想在本地设备或中等算力的服务器上构建视觉问答、自动化图像标注或智能文档分析应用,它是目前市面上极具竞争力的开源首选。上手门槛低,与 Hugging Face 生态兼容性极佳。

image text to textgemma
2.0K 星标查看详情

Muse-Glimmer-30B

meta-models
模型

Muse-Glimmer-30B 是由 meta-models 团队推出的一款高性能多模态大模型,核心能力在于深度理解图像与文本的跨模态关联。不同于单纯的图像生成模型,它更擅长“看图说话”与“图文推理”,能够精准解析图像细节并结合上下文进行逻辑对话。对于开发者而言,30B 的参数规模在性能与部署成本之间取得了较好的平衡,既能胜任复杂的视觉问答(VQA)任务,也适合集成到需要视觉理解能力的智能助手或自动化内容审核场景中。由于采用了 Apache-2.0 开源协议,它对商业化应用非常友好,上手门槛适中,是构建下一代多模态应用的一个强力候选底座。

image text to textapache-2.0
2.0K 星标查看详情

ZDTaichu5.0-9B

TaichuAI
模型

ZDTaichu5.0-9B 是由 TaichuAI 开发的一款轻量化多模态大模型,专注于实现“图像-文本-文本”的高效转换。简单来说,它不仅能看懂图片,还能基于图片内容进行深度对话和逻辑推理。得益于 9B 的参数规模,它在保持较强理解能力的同时,对显存的要求相对亲民,非常适合开发者在消费级显卡上进行部署实验。无论是做自动化图像描述、复杂的视觉问答(VQA),还是辅助理解文档图表,它都能提供稳健的支持。对于习惯使用开源生态的开发者而言,这款模型可以作为 LLaVA 等主流多模态方案的有力补充,是构建垂直领域视觉助手的一个高性价比选择。

image text to textSee model card
1.9K 星标查看详情

Florence 2 Large

microsoft
模型

...

image text to textmit
1.9K 星标查看详情

Qwen3.8-27B-GSQ-RCO-GGUF

ISTA-DASLab
模型

这款由 ISTA-DASLab 发布的 Qwen3.8-27B-GSQ-RCO-GGUF 模型,是基于通义千问系列深度定制的多模态理解模型。它通过 GGUF 格式进行了量化优化,这意味着开发者可以在消费级显卡甚至内存较大的笔记本电脑上流畅运行,极大地降低了本地部署多模态大模型的门槛。该模型的核心能力在于强大的图文理解与推理,能够精准识别图像细节并结合上下文进行文本生成。无论是用于构建智能视觉助手、自动化图像标注,还是处理复杂的文档图表分析,它都能提供稳定且高质量的输出。对于习惯使用 llama.cpp 或 LM Studio 等工具的开发者来说,这种格式的模型几乎可以实现“开箱即用”,是目前平衡性能与硬件成本的优秀选择。

image text to textapache-2.0
1.8K 星标查看详情