全球 AI 聊天室 · 现在 16 人在线 进去聊聊
DIRECTORY / 02

AI 模型广场|开源大模型与 LLM 目录

开源大模型和多模态模型目录:看能力、参数规模、许可证、下载量和来源页,方便对比 Qwen、Llama 等怎么选、怎么部署。PromptCube 模型广场持续收录。

比较模型为你的下一个工作流找到合适的选择
目录概览
36
已收录条目
24 个主题分类持续更新
02 / MODEL INDEX

找到适合任务的模型

先看清楚,再做选择。每个条目都保留关键上下文。

精选目录36 个结果

Janus-Pro-7B

deepseek-ai
模型

Janus-Pro-7B 是由 DeepSeek 推出的多模态“全能型”模型,其核心亮点在于实现了真正的 Any-to-Any 能力。不同于传统的只能“看图说话”的模型,它能够处理图像与文本之间的双向转换,既能深度理解复杂的视觉信息,也能高质量地生成图像。对于开发者而言,7B 的参数量在性能与部署成本之间取得了极佳平衡,非常适合集成到需要视觉理解与生成能力的端侧应用或轻量化工作流中。无论你是想构建一个能读图写代码的助手,还是一个能通过文字精准绘图的智能体,Janus-Pro 都能提供比单一模态模型更丝滑的交互体验,是目前开源社区中极具潜力的多模态基座。

any to anymit
3.7K 星标查看详情

Qwen2.5-Omni-7B

Qwen
模型

通义千问团队推出的 Qwen2.5-Omni-7B 是一款极具潜力的全模态(Any-to-Any)模型。不同于以往只能处理单一文本或图像的架构,它实现了多种模态间的无缝转换。对于开发者而言,这意味着你可以用一段语音提问,让它理解图像内容,并以极具自然感的语音或文本进行回应。7B 的参数规模在保证了极强理解能力的同时,也兼顾了推理效率,非常适合部署在对响应速度有要求的端侧设备或个人工作站上。无论你是想开发智能语音助手,还是构建具备视觉感知能力的交互机器人,这款模型都提供了一个低门槛、高性能的统一底座。

any to anyother
2.0K 星标查看详情

gemma-4-12B-it

google
模型

作为 Google 推出的全新一代轻量化模型,gemma-4-12B-it 最大的亮点在于其强大的“全模态(Any-to-Any)”处理能力。不同于以往只能处理文本的轻量模型,它在 12B 这个极具性价比的参数规模下,实现了对多种输入形式的深度理解。对于开发者而言,这意味着你无需堆砌庞大的算力集群,就能在本地或边缘设备上构建出具备视觉、音频或文本多维感知能力的智能应用。它的上手门槛极低,完美兼容 Hugging Face 生态,是替代传统单一模态模型、开发多模态交互助手或自动化内容分析工具的理想选择。如果你正在寻找一个既能跑在消费级显卡上,又能处理复杂跨模态任务的开源底座,它绝对值得关注。

any to anyapache-2.0
1.6K 星标查看详情

gemma-4-E4B-it

google
模型

Gemma-4-E4B-it 是 Google 推出的新一代全模态(Any-to-Any)轻量化模型。与以往只能处理文本或单一模态的模型不同,它具备了跨模态的理解与生成能力,能够实现多种输入输出形式的无缝转换。对于开发者而言,这款模型最大的亮点在于其极高的灵活性与 Apache 2.0 开源协议带来的商用友好性。它非常适合集成到需要处理语音、图像或复杂指令的端侧设备或轻量化应用场景中。虽然参数量未公开,但从其定位来看,它在保证推理效率的同时,极大降低了多模态应用的开发门槛,是构建智能交互 Agent 的理想底座。

any to anyapache-2.0
1.6K 星标查看详情

MiniCPM-o-4_5

openbmb
模型

MiniCPM-o-4_5 是由 OpenBMB 推出的全能型“端到端”多模态模型。不同于以往只能处理单一输入的模型,它实现了真正的 Any-to-Any 能力,能够流畅地理解并生成文本、图像、音频等多种模态。对于开发者而言,它的核心优势在于极高的交互实时性,非常适合构建类似智能助手、实时视觉对话或语音交互等对响应速度要求极高的应用场景。虽然它在参数规模上追求轻量化,但在复杂指令遵循和跨模态理解上表现出色,上手门槛较低,是目前开源社区中极具竞争力的多模态交互基座。

any to anyapache-2.0
1.5K 星标查看详情

MiniCPM-o-2_6

openbmb
模型

MiniCPM-o-2_6 是由 OpenBMB 推出的全模态(Any-to-Any)端到端模型,它打破了传统模型只能处理单一输入的局限。简单来说,它不再是简单的“看图说话”,而是能像真人一样实时处理文本、图像、音频甚至视频流。对于开发者而言,这款模型最大的亮点在于其极高的端侧运行效率,非常适合集成到手机、机器人或智能硬件等资源受限的场景中。相比于动辄千亿参数的巨型模型,它在保持极强交互感和低延迟的同时,极大地降低了部署门槛,是构建下一代实时语音助手或多模态交互设备的理想基座。

any to anyapache-2.0
1.3K 星标查看详情

BAGEL-7B-MoT

ByteDance-Seed
模型

BAGEL-7B-MoT 是由字节跳动 Seed 团队推出的全模态(Any-to-Any)开源模型。不同于传统的仅限文本或图文理解的模型,它具备处理多种输入输出模态的能力,旨在打破不同媒介间的理解壁垒。对于开发者而言,7B 的参数规模在性能与部署成本之间取得了极佳的平衡,非常适合在消费级显卡上进行本地化微调或作为多模态 Agent 的核心大脑。无论你是想构建跨模态的智能助手,还是探索更复杂的音视频交互场景,BAGEL 都提供了一个极具潜力的底层框架,其 Apache-2.0 的开源协议也为商业化应用扫清了法律障碍。

any to anyapache-2.0
1.2K 星标查看详情

Lance

bytedance-research
模型

Lance 是由字节跳动研究团队推出的全模态(Any-to-Any)大模型。与目前主流的单模态或特定任务模型不同,Lance 的核心竞争力在于其强大的跨模态理解与生成能力,能够实现文本、图像、音频等多种信息流之间的无缝转换。对于开发者而言,这意味着你可以用它构建更复杂的交互应用,比如通过语音直接生成视觉描述,或者实现多维度的内容理解。该模型采用 Apache 2.0 开源协议,对商业化落地非常友好。虽然其具体的参数量尚未完全公开,但从其架构设计来看,它旨在打破模态间的壁垒,是探索下一代通用人工智能(AGI)交互方式的重要工具。

any to anyapache-2.0
1.1K 星标查看详情

Qwen3-Omni-30B-A3B-Instruct

Qwen
模型

Qwen3-Omni 系列是通义千问团队推出的全模态(Any-to-Any)大模型,这标志着模型能力从单纯的文本交互向全感官交互的跨越。该版本采用 30B 参数规模,通过混合专家架构(MoE)实现了极高的推理效率。它不仅能读懂文字,更能直接理解并生成音频、图像等多种模态,真正实现了“所见即所得、所听即所得”的交互体验。对于开发者而言,它非常适合构建实时语音助手、多模态内容创作工具或复杂的视觉问答系统。相比于传统的文本模型,它的上手门槛在于需要处理更丰富的输入流,但在处理跨模态逻辑推理时,其表现远超单一模态模型。

any to anyother
1.0K 星标查看详情

gemma-4-E2B-it

google
模型

gemma-4-E2B-it 是 Google 推出的新一代全模态(Any-to-Any)模型,它打破了传统 LLM 仅限于文本交互的局限。作为 Gemma 系列的进化版,该模型具备原生处理多种模态输入与输出的能力,这意味着你可以尝试用语音、图像甚至视频来驱动它,并获得相应的反馈。对于开发者而言,它最大的价值在于极高的集成灵活性,非常适合构建智能助手、多模态内容创作工具或复杂的交互式 AI 应用。相比于仅能“看图说话”的模型,E2B-it 追求的是更深层的模态融合。虽然由于其全模态特性,部署和调优的门槛比纯文本模型略高,但其 Apache-2.0 的开源协议为商业化落地提供了极佳的自由度。

any to anyapache-2.0
990 星标查看详情

gemma-4-12B

google
模型

作为 Google 推出的 Gemma 系列最新力作,gemma-4-12B 是一款极具竞争力的“全模态”模型。不同于以往只能处理文本的模型,它具备了强大的 Any-to-Any 能力,意味着它能打破单一模态的限制,在文本、图像甚至更复杂的跨模态任务中展现出极高的理解力。12B 的参数规模在性能与推理成本之间找到了一个绝佳的平衡点:它既不像超大规模模型那样难以部署,也不像轻量化模型那样容易“智商掉线”。对于开发者而言,它非常适合集成到需要多模态理解的智能助手、内容分析工具或自动化工作流中。由于采用了 Apache-2.0 开源协议,它的商用门槛极低,是构建定制化多模态应用的高性价比首选。

any to anyapache-2.0
756 星标查看详情

Janus-1.3B

deepseek-ai
模型

Janus-1.3B 是由 DeepSeek 推出的轻量化“全模态”模型,实现了真正的 Any-to-Any 能力。不同于传统只做视觉问答或纯文本生成的模型,它尝试在同一个架构下打通文本与图像的理解与生成。虽然 1.3B 的参数量不算大,但这意味着它对硬件极其友好,开发者甚至可以在消费级显卡或移动端设备上进行本地部署和微调。对于想要探索多模态交互、构建轻量化智能助手或进行图像/文本跨模态任务研究的开发者来说,Janus 提供了一个低门槛且高性能的实验基座,是研究多模态统一架构的一个极佳切入点。

any to anymit
601 星标查看详情

gemma-4-12B-it-qat-GGUF

unsloth
模型

gemma-4-12B-it-qat-GGUF 是由 Unsloth 团队基于 Google Gemma 4 系列优化的量化版本。这款模型最大的亮点在于其“全模态(Any-to-Any)”的潜力,能够处理多种输入形式。通过 QAT(量化感知训练)技术,它在大幅压缩参数体积、降低显存占用需求的同时,尽可能保留了原模型的逻辑推理与指令遵循能力。对于开发者而言,GGUF 格式意味着它能完美适配 llama.cpp 等主流推理框架,即便在消费级显卡甚至高性能 CPU 上也能流畅运行。如果你正在寻找一个既能处理复杂任务,又能在本地设备上低成本部署的轻量级多模态模型,它是一个非常理想的进阶选择。

any to anyapache-2.0
555 星标查看详情

Janus-Pro-1B

deepseek-ai
模型

Janus-Pro-1B 是由 DeepSeek 推出的轻量级“全模态”模型。不同于传统的单一功能模型,它具备了“Any-to-Any”的能力,这意味着它能打破文本、图像之间的界限,实现多模态的深度理解与生成。虽然 1B 的参数量在体量上属于“小钢炮”级别,但它非常适合集成在对延迟敏感、算力有限的端侧设备或移动应用中。对于开发者来说,它的上手门槛较低,且采用 MIT 开源协议,非常适合用来做多模态对话机器人、智能图像描述或轻量级的视觉理解任务。如果你正在寻找一种既能看懂图片又能生成内容的低成本方案,Janus-Pro-1B 是一个极具性价比的选择。

any to anymit
488 星标查看详情

gemma-4-E2B

google
模型

作为 Google 推出的新一代原生多模态模型,gemma-4-E2B 展现了极强的“全模态”处理潜力。不同于以往需要多个模型组合的架构,它在设计之初就具备了 any-to-any 的能力,能够实现跨模态的无缝理解与生成。对于开发者而言,这意味着你可以用一套 API 逻辑处理文本、图像甚至音频的复杂交互,极大降低了构建多模态应用时的工程复杂度。由于采用了 Apache-2.0 开源协议,它对商业化落地非常友好,非常适合集成到需要实时感官理解的智能助手、多媒体分析工具或自动化工作流中。上手门槛较低,在 Hugging Face 上即可快速部署测试。

any to anyapache-2.0
486 星标查看详情

OmniGen2

OmniGen2
模型

OmniGen2 是 Hugging Face 上备受关注的一款“全能型”Any-to-Any 模型。与传统的单一模态模型不同,它打破了文本、图像等不同数据格式之间的壁垒,能够实现多模态间的自由转换。对于开发者而言,这意味着你不再需要为文生图、图生文或图生图分别寻找不同的模型组合,OmniGen2 试图在一个统一的架构下解决这些复杂任务。虽然具体的参数量尚未完全公开,但其 Apache-2.0 的开源协议对商业化探索非常友好。上手难度方面,由于其高度集成的特性,开发者可以更简洁地构建多模态应用流,是构建下一代智能交互工具的理想底座。

any to anyapache-2.0
458 星标查看详情

gemma-4-E4B

google
模型

Gemma-4-E4B 是 Google 推出的新一代全模态(Any-to-Any)开源模型,彻底打破了传统语言模型仅限于文本输入的限制。它最核心的竞争力在于其强大的跨模态理解与生成能力,能够实现多种输入格式(如文本、图像、音频等)与输出之间的无缝转换。对于开发者而言,这款模型在保持轻量化部署优势的同时,提供了极高的交互灵活性,非常适合构建智能语音助手、多模态内容创作工具或复杂的视觉问答系统。由于采用了 Apache-2.0 开源协议,它在商用集成和二次开发方面非常友好,是开发者从单一模态向全模态 AI 应用转型的重要基石。

any to anyapache-2.0
437 星标查看详情

Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16

nvidia
模型

这款由 NVIDIA 推出的 Nemotron-3-Nano-Omni 系列模型,是针对多模态(Any-to-Any)交互场景深度优化的推理增强版。它不仅具备强大的文本逻辑推理能力,更在处理跨模态信息流时展现出极高的灵活性。对于开发者而言,这款模型在保持 30B 级别参数规模的同时,通过架构优化实现了极高的推理效率,非常适合集成到需要处理复杂指令、多模态输入或高逻辑要求的工作流中。相比于传统的纯文本模型,它更像是一个全能的数字大脑,上手门槛适中,是构建下一代多模态智能应用、复杂逻辑 Agent 或多任务处理系统的理想基座。

any to anyother
434 星标查看详情

Chroma-4B

FlashLabs
模型

Chroma-4B 是由 FlashLabs 推出的轻量级全模态(Any-to-Any)模型。不同于传统的单一输入模型,它打破了模态间的壁垒,旨在实现文本、图像等多种媒介之间的自由转换。4B 的参数规模意味着它对硬件非常友好,开发者甚至可以在消费级显卡或边缘设备上进行部署尝试。对于追求低延迟、高交互性的多模态应用场景(如智能助手、创意内容生成工具)来说,这是一个极具潜力的开源底座。相比于动辄数百亿参数的巨型模型,Chroma-4B 的上手门槛更低,更适合作为原型开发或特定垂直领域的微调基石。

any to anyapache-2.0
388 星标查看详情

Qwen2.5-Omni-3B

Qwen
模型

通义千问团队推出的 Qwen2.5-Omni-3B 是一款极具潜力的全模态(Any-to-Any)端到端模型。不同于传统的‘视觉/语音转文字再处理’的流水线模式,它实现了音视频与文本在同一模型内的原生交互。虽然 3B 的参数量并不算庞大,但其轻量化的特性使其非常适合部署在端侧设备或个人电脑上,实现低延迟的实时语音对话或多模态理解。对于开发者而言,它不仅降低了构建智能助理的门槛,还为实现类似 GPT-4o 的自然交互体验提供了一个高性能、低成本的国产开源方案,是探索端侧多模态交互的重要基石。

any to anyother
358 星标查看详情

gemma-4-31B-it-assistant

google
模型

Gemma 4-31B-it-assistant 是 Google 推出的新一代高性能指令微调模型。不同于传统的纯文本模型,它具备强大的‘Any-to-Any’多模态处理能力,这意味着它能更自然地理解和处理跨模态的信息流。31B 的参数规模在性能与推理成本之间找到了极佳的平衡点:它既拥有足以应对复杂逻辑推理、长文本分析的深度,又不像超大规模模型那样难以部署,非常适合开发者将其集成到需要多模态理解的本地应用或私有化部署场景中。对于习惯使用 GPT-4 或 Claude 的用户来说,它是开源社区中极具竞争力的替代方案,上手门槛低,且遵循 Apache 2.0 开源协议,对商业开发非常友好。

any to anyapache-2.0
325 星标查看详情

Qwen3-Omni-30B-A3B-Thinking

Qwen
模型

Qwen3-Omni-30B-A3B-Thinking 是通义千问团队推出的新一代全模态(Any-to-Any)模型。与传统只能处理文本的模型不同,它具备了强大的多模态感知与交互能力,能够实现音视频、图像与文本之间的无缝流转。最值得关注的是其集成的“Thinking”推理机制,这意味着它在处理复杂逻辑问题时,不再是简单的概率预测,而是会像人类一样进行深度思考和自我修正。对于开发者而言,它非常适合构建实时语音助手、智能视觉分析系统或复杂的逻辑推理 Agent。虽然全模态架构对算力有一定要求,但凭借其高效的混合专家架构(MoE)设计,在性能与推理成本之间取得了很好的平衡,是进阶 AI 应用开发者的理想选择。

any to anyother
323 星标查看详情

gemma-4-12B-it-qat-q4_0-gguf

google
模型

这款模型是 Google 推出的 Gemma 4 系列中的中量级选手,采用了 12B 参数规模并经过了 QAT(量化感知训练)优化。对于开发者来说,它最大的亮点在于‘全模态’的潜力,能够处理从文本到图像甚至音频的跨模态任务。由于采用了 GGUF 格式并进行了 Q4_0 量化,它非常适合在消费级显卡或内存较大的笔记本电脑上通过 llama.cpp 等工具进行本地部署。相比于动辄百亿参数的大模型,它在保持极高逻辑推理能力的同时,显著降低了显存占用。如果你想在本地构建一个既能读图、又能对话,且响应速度极快的个人 AI 助手,它是目前性价比极高的选择。

any to anyapache-2.0
312 星标查看详情

SenseNova-U1-8B-MoT

sensenova
模型

SenseNova-U1-8B-MoT 是由商量(SenseNova)团队推出的高性能“全模态”(Any-to-Any)轻量化模型。不同于传统的单一文本模型,它打破了模态间的壁垒,能够处理多种输入并生成相应的输出,展现了极强的跨模态理解力。尽管参数规模维持在 8B 级别,非常适合开发者在资源有限的本地环境或边缘侧进行部署,但其在复杂任务上的表现却相当惊艳。如果你正在寻找一种能够低成本实现语音、图像与文本混合交互的方案,或者想在现有工作流中集成更灵活的多模态能力,这款模型是一个非常值得尝试的开源选择,上手难度适中,对开发者极其友好。

any to anyapache-2.0
290 星标查看详情