全球 AI 聊天室 · 现在 18 人在线 进去聊聊
DIRECTORY / 02

AI 模型广场|开源大模型与 LLM 目录

开源大模型和多模态模型目录:看能力、参数规模、许可证、下载量和来源页,方便对比 Qwen、Llama 等怎么选、怎么部署。PromptCube 模型广场持续收录。

比较模型为你的下一个工作流找到合适的选择
目录概览
839
已收录条目
24 个主题分类持续更新
02 / MODEL INDEX

找到适合任务的模型

先看清楚,再做选择。每个条目都保留关键上下文。

精选目录839 个结果

gemma-4-12B-it-qat-q4_0-gguf

google
模型

这款模型是 Google 推出的 Gemma 4 系列中的中量级选手,采用了 12B 参数规模并经过了 QAT(量化感知训练)优化。对于开发者来说,它最大的亮点在于‘全模态’的潜力,能够处理从文本到图像甚至音频的跨模态任务。由于采用了 GGUF 格式并进行了 Q4_0 量化,它非常适合在消费级显卡或内存较大的笔记本电脑上通过 llama.cpp 等工具进行本地部署。相比于动辄百亿参数的大模型,它在保持极高逻辑推理能力的同时,显著降低了显存占用。如果你想在本地构建一个既能读图、又能对话,且响应速度极快的个人 AI 助手,它是目前性价比极高的选择。

any to anyapache-2.0
312 星标查看详情

SenseNova-U1-8B-MoT

sensenova
模型

SenseNova-U1-8B-MoT 是由商量(SenseNova)团队推出的高性能“全模态”(Any-to-Any)轻量化模型。不同于传统的单一文本模型,它打破了模态间的壁垒,能够处理多种输入并生成相应的输出,展现了极强的跨模态理解力。尽管参数规模维持在 8B 级别,非常适合开发者在资源有限的本地环境或边缘侧进行部署,但其在复杂任务上的表现却相当惊艳。如果你正在寻找一种能够低成本实现语音、图像与文本混合交互的方案,或者想在现有工作流中集成更灵活的多模态能力,这款模型是一个非常值得尝试的开源选择,上手难度适中,对开发者极其友好。

any to anyapache-2.0
290 星标查看详情

Qwen3 Embedding 8B

Qwen
模型

Qwen3 Embedding 8B 是阿里巴巴通义千问团队推出的新一代文本向量化模型。与传统的轻量级 Embedding 模型不同,它采用了 8B 的大参数量规模,旨在通过更强的语义理解能力,将复杂的文本精准地转化为高维向量。对于开发者而言,它最核心的价值在于显著提升 RAG(检索增强生成)系统的召回质量,尤其在处理长文本、专业领域知识或复杂查询时,能有效减少语义漂移。该模型上手门槛低,兼容主流向量数据库,是构建高性能企业级知识库的理想底层组件。

feature-extractionapache-2.0
278 星标查看详情

twitter-xlm-roberta-base-sentiment

cardiffnlp
Not specified

这是一个由 CardiffNLP 团队基于 XLM-RoBERTa 预训练的轻量级多语言情感分析模型。它专门针对社交媒体文本进行了优化,能够识别文本中的正向、负向或中性情绪。对于国内开发者而言,该模型最大的价值在于其跨语言能力,无需为每种语言单独部署模型,即可快速处理包括中文在内的多种语言社交数据。由于其 Base 规模,部署成本低,推理速度快,非常适合集成到舆情监控、用户反馈分析等实际业务场景中,是替代复杂 NLP 管道的高效方案。

text classificationSee model card
277 星标查看详情

LensVLM-9B

apple
模型

LensVLM-9B 是由 Apple 开发的一款轻量化多模态大模型,专注于实现高质量的图像到文本理解。相比于动辄几十亿参数的巨型模型,这颗 9B 参数规模的“小钢炮”在端侧部署和推理效率上展现了极佳的平衡感。它能够精准捕捉图像细节并结合文本指令进行复杂的逻辑推理,非常适合集成到需要实时视觉反馈的应用场景中,比如智能助手、自动化图像标注或移动端的视觉问答。对于开发者而言,它在 Hugging Face 上开源,上手门槛适中,是研究多模态轻量化方案或构建低延迟视觉 AI 应用的理想底座。

image text to textapple-amlr
265 星标查看详情

Realistic_Vision_V5.1_noVAE

SG161222
Not specified

Realistic Vision V5.1 是一款在 Stable Diffusion 社区极具口碑的写实风微调模型。它专注于消除 AI 绘画常见的“塑料感”,在皮肤纹理、光影过渡和真实场景还原上表现出色,非常适合需要出高质量人像摄影、产品实拍图的开发者和创作者。由于该版本标注为 noVAE,用户在部署时需自行加载合适的 VAE 文件以确保色彩正常且无灰边。对于习惯使用 WebUI 或 ComfyUI 的用户来说,该模型上手门槛低,且能通过简单的提示词实现电影级的写实效果。

text to imagecreativeml-openrail-m
263 星标查看详情

Z-Image-Turbo-GGUF

unsloth
Not specified

Z-Image-Turbo-GGUF 是由 Unsloth 团队推出的文本生成图像模型,采用 GGUF 量化格式发布。对于开发者而言,这款模型最大的价值在于其对内存效率的极致优化,非常适合在显存有限的个人电脑或边缘设备上本地运行。相比于动辄占用巨大显存的原始权重,GGUF 版本显著降低了硬件门槛,让你能在普通的消费级显卡甚至高性能 CPU 上体验快速的生图过程。它主要面向需要低延迟、轻量化部署的 AI 绘画场景,如果你正在寻找一种既能保证生成质量,又能在本地环境顺畅跑起来的生图方案,这款模型是一个非常务实的选择。

text to imageapache-2.0
263 星标查看详情

needle3

Cactus-Compute
模型

needle3 是由 Cactus-Compute 开发的一款专注于文本生成任务的开源模型,托管于 Hugging Face 社区。虽然其具体的参数规模尚未完全公开,但从其定位来看,它更倾向于轻量化且高效的生成逻辑。对于开发者而言,该模型采用 Apache-2.0 开源协议,这意味着你可以非常自由地将其集成到自己的商业项目或研究工作流中,而无需担心版权限制。相比于动辄千亿参数的巨型模型,needle3 更适合作为特定垂直场景下的微调基座,或者用于对推理延迟有较高要求的轻量级应用场景。如果你正在寻找一个上手门槛低、部署灵活且具备良好社区支持的文本生成工具,needle3 是一个值得关注的备选方案。

text generationapache-2.0
263 星标查看详情

SenseNova-U1.5-8B-MoT

sensenova
模型

SenseNova-U1.5-8B-MoT 是来自商量(SenseNova)系列的一款轻量化“全模态”模型。与传统的只能处理文本或单一模态的模型不同,它主打 Any-to-Any 的能力,意味着它在处理跨模态信息转换时展现出了极高的灵活性。虽然参数规模在 8B 级别,非常适合开发者在显存有限的个人设备或边缘计算端进行部署,但其多模态理解与生成的协同能力不容小觑。对于想要构建智能语音助手、视觉对话机器人或多模态交互应用的开发者来说,这是一个上手门槛低、性价比极高的开源底座,能够无缝集成到现有的 AI 工作流中。

any to anyapache-2.0
261 星标查看详情

LightOnOCR-1B-1025

lightonai
Not specified

LightOnOCR-1B-1025 是 LightOn 开源的轻量级视觉语言模型,主打图文识别与理解,参数量 1B 级别,部署门槛低,适合在消费级显存或边缘设备上跑通推理。模型基于 Apache-2.0 协议发布,商用友好,配合 Hugging Face Transformers 库几行代码即可接入,适配 `AutoModelForCausalLM` 与 `AutoProcessor` 标准流程。典型场景包括单据结构化、表格/表单抽取、中英混排文档数字化等,对版面复杂、字号较小的中文场景有一定鲁棒性。受限于参数量,长文档推理、复杂推理链条表现不如 7B 以上大模型,建议作为 OCR 后处理或轻量端侧落地的首选基座,配合规则引擎或 RAG 做二次清洗效果更佳。

image to textapache-2.0
256 星标查看详情

Qwen3-Omni-30B-A3B-Captioner

Qwen
模型

Qwen3-Omni-30B-A3B-Captioner 是通义千问团队推出的新一代多模态理解模型,专注于极高精度的视频与图像描述任务。不同于传统的单一模态模型,它具备强大的“全向(Any-to-Any)”理解潜力,能够将复杂的视觉信息转化为细腻、逻辑严密的文本描述。对于开发者而言,它的核心价值在于解决多模态数据标注的痛点,无论是长视频的剧情拆解,还是复杂图像的细节刻画,它都能提供接近人类感知的语义输出。虽然 30B 的参数量对显存有一定要求,但其在指令遵循和场景感知上的表现,使其成为构建自动化视频剪辑、智能视觉搜索或辅助视障人士应用时的理想底层引擎。

any to anyother
248 星标查看详情

bge-reranker-base

BAAI
Not specified

bge-reranker-base 是由北京智源人工智能研究院(BAAI)推出的轻量级重排序模型。在 RAG(检索增强生成)流程中,它通常接在向量检索之后,用于对初筛出的文档进行精准的二次打分,有效解决向量检索在处理长文本或复杂语义时容易出现的“召回不准”问题。该模型上手简单,可通过 HuggingFace 或本地部署快速集成,是提升知识库问答准确率、减少 LLM 幻觉的性价比之选。

text classificationmit
246 星标查看详情

Qwen Image Edit 2509

Qwen
模型

Qwen Image Edit 2509 是阿里通义千问团队推出的图像编辑模型,主打精准的指令驱动修改。与传统的 AI 绘图不同,它更像是一个懂指令的“智能修图师”,用户无需复杂的 Prompt 工程,直接用自然语言描述修改需求(如“把背景换成海滩”或“给人物加一副眼镜”),模型即可在保持原图主体一致性的前提下完成局部调整。对于开发者而言,其 Apache-2.0 协议极大降低了商用门槛,非常适合集成到电商修图、社交 App 滤镜或自动化设计工作流中,上手难度极低。

image-to-imageapache-2.0
246 星标查看详情

voice-activity-detection

pyannote
Not specified

pyannote 的 VAD(语音活动检测)是一个专注于从音频流中精准剔除静音和背景噪音、仅保留人声片段的轻量级工具。对于开发者来说,它不是一个完整的语音转文字模型,而是 ASR(语音识别)流程中的关键预处理步骤。通过在进入大模型识别前先过滤掉无意义的空白段,能显著降低 API 调用成本并提升识别效率。该模型上手简单,支持 MIT 开源协议,非常适合集成到会议记录、智能客服等需要实时监测说话状态的本地化场景中。

automatic speech recognitionmit
241 星标查看详情

Agnes-3.0-Flash

Agnes-AI
模型

Agnes-3.0-Flash 是由 Agnes-AI 开发的一款轻量化多模态大模型,主打“图文理解”到“文本生成”的任务流。不同于追求参数规模的巨型模型,Flash 版本更侧重于推理效率与响应速度,非常适合需要快速处理视觉信息并进行对话的场景。开发者可以利用它实现自动化图像描述、文档内容提取或基于视觉上下文的问答。由于采用了 Apache-2.0 开源协议,它对商业化应用非常友好,上手门槛较低,能够无缝集成到现有的视觉工作流或轻量级 AI 应用中,是追求性价比和部署灵活性的开发者值得关注的选择。

image text to textapache-2.0
239 星标查看详情

RealVisXL_V5.0

SG161222
Not specified

RealVisXL V5.0 是一款基于 SDXL 架构微调的高质量写实类图像生成模型。它专注于解决 AI 绘图中常见的“塑料感”问题,通过优化皮肤纹理、光影细节和真实比例,能产出极具摄影感的照片级图像。对于习惯使用 Stable Diffusion 的开发者或设计师来说,该模型上手门槛低,无需复杂的提示词堆砌即可获得自然的人像和场景效果,是目前替代通用模型、追求极致写实视觉表达的理想选择。

text to imageopenrail++
230 星标查看详情

whisperkit-coreml

argmaxinc
Not specified

WhisperKit CoreML 是将 OpenAI 的 Whisper 语音识别模型针对苹果生态深度优化的版本。它通过 Core ML 框架,让模型能高效调用 iPhone、iPad 和 Mac 的 NPU(神经网络引擎),在保证识别精度几乎不打折的前提下,大幅降低了端侧运行的功耗并提升了推理速度。对于开发者来说,它解决了原版模型在 iOS/macOS 上部署时内存占用高、发热严重的问题,非常适合构建需要离线语音转文字、实时字幕或隐私敏感的本地 AI 应用,上手门槛较低,可直接集成到 Swift 项目中。

automatic speech recognitionmit
228 星标查看详情

finbert-tone

yiyanghkust
Not specified

FinBERT-Tone 是一款专门针对金融领域文本情感分析的轻量级分类模型。不同于通用模型,它能精准识别金融语境下的“看涨”或“看跌”情绪,有效解决金融术语在通用语境中含义偏移的问题。该模型上手门槛极低,非常适合开发者集成到量化分析流水线、财报自动化分析或股市舆情监控系统中。如果你需要从海量金融新闻或公告中快速提取情绪指标,它是比通用 LLM 更高效、更专注的垂直方案。

text classificationSee model card
223 星标查看详情

K2-Horizon-7B

IFM
7b

K2-Horizon-7B 是由 IFM 开发的一款基于 7B 参数规模的文本生成模型。在当前大模型卷参数量的趋势下,这款模型走的是“轻量化、高效率”的路线。它非常适合对推理成本敏感、且需要在消费级显卡或边缘设备上本地部署的开发者。相比于动辄百亿参数的巨兽,Horizon-7B 在处理日常文本创作、逻辑问答以及基础指令遵循方面表现得足够稳健。如果你正在寻找一个能够无缝集成到个人工作流、或作为端侧 AI 应用底座的开源模型,它的 Apache-2.0 协议也为商业化落地提供了极大的便利。上手难度较低,配合主流的推理框架(如 llama.cpp 或 vLLM)即可快速跑通。

text generationapache-2.0
222 星标查看详情

trocr-base-printed

microsoft
Not specified

TrOCR base printed 是由微软推出的端到端光学字符识别(OCR)模型。与传统 OCR 先检测文本行再识别字符的方案不同,它采用了 Transformer 架构,直接将图像特征转换为文本序列,能够更自然地处理打印体文字。该模型在处理清晰的文档扫描件、数字化表单时表现稳健,且由于采用了开源的 Apache-2.0 协议,开发者可以非常方便地将其集成到自己的本地化工作流中。对于习惯使用 Tesseract 或 PaddleOCR 的用户来说,TrOCR 提供了另一种基于深度学习的替代方案,尤其在识别精度和上下文理解上具有优势。

image to textSee model card
220 星标查看详情

VoxCPM2

openbmb
模型

VoxCPM2 是由 OpenBMB 推出的开源文本转语音(TTS)模型,旨在提供更自然、更具情感表现力的语音合成体验。不同于传统的机械合成音,它在语调起伏和自然度上做了深度优化,能够较好地还原人类说话的节奏感。对于开发者而言,该模型采用 Apache-2.0 协议,部署门槛较低,非常适合集成到智能助手、有声书制作或游戏 NPC 对话等需要高质量语音输出的场景中,是目前国产开源 TTS 方案中一个极具竞争力的选择。

text-to-speechapache-2.0
214 星标查看详情

OrcaSAQ-2-27B

orcarouter
模型

OrcaSAQ-2-27B 是由 orcarouter 团队推出的高性能文本生成模型。虽然官方未详细披露参数细节,但从其 27B 的规模来看,它在逻辑推理与长文本处理能力上表现均衡,试图在轻量化部署与复杂指令遵循之间寻找最佳平衡点。对于开发者而言,该模型采用 Apache-2.0 开源协议,商业化门槛极低,非常适合作为本地知识库问答、自动化内容创作或垂直领域 Agent 的底层大脑。相比于动辄千亿参数的巨型模型,它的上手难度更低,对显存的要求也更为友好,是追求性价比和私有化部署场景下的一个有力竞争者。

text generationapache-2.0
210 星标查看详情

gemma-4-E4B-it-qat-GGUF

unsloth
模型

这款由 Unsloth 团队优化的 Gemma-4 系列模型,采用了 GGUF 量化格式,是追求极致推理效率开发者的福音。作为一款具备 Any-to-Any 能力的轻量化模型,它不仅能处理文本,更在多模态理解上展现了极高的性价比。通过 QAT(量化感知训练)技术,模型在大幅压缩体积、降低显存占用的同时,尽可能保留了原始模型的逻辑推理能力。对于想要在个人电脑、移动端或低成本服务器上部署本地 AI 助手、构建多模态 RAG 应用的开发者来说,它是目前非常平衡的选择。上手难度低,配合 llama.cpp 等主流工具即可实现流畅的本地化运行。

any to anyapache-2.0
207 星标查看详情

gemma-4-E4B-it-ultra-uncensored-heretic-GGUF

llmfan46
模型

这款模型基于 Google 的 Gemma 4 架构进行了深度定制,通过 GGUF 格式封装,非常适合在个人电脑或边缘设备上利用 llama.cpp 等工具进行本地部署。它在原生模型的基础上,针对指令遵循能力和响应的自由度进行了强化,旨在打破常规对话中的过度约束。对于开发者而言,它不仅是一个高性能的文本处理工具,更是一个具备“全能型”潜力的实验平台。由于采用了量化技术,它在保持逻辑推理能力的同时,极大地降低了显存占用,即使是配置一般的消费级显卡或 Mac 用户,也能流畅体验到这种高响应速度的本地 AI 助手。

any to anyapache-2.0
204 星标查看详情