全球 AI 聊天室 · 现在 17 人在线 进去聊聊
DIRECTORY / 02

AI 模型广场|开源大模型与 LLM 目录

开源大模型和多模态模型目录:看能力、参数规模、许可证、下载量和来源页,方便对比 Qwen、Llama 等怎么选、怎么部署。PromptCube 模型广场持续收录。

比较模型为你的下一个工作流找到合适的选择
目录概览
839
已收录条目
24 个主题分类持续更新
02 / MODEL INDEX

找到适合任务的模型

先看清楚,再做选择。每个条目都保留关键上下文。

精选目录839 个结果

FLUX.1-dev-gguf

city96
Not specified

FLUX.1-dev-gguf 是由 city96 社区大佬对顶尖图像生成模型 FLUX.1-dev 进行量化后的版本。简单来说,它解决了原版模型对显存要求过高的“痛点”。通过引入 GGUF 这种高效的量化格式,开发者可以在家用显卡甚至配置稍低的电脑上,流畅运行原本只能在专业工作站上跑的高质量文生图任务。如果你追求极致的画面细节、精准的语义理解(尤其是文字渲染能力),但又不想折腾昂贵的硬件,这个版本是目前本地部署的最佳平衡点。它完美适配 ComfyUI 等主流工作流,上手门槛较低,是追求性价比的 AI 绘画玩家必试的进阶工具。

text to imageother
1.4K 星标查看详情

paraphrase-multilingual-MiniLM-L12-v2

sentence-transformers
Not specified

这是一个轻量级且高效的多语言文本向量化模型,专门用于将句子转换为高维向量,从而计算文本间的语义相似度。相比于体积庞大的 LLM,它在资源占用极低的情况下,能快速处理包括中文在内的多种语言。对于开发者而言,它是构建 RAG(检索增强生成)系统中向量检索环节的理想选择,尤其适合部署在端侧或对响应延迟要求极高的生产环境。上手难度低,可直接通过 sentence-transformers 库调用,是替代昂贵 API 接口的优秀开源方案。

sentence similarityapache-2.0
1.4K 星标查看详情

Ternary-Bonsai-27B-gguf

prism-ml
模型

Ternary-Bonsai-27B-gguf 是 prism-ml 团队发布的一款面向文本生成任务的大语言模型,采用 GGUF 格式量化,方便在本地或边缘设备上部署推理。该模型通过三元权值压缩技术,在降低存储体积和计算开销的前提下,尽可能保留原始模型的性能表现。对于普通开发者而言,它无需依赖昂贵的 GPU 即可在消费级硬件上运行,特别适合用于离线问答、文本摘要、代码补全等场景。需要注意的是,由于量化和三元化处理,生成文本的细节丰富度可能略有下降,更适合对速度与资源优先考虑的应用。上手门槛较低,只需下载 GGUF 文件并结合常见的 llama.cpp 等推理工具即可开始使用,社区和文档支持也较为完善。

text generationapache-2.0
1.4K 星标查看详情

all-mpnet-base-v2

sentence-transformers
Not specified

all-mpnet-base-v2 是一款在语义相似度任务上表现极佳的轻量级文本向量化模型。它基于 MPNet 架构,通过大规模句子对预训练,能够将文本精准地映射为高维向量。对于中国开发者而言,它是构建 RAG(检索增强生成)系统、语义搜索或文档聚类时的理想选择。相比于调用昂贵的闭源 Embedding API,该模型支持本地部署,推理速度快且隐私性高,上手难度低,可直接通过 sentence-transformers 库快速集成到现有工作流中。

sentence similarityapache-2.0
1.4K 星标查看详情

Qwen3.8-27B-Uncensored-GGUF

JonathanColetti
模型

这款模型是基于通义千问(Qwen)系列架构进行微调的衍生版本,通过移除内置的安全对齐限制,实现了更具“自由度”的内容生成能力。它采用了 GGUF 量化格式,这意味着开发者和爱好者可以利用 llama.cpp 等工具,在消费级显卡甚至高性能笔记本上实现本地化部署。相比于原版 Qwen,它在处理一些敏感话题或不受限的创意写作时,表现得更加直接,不会频繁触发拒绝回答的机制。对于追求极致创作自由、需要进行角色扮演(Roleplay)或进行特定领域压力测试的开发者来说,这是一个非常实用的本地化实验工具。上手难度较低,只要有足够的显存空间,通过 LM Studio 或 Ollama 即可快速跑起来。

text generationapache-2.0
1.3K 星标查看详情

Spark-X2.5-4B

XHToken
模型

Spark-X2.5-4B 是由 XHToken 推出的轻量化文本生成模型,采用了 4B(40 亿)参数规模。对于追求端侧部署或低算力环境的开发者来说,这是一个非常平衡的选择。它在保持较小体积的同时,针对文本生成任务进行了优化,能够胜任日常的对话、摘要提取及逻辑写作等任务。相比于动辄百亿参数的大模型,Spark-X2.5-4B 的上手门槛极低,单张消费级显卡甚至部分高性能移动设备即可流畅运行。如果你正在寻找一个可以快速集成到本地应用、且对响应速度有较高要求的开源底座,它是一个值得尝试的轻量级替代方案。

text generationapache-2.0
1.3K 星标查看详情

MiniCPM-o-2_6

openbmb
模型

MiniCPM-o-2_6 是由 OpenBMB 推出的全模态(Any-to-Any)端到端模型,它打破了传统模型只能处理单一输入的局限。简单来说,它不再是简单的“看图说话”,而是能像真人一样实时处理文本、图像、音频甚至视频流。对于开发者而言,这款模型最大的亮点在于其极高的端侧运行效率,非常适合集成到手机、机器人或智能硬件等资源受限的场景中。相比于动辄千亿参数的巨型模型,它在保持极强交互感和低延迟的同时,极大地降低了部署门槛,是构建下一代实时语音助手或多模态交互设备的理想基座。

any to anyapache-2.0
1.3K 星标查看详情

Qwen3.8-27B-OBLITERATED

OBLITERATUS
模型

Qwen3.8-27B-OBLITERATED 是基于通义千问架构进行深度微调的文本生成模型。虽然它并非官方发布的标准版,但从其极高的下载量和社区关注度来看,该模型在指令遵循和特定文本风格化方面表现出了极强的生命力。27B 的参数规模是一个非常巧妙的平衡点:它既保留了超越小型模型(如 7B/14B)的逻辑推理深度,又不像超大规模模型那样对显存极其苛刻,非常适合部署在消费级显卡或高性能工作站上。对于追求模型响应速度与生成质量平衡的开发者来说,这是一个非常值得尝试的进阶选择,尤其在处理复杂文本创作或特定任务微调时,能提供比通用版更具个性的输出效果。

text generationapache-2.0
1.3K 星标查看详情

stable-diffusion-v1-5

stable-diffusion-v1-5
Not specified

Stable Diffusion v1.5 是目前 AI 绘画社区生态最繁荣的经典模型。虽然它不是最新的版本,但凭借极低的硬件门槛和开放的权重,成为了无数开发者和创作者的首选。它最大的优势在于极强的可塑性,用户可以通过加载海量的 LoRA 微调模型或 ControlNet 插件,精准控制人物姿态、画风和细节。对于习惯使用 WebUI 或 ComfyUI 的用户来说,v1.5 是一个极其稳定且灵活的底模,非常适合需要高度自定义图像生成流程的场景。

text to imagecreativeml-openrail-m
1.3K 星标查看详情

Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NEO-CODER-MAX-MTP-GGUF

DavidAU
模型

这款模型是基于 Qwen 系列架构深度定制的多模态版本,由开发者 DavidAU 通过复杂的微调技术整合而成。它不仅继承了通义千问强大的中文语境理解能力,更在视觉理解与代码生成(NEO-CODER)方面进行了专项强化。简单来说,它是一个能够“看图说话”并能处理复杂编程逻辑的复合型工具。由于采用了 GGUF 格式,它对硬件非常友好,普通开发者利用 llama.cpp 等工具即可在消费级显卡甚至大内存 Mac 上流畅运行。虽然其命名包含大量实验性后缀,暗示了其在逻辑推理和指令遵循上的激进优化,但最适合的场景是需要高强度代码辅助或复杂图文综合分析的任务,上手门槛较低,是本地化部署多模态应用的理想选择。

image text to textapache-2.0
1.3K 星标查看详情

finbert

ProsusAI
Not specified

FinBERT 是一个专门针对金融领域微调的自然语言处理模型,基于 BERT 架构并使用了大规模金融语料库进行训练。与通用模型不同,它能精准识别金融文本中特有的语义倾向(例如“利率上升”在不同语境下的利好或利空),极大地解决了通用模型在处理专业财报、新闻时容易产生的误判。对于量化交易者或金融分析师来说,它是一个低门槛且高效的文本分类工具,可以直接集成到数据流水线中,将非结构化的金融资讯转化为可量化的情感指标。

text classificationSee model card
1.2K 星标查看详情

BAGEL-7B-MoT

ByteDance-Seed
模型

BAGEL-7B-MoT 是由字节跳动 Seed 团队推出的全模态(Any-to-Any)开源模型。不同于传统的仅限文本或图文理解的模型,它具备处理多种输入输出模态的能力,旨在打破不同媒介间的理解壁垒。对于开发者而言,7B 的参数规模在性能与部署成本之间取得了极佳的平衡,非常适合在消费级显卡上进行本地化微调或作为多模态 Agent 的核心大脑。无论你是想构建跨模态的智能助手,还是探索更复杂的音视频交互场景,BAGEL 都提供了一个极具潜力的底层框架,其 Apache-2.0 的开源协议也为商业化应用扫清了法律障碍。

any to anyapache-2.0
1.2K 星标查看详情

bge-reranker-v2-m3

BAAI
Not specified

BGE Reranker v2 M3 是由北京智源人工智能研究院(BAAI)推出的高性能重排序模型。在 RAG(检索增强生成)工作流中,它扮演着“精筛”的角色:先由向量模型快速召回候选文档,再由它对结果进行深度语义打分,剔除无关干扰项。该模型最大的特点是支持多语言且具备极强的泛化能力,能显著提升知识库问答的准确率。对于开发者而言,它属于典型的插件式组件,部署简单,是优化搜索质量、解决 LLM 幻觉问题的关键环节。

text classificationapache-2.0
1.2K 星标查看详情

Qwen3.8-27B-Uncensored-GGUF

orcarouter
模型

这款模型基于通义千问 Qwen 系列进行微调,通过移除内置的安全限制(Uncensored),为开发者提供了更具自由度的交互体验。它不仅继承了 Qwen 强大的中文理解与逻辑推理能力,还特别强化了在不受约束场景下的内容生成表现。由于采用了 GGUF 量化格式,它对硬件非常友好,即使是消费级显卡或内存较大的笔记本电脑,也能通过 llama.cpp 等主流工具实现流畅的本地部署。无论你是想进行更深度的角色扮演、不受限的创意写作,还是需要一个在处理敏感话题时不会频繁“拒绝回答”的辅助工具,这款模型都是目前平衡性能与自由度的极佳选择。

image text to textapache-2.0
1.2K 星标查看详情

gemma-3-1b-it

google
Not specified

gemma-3-1b-it 是 Google 推出的轻量化文本生成模型,属于 Gemma 系列的入门版本。尽管参数量未明确公布,但作为 1B 级别的推理优化模型,它在 CPU 和入门 GPU 上表现出不错的推理效率,特别适合用于对话式应用、简单问答或教学场景。相比更大的模型,它在资源受限的环境下更容易上手,兼容 Hugging Face Transformers 生态,部署门槛较低。然而,其生成质量和上下文理解能力有限,不适用于复杂推理或专业领域的深度应用。许可证为 Gemma,允许商业使用,但需遵守相关条款,尤其在生产环境中应仔细阅读模型卡和限制说明。

text generationgemma
1.1K 星标查看详情

Qwen3-ASR-1.7B

Qwen
Not specified

Qwen3 ASR 1.7B 是阿里通义千问团队推出的轻量级自动语音识别模型。它在保持极小参数规模的同时,优化了语音到文本的转换效率,非常适合部署在端侧设备或对响应延迟要求极高的实时场景中。对于开发者而言,该模型上手门槛低,可作为语音助手、会议纪要或实时字幕功能的底层组件。相比于体积庞大的通用模型,它在特定 ASR 任务上提供了更好的能效比,是构建轻量化语音交互应用的理想选择。

automatic speech recognitionapache-2.0
1.1K 星标查看详情

Lance

bytedance-research
模型

Lance 是由字节跳动研究团队推出的全模态(Any-to-Any)大模型。与目前主流的单模态或特定任务模型不同,Lance 的核心竞争力在于其强大的跨模态理解与生成能力,能够实现文本、图像、音频等多种信息流之间的无缝转换。对于开发者而言,这意味着你可以用它构建更复杂的交互应用,比如通过语音直接生成视觉描述,或者实现多维度的内容理解。该模型采用 Apache 2.0 开源协议,对商业化落地非常友好。虽然其具体的参数量尚未完全公开,但从其架构设计来看,它旨在打破模态间的壁垒,是探索下一代通用人工智能(AGI)交互方式的重要工具。

any to anyapache-2.0
1.1K 星标查看详情

Qwen3-Coder-30B-A3B-Instruct-GGUF

unsloth
Not specified

Qwen3 Coder 30B A3B 是一款由阿里巴巴开源、经 Unsloth 优化量化的代码大模型。它采用了 MoE(混合专家)架构,在保持 30B 级别逻辑推理能力的同时,大幅降低了实际运行时的计算开销。对于国内开发者而言,该模型在 Python、Java 等主流语言的补全和重构上表现出色,且对中文注释和需求文档的理解非常地道。由于提供了 GGUF 格式,用户可以通过 llama.cpp 或 Ollama 在消费级显卡甚至 Mac 上流畅运行,是本地部署代码助手的理想选择,可作为 GitHub Copilot 的私有化替代方案。

text generationapache-2.0
1.0K 星标查看详情

NeoHorse-1-9B

TokenRhythm
模型

NeoHorse-1-9B 是由 TokenRhythm 推出的轻量级文本生成模型。在当前大模型动辄百亿、千亿参数的趋势下,这款 9B 参数规模的模型走的是“小而精”的路线,非常适合对推理成本敏感、或者希望在消费级显卡上实现本地部署的开发者。它在保持较高文本生成质量的同时,极大地降低了硬件门槛,是构建个人 AI 助手、自动化内容创作流或特定垂直领域应用的理想底座。对于习惯使用 Hugging Face 生态的用户来说,它的上手难度极低,可以无缝集成到各类开源推理框架中,是追求端侧智能和私有化部署场景下的有力竞争者。

text generationapache-2.0
1.0K 星标查看详情

Qwen3-Omni-30B-A3B-Instruct

Qwen
模型

Qwen3-Omni 系列是通义千问团队推出的全模态(Any-to-Any)大模型,这标志着模型能力从单纯的文本交互向全感官交互的跨越。该版本采用 30B 参数规模,通过混合专家架构(MoE)实现了极高的推理效率。它不仅能读懂文字,更能直接理解并生成音频、图像等多种模态,真正实现了“所见即所得、所听即所得”的交互体验。对于开发者而言,它非常适合构建实时语音助手、多模态内容创作工具或复杂的视觉问答系统。相比于传统的文本模型,它的上手门槛在于需要处理更丰富的输入流,但在处理跨模态逻辑推理时,其表现远超单一模态模型。

any to anyother
1.0K 星标查看详情

Qwen3.8-Flash-Next-GGUF

unsloth
模型

这款由 Unsloth 团队优化的 Qwen3.8-Flash-Next-GGUF 模型,是专为追求极致推理效率的开发者打造的多模态轻量化方案。它通过 GGUF 量化技术,显著降低了对显存的需求,让普通消费级显卡甚至高性能笔记本都能流畅运行。模型核心能力在于强大的图文理解力,能够精准解析图像细节并结合上下文进行文本生成。对于需要集成视觉识别、文档分析或自动化 UI 巡检的开发者来说,这是一个极具性价比的本地化部署选择。上手难度较低,配合 llama.cpp 等主流工具即可快速跑通,非常适合作为端侧 AI 应用或轻量级智能助手的底层引擎。

image text to textother
995 星标查看详情

gemma-4-E2B-it

google
模型

gemma-4-E2B-it 是 Google 推出的新一代全模态(Any-to-Any)模型,它打破了传统 LLM 仅限于文本交互的局限。作为 Gemma 系列的进化版,该模型具备原生处理多种模态输入与输出的能力,这意味着你可以尝试用语音、图像甚至视频来驱动它,并获得相应的反馈。对于开发者而言,它最大的价值在于极高的集成灵活性,非常适合构建智能助手、多模态内容创作工具或复杂的交互式 AI 应用。相比于仅能“看图说话”的模型,E2B-it 追求的是更深层的模态融合。虽然由于其全模态特性,部署和调优的门槛比纯文本模型略高,但其 Apache-2.0 的开源协议为商业化落地提供了极佳的自由度。

any to anyapache-2.0
990 星标查看详情

Voxtral-Mini-4B-Realtime-2602

mistralai
Not specified

Voxtral Mini 4B Realtime 2602 是一款由 Mistral AI 推出的轻量级实时语音识别(ASR)模型。它主打低延迟和高响应速度,旨在将语音实时转化为文本。对于开发者而言,该模型在端侧部署或实时交互场景(如语音助手、会议实时转写)中具有很高的实用价值。由于参数量较小且采用 Apache-2.0 开源协议,它在保证识别准确率的同时,极大地降低了计算资源开销,上手门槛低,非常适合集成到需要快速反馈的 AI 工作流中。

automatic speech recognitionapache-2.0
986 星标查看详情

distilbert-base-uncased-finetuned-sst-2-english

distilbert
Not specified

这是一个基于 DistilBERT 的轻量级文本分类模型,专门在 SST-2 情感分析数据集上进行了微调。简单来说,它是一个高效的“情感检测器”,能快速判断英文文本是正面还是负面评价。相比于原版 BERT,它在保持绝大部分性能的同时,显著降低了推理延迟和内存占用,非常适合部署在资源有限的端侧设备或需要高吞吐量的实时分析场景中。对于开发者而言,它无需复杂配置即可快速上手,是构建英文评论分析、用户反馈筛选等功能的理想基准模型。

text classificationapache-2.0
954 星标查看详情