全球 AI 聊天室 · 现在 17 人在线 进去聊聊
DIRECTORY / 02

AI 模型广场|开源大模型与 LLM 目录

开源大模型和多模态模型目录:看能力、参数规模、许可证、下载量和来源页,方便对比 Qwen、Llama 等怎么选、怎么部署。PromptCube 模型广场持续收录。

比较模型为你的下一个工作流找到合适的选择
目录概览
839
已收录条目
24 个主题分类持续更新
02 / MODEL INDEX

找到适合任务的模型

先看清楚,再做选择。每个条目都保留关键上下文。

精选目录839 个结果

Huihui-Qwen3.8-27B-abliterated-GGUF

huihui-ai
模型

这款模型是基于 Qwen 系列深度定制的视觉语言模型,采用了 GGUF 量化格式,非常适合在个人电脑或显存有限的设备上通过 llama.cpp 等工具本地运行。它最大的特点在于通过 'abliterated' 技术处理,在保持强大的图像理解与文本生成能力的同时,显著提升了回答的自由度,减少了过度防御性的拒答情况。对于开发者和爱好者来说,它不仅能精准描述图片细节,还能进行复杂的图文逻辑推理。由于采用了 GGUF 格式,上手难度极低,配合 LM Studio 或 Ollama 等主流客户端,即可实现开箱即用的本地多模态交互体验。

image text to textapache-2.0
953 星标查看详情

nomic-embed-text-v1.5

nomic-ai
Not specified

nomic embed text v1.5 是一款高性能的开源文本向量化模型,主要用于将文本转换为高维向量,以便计算机理解语义相似度。它在中文等多语言支持和长文本处理上表现稳健,是构建 RAG(检索增强生成)系统的核心组件。相比于闭源的 OpenAI embedding 接口,它不仅能本地部署以保证数据隐私,且在很多基准测试中性能相当。对于开发者来说,它能无缝集成到 LangChain 或 LlamaIndex 等主流框架中,上手门槛极低,是替代商业 API、降低推理成本的理想选择。

sentence similarityapache-2.0
935 星标查看详情

vit-gpt2-image-captioning

nlpconnect
Not specified

vit-gpt2-image-captioning 是一款经典的“看图说话”模型,它巧妙地结合了 Vision Transformer (ViT) 的视觉感知能力与 GPT-2 的文本生成能力。简单来说,它能像人类一样“读懂”图片内容,并自动生成一段通顺的文字描述。对于开发者而言,这款模型非常轻量化,上手难度极低,通过 Hugging Face 的 Transformers 库几行代码就能跑通。它非常适合用于构建自动化图片标签系统、辅助视障人士理解图像内容,或者为大规模图库建立文本索引。虽然它在处理极其复杂的逻辑细节时可能不如超大规模多模态模型,但在资源受限或追求推理速度的轻量级应用场景中,它是一个非常平衡且实用的选择。

image to textapache-2.0
935 星标查看详情

blip-image-captioning-base

Salesforce
Not specified

BLIP Image Captioning Base 是由 Salesforce 开发的一款经典视觉-语言预训练模型,专注于将图像内容转化为精准的文字描述。与复杂的通用大模型不同,它是一个轻量级的专项工具,能够快速识别图片中的主体对象及其关系,并生成简洁的自然语言标题。对于中国开发者而言,它非常适合集成到自动化打标签、电商商品描述生成或视障辅助工具等实际场景中。由于其参数规模适中,在普通消费级 GPU 甚至 CPU 上即可流畅运行,上手门槛极低,是构建图像理解管线的理想基础组件。

image to textbsd-3-clause
889 星标查看详情

Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF

DavidAU
模型

这款模型是基于通义千问 Qwen 3.5 系列深度定制的视觉语言模型,由开发者 DavidAU 通过 IMATRIX 技术进行了量化优化。它最核心的特点在于突破了常规模型的表达限制,能够更自由地处理复杂的文本与图像交互任务。对于开发者而言,它不仅具备强大的多模态理解能力,能精准解析图像细节并进行逻辑推理,更在内容生成上展现出极高的灵活性,适合用于创意写作、角色扮演或需要深度语义挖掘的非受限场景。由于采用了 GGUF 格式并经过 MTP 优化,它对硬件非常友好,即使在消费级显卡或大内存设备上也能流畅运行,是追求高自由度与高性能平衡的玩家进阶首选。

image text to textapache-2.0
878 星标查看详情

TeleOCR

XingChen-AGI
模型

TeleOCR 是星辰智能(XingChen-AGI)在 Hugging Face 开源的图文转文本模型,主打通用 OCR 与版面理解的融合。它能直接把图片里的文字、表格、公式、手写内容一次性转成结构化文本或 Markdown,省去传统「检测→识别→后处理」的多阶段管线。模型采用 Apache-2.0 许可,商用友好,权重开箱即用,配合 Transformers 几行代码即可推理,也适配 vLLM、Ollama 等本地部署框架。实测在中英混排、复杂表格、票据单据等场景表现稳健,适合文档数字化、知识库构建、RAG 数据清洗等落地需求。参数量未公开,但从下载量(2.8 万+)与社区反馈看,推理速度在同类开源模型中属于可用水平,显存占用对 24GB 显存单卡友好。

image text to textapache-2.0
864 星标查看详情

Nex-N2.5-mini

nex-agi
模型

Nex-N2.5-mini 是由 nex-agi 推出的轻量化文本生成模型,目前已在 Hugging Face 开源。作为一款追求效率的“小钢炮”模型,它在保持较强逻辑理解能力的同时,极大地降低了部署门槛和算力成本。对于开发者而言,它非常适合集成到对响应速度要求极高的端侧应用、自动化文本处理流或作为轻量级对话助手。由于采用了 Apache-2.0 协议,它在商业化落地和二次开发方面非常友好,可以轻松作为现有 LLM 工作流中的补充模块,用于执行特定任务,是构建低成本、高并发 AI 应用的一个务实选择。

text generationapache-2.0
839 星标查看详情

Qwen2.5-1.5B-Instruct

Qwen
Not specified

Qwen2.5-1.5B-Instruct 是阿里通义千问团队推出的轻量级指令微调模型。它在极小的参数规模下,通过高质量数据训练,实现了极强的性价比,尤其在中文语境理解、基础代码编写和逻辑推理上表现出色。对于开发者而言,这款模型非常适合部署在端侧设备(如手机、笔记本)或作为低成本的 Agent 路由节点,上手门槛极低。它不是为了替代超大规模模型,而是在保证响应速度的同时,高效处理简单的文本摘要、格式转换等日常任务。

text generationapache-2.0
837 星标查看详情

twitter-roberta-base-sentiment-latest

cardiffnlp
Not specified

这是一个由卡迪夫大学(CardiffNLP)基于 RoBERTa 架构微调的轻量级情感分析模型。它专门在海量推特数据上进行训练,因此对社交媒体特有的非规范语言、网络俚语以及表情符号(Emoji)有极强的捕捉能力。相比于通用情感模型,它在处理短文本、口语化表达时准确率更高。对于开发者而言,该模型上手门槛极低,可通过 Hugging Face 快速部署,非常适合用于品牌舆情监控、用户反馈分析或构建简单的社交媒体情绪看板。

text classificationcc-by-4.0
831 星标查看详情

Qwen-Image-Lightning

lightx2v
Not specified

Qwen Image Lightning 是一款主打极致生成速度的文本到图像模型。它针对中文语境进行了深度优化,能够精准理解复杂的中文提示词,有效解决了许多海外模型在处理中文意境时出现的“理解偏差”。该模型上手门槛极低,非常适合需要快速出图、进行创意脑暴或在实时应用场景中集成图像生成的开发者。相比于传统的重量级扩散模型,它在保证视觉质量的同时大幅降低了推理延迟,是追求效率与质量平衡的理想选择。

text to imageapache-2.0
829 星标查看详情

playground-v2.5-1024px-aesthetic

playgroundai
Not specified

Playground v2.5 1024px Aesthetic 是 Playground AI 发布的文生图模型,主打 1024×1024 分辨率下的审美表现。模型在色彩平衡、构图细节和光影层次上经过针对性调优,适合需要高质量插画、概念设计或社交媒体配图的场景。基于 Diffusers 生态,配合 Hugging Face 的 pipeline 即可快速接入,无需额外微调即可产出可用结果;若追求特定风格,可结合 LoRA 或 ControlNet 做轻量适配。许可证标注为“other”,商用前需仔细阅读模型卡确认权限边界。整体上手门槛低,适合已有 Stable Diffusion 基础的开发者直接集成到现有工作流中。

text to imageother
771 星标查看详情

Hemmingway-1

Altworld
模型

Hemmingway-1 是 Altworld 发布在 Hugging Face 上的文本生成模型,采用 cc-by-nc-4.0 许可证,适合非商业项目试验。该模型参数量未公开,但凭借简单架构和较小体积,可在消费级显卡或 even CPU 上快速推理,降低了本地部署门槛。由于训练数据以英文为主,英文写作润色、摘要生成、角色对话等场景表现尚可;中文理解和生成能力有限,需谨慎用于中文应用。接入方式与 Hugging Face 生态无缝对接,调用 tokenizer 和 pipeline 即可上手,适合开发者快速构建原型或进行文本生成方向的学习实验。需要注意的是,许可证限制了商业用途,线上服务或产品化时务必审慎。

text generationcc-by-nc-4.0
770 星标查看详情

gemma-4-12B

google
模型

作为 Google 推出的 Gemma 系列最新力作,gemma-4-12B 是一款极具竞争力的“全模态”模型。不同于以往只能处理文本的模型,它具备了强大的 Any-to-Any 能力,意味着它能打破单一模态的限制,在文本、图像甚至更复杂的跨模态任务中展现出极高的理解力。12B 的参数规模在性能与推理成本之间找到了一个绝佳的平衡点:它既不像超大规模模型那样难以部署,也不像轻量化模型那样容易“智商掉线”。对于开发者而言,它非常适合集成到需要多模态理解的智能助手、内容分析工具或自动化工作流中。由于采用了 Apache-2.0 开源协议,它的商用门槛极低,是构建定制化多模态应用的高性价比首选。

any to anyapache-2.0
756 星标查看详情

Qwen3-32B

Qwen
Not specified

Qwen3 32B 是通义千问系列的最新进阶型号,精准卡在“性能”与“部署成本”的黄金平衡点上。相比于轻量级模型,它在复杂逻辑推理和多语言处理上有了显著提升,而相比于超大规模模型,它对显存的要求更亲民,非常适合开发者在私有化部署时作为主力推理后端。无论你是需要一个强大的代码助手,还是想构建一个对中文语境理解极深的企业级知识库,Qwen3 32B 都能提供接近旗舰模型的体验,且上手门槛极低,兼容主流的推理框架。

text generationapache-2.0
747 星标查看详情

animagine-xl-3.1

cagliostrolab
Not specified

Animagine XL 3.1 是 CagliostroLab 基于 SDXL 微调的二次元特化模型,在 Danbooru 标签理解、角色还原度和构图质量上表现突出。原生支持原生分辨率 1024x1024,配合 ComfyUI 或 WebUI 直接加载即用,无需额外 VAE。擅长动漫线稿上色、角色一致性生成及复杂场景渲染,Tag 顺序敏感度高,建议按质量、角色、场景顺序提示。OpenRAIL++ 协议允许商用但需注意衍生模型共享条款,适合二创插画、轻小说封面、游戏立绘快速出图。

text to imageopenrail++
733 星标查看详情

Qwen3-4B

Qwen
Not specified

Qwen3-4B 是阿里通义千问系列的新一代小参数模型,延续了 Qwen2.5 的强中文理解与指令跟随能力,在数学推理、代码生成和多语言任务上表现均衡。得益于 Apache-2.0 许可,开发者可直接用于商业闭源项目,部署门槛极低:量化后 4-bit 版本仅需 3-4GB 显存即可在消费级显卡(如 RTX 3060/4060)上流畅跑通,配合 llama.cpp、Ollama 或 vLLM 可在几分钟内完成本地化部署。相比同量级竞品,其长文本窗口(32K)和结构化输出稳定性更强,适合作为轻量级 Agent 基座、RAG 检索增强的生成端,或嵌入到边缘设备、移动端 App 做离线推理。生态上已融入 Hugging Face Transformers、ModelScope、FastChat 等主流框架,微调脚本(LoRA/QLoRA)现成可用,二次开发成本极低。

text generationapache-2.0
703 星标查看详情

roberta-base-go_emotions

SamLowe
Not specified

roberta-base-go-emotions 是一个基于 RoBERTa 架构的轻量级文本分类模型,专门用于精细化的情感分析。与传统的正负面二元分类不同,它能识别 28 种细粒度的情绪(如感激、好奇、失望等),非常适合需要深度洞察用户心理的场景。对于开发者来说,该模型上手门槛极低,可直接通过 Hugging Face 部署,是构建智能客服分析、社交媒体舆情监控或情感计算应用的理想选择,能有效弥补通用大模型在特定情感量化分析上的不稳定性。

text classificationmit
691 星标查看详情

Ornith-1.0-9B-GGUF

ornith-ai
Not specified

Ornith-1.0-9B 是由 ornith-ai 发布的 90 亿参数文本生成模型,采用 MIT 宽松许可,商业友好。模型以 GGUF 量化格式分发,原生适配 llama.cpp、Ollama、LM Studio 等本地推理生态,无需复杂配置即可在消费级显存(如 8-12GB)上流畅运行。作为通用基座模型,它在中英文指令跟随、代码片段生成及长文本摘要等任务上表现均衡,适合需要离线部署、数据隐私敏感或二次微调的开发者快速验证原型。社区反馈显示其指令遵循稳定性优于同量级早期开源模型,但专业领域知识深度仍受限于参数规模,建议结合 RAG 或 LoRA 微调落地具体业务。

text generationmit
659 星标查看详情

Qwen2.5-0.5B-Instruct

Qwen
Not specified

Qwen2.5-0.5B-Instruct 是阿里通义千问家族中极其轻量化的指令微调模型。尽管参数量仅有 0.5B,但它在保持极低推理成本的同时,具备了出色的基础对话和指令遵循能力。这款模型并非为了替代大型 LLM,而是为端侧部署和特定任务微调而生。对于开发者来说,它非常适合集成到手机、IoT 设备或作为复杂 Pipeline 中的轻量级前置分类器,在保证响应速度的同时,能有效降低对硬件显存的依赖,是尝试本地化部署 AI 的绝佳入门选择。

text generationapache-2.0
628 星标查看详情

Qwen3.6-35B-A3B-NVFP4

nvidia
Not specified

Qwen3.6 35B A3B NVFP4 是由 NVIDIA 提供的基于通义千问系列的优化版本。该模型采用了 NVFP4 低精度量化技术,旨在通过大幅降低显存占用,在不牺牲太多性能的前提下,提升在 NVIDIA GPU 上的推理吞吐量。对于开发者而言,它在保持 30B 级别模型逻辑推理能力的同时,极大降低了部署门槛,非常适合需要兼顾响应速度与智能程度的本地化部署或企业级私有化场景,是追求极致推理能效比的理想选择。

text generationapache-2.0
624 星标查看详情

Janus-1.3B

deepseek-ai
模型

Janus-1.3B 是由 DeepSeek 推出的轻量化“全模态”模型,实现了真正的 Any-to-Any 能力。不同于传统只做视觉问答或纯文本生成的模型,它尝试在同一个架构下打通文本与图像的理解与生成。虽然 1.3B 的参数量不算大,但这意味着它对硬件极其友好,开发者甚至可以在消费级显卡或移动端设备上进行本地部署和微调。对于想要探索多模态交互、构建轻量化智能助手或进行图像/文本跨模态任务研究的开发者来说,Janus 提供了一个低门槛且高性能的实验基座,是研究多模态统一架构的一个极佳切入点。

any to anymit
601 星标查看详情

MiMo-V2.6-Pro-RL

XiaomiMiMo
模型

MiMo-V2.6-Pro-RL 是小米推出的一款面向文本生成任务的推理模型,隶属于 MiMo 系列,专注于提升多轮对话和复杂语境下的推理能力。该模型通过强化学习(RL)进行优化,能够更好地理解指令并生成更贴切、连贯的回复,尤其在需要逻辑推理、文档整理或代码解释等场景中表现突出。由于采用 MIT 许可证,开发者可自由用于商业或研究项目,无需担心版权限制。尽管目前下载量较低、社区关注度不高,但其架构设计上更倾向于轻量化部署,适合希望在本地或边缘设备上运行推理任务的用户。上手难度中等,依赖 Hugging Face 平台即可快速调用,与常见的 LLaMA、Qwen 系列模型存在一定的可替代性,开发者可根据具体需求进行选择与集成。

text generationmit
598 星标查看详情

Swift-Qwen3.8-27b

ukisai
模型

Swift-Qwen3.8-27b 是一款基于 Qwen 系列架构深度优化的多模态大模型,核心能力在于实现高质量的图文理解与跨模态交互。它不仅仅能“看懂”图片,更能精准地将视觉信息转化为逻辑严密的文本描述。对于开发者而言,27B 的参数规模在性能与推理成本之间找到了一个极佳的平衡点:既具备处理复杂视觉任务的能力,又不会像超大规模模型那样对硬件配置提出极端要求。无论你是想构建自动化图像标注工具、智能视觉问答系统,还是需要一个能读懂复杂图表的 AI 助手,这款模型都能提供非常稳健的支持。上手难度适中,兼容主流的多模态推理框架,是国产开源生态中非常值得尝试的视觉语言模型。

image text to textother
587 星标查看详情

nomic-embed-text-v1

nomic-ai
Not specified

nomic-embed-text-v1 是一款高性能的开源文本向量化模型,旨在将文本转化为高维向量以实现语义搜索和相似度计算。相比于闭源的 OpenAI embedding 接口,它最大的优势在于开源且支持长文本输入,能有效处理更复杂的文档片段。对于国内开发者而言,它是构建本地 RAG(检索增强生成)知识库的理想选择,可以替代昂贵的 API 调用,在保证检索精度的同时,显著降低部署成本并提升数据隐私性。上手难度较低,可通过 Hugging Face 或 Ollama 快速集成到现有工作流中。

sentence similarityapache-2.0
582 星标查看详情