全球 AI 聊天室 · 现在 17 人在线 进去聊聊
DIRECTORY / 02

AI 模型广场|开源大模型与 LLM 目录

开源大模型和多模态模型目录:看能力、参数规模、许可证、下载量和来源页,方便对比 Qwen、Llama 等怎么选、怎么部署。PromptCube 模型广场持续收录。

比较模型为你的下一个工作流找到合适的选择
目录概览
839
已收录条目
24 个主题分类持续更新
02 / MODEL INDEX

找到适合任务的模型

先看清楚,再做选择。每个条目都保留关键上下文。

精选目录839 个结果

Qwen3.8-27B

Qwen
模型

Qwen3.8-27B 是通义千问团队推出的新一代多模态大模型,主打强大的图文理解与跨模态推理能力。不同于纯文本模型,它能直接“看懂”图片并结合上下文进行深度对话。27B 的参数规模在性能与推理成本之间取得了极佳的平衡,非常适合开发者将其集成到需要视觉识别、文档解析或复杂图像问答的应用场景中。对于习惯使用 GPT-4V 的用户来说,Qwen 系列在中文语境下的图像理解表现往往更具本土化优势。模型采用 Apache-2.0 开源协议,对商业化部署非常友好,上手门槛适中,通过 Hugging Face 即可快速调用或进行微调。

image text to textapache-2.0
16.6K 星标查看详情

DeepSeek-R1

deepseek-ai
模型

DeepSeek R1 是一款主打强化学习(RL)的推理模型,旨在对标 OpenAI o1。它最核心的突破在于通过大规模强化学习提升了逻辑推理、数学证明和代码编写能力,能够通过“慢思考”生成详细的思维链(CoT),让用户清晰看到模型的推理路径。对于国内开发者而言,R1 的最大亮点在于其极高的性价比和开源属性,它不仅在复杂逻辑任务上表现强劲,且上手门槛低,可通过 API 或本地部署快速集成到现有工作流中,是替代昂贵闭源推理模型的理想选择。

text generationmit
14.3K 星标查看详情

Kimi-K3

moonshotai
模型

Kimi-K3 是由月之暗面(Moonshot AI)推出的多模态大模型,专门针对“图文理解”这一核心能力进行了深度优化。不同于单纯的文本对话模型,K3 能够像人类一样“看懂”图片并结合上下文进行逻辑推理。对于开发者而言,它在处理复杂的图文交互任务时表现出色,无论是解析复杂的流程图、识别图片中的细微文字,还是进行基于视觉信息的创意写作,都能提供极高的准确度。该模型目前托管在 Hugging Face 上,上手门槛较低,非常适合希望在现有应用中集成视觉理解能力的开发者,是构建智能视觉助手或自动化文档处理工具的理想选择。

image text to textother
11.5K 星标查看详情

Stable Diffusion XL

Stability AI
3.5B

Stable Diffusion XL (SDXL) 是目前开源图像生成领域的标杆之作。相比前代,它通过更大的参数量显著提升了画质和对复杂提示词的理解力,尤其是解决了人体结构和文字渲染的痛点。对于开发者和创作者而言,SDXL 的最大价值在于其极强的生态可塑性:你可以通过 LoRA 轻松微调出特定风格,或配合 ControlNet 实现精准的构图控制。它无需依赖昂贵的云端订阅,支持本地部署,是追求极致自定义和私有化部署用户的首选方案。

text-to-imageCreativeML Open RAIL++-M
11.0K 星标查看详情

Llama 3.1 405B

Meta
405B

Llama 3.1 405B 是 Meta 推出的开源里程碑之作,也是首个在性能上能与 GPT-4o 等顶级闭源模型正面交锋的开源大模型。它凭借巨大的参数量,在复杂推理、多语言处理和代码编写上展现出极强的能力。对于开发者而言,它最大的价值在于提供了高性能的“基座”,可以通过知识蒸馏将能力迁移到更小的模型中,或者在私有化部署中实现顶尖的文本生成效果。虽然运行门槛极高,但它打破了顶尖 AI 能力被少数闭源巨头垄断的局面。

text-generationLlama 3.1
9.5K 星标查看详情

Stable Diffusion v1.5

Runway
860M

作为 AI 绘画界的“常青树”,SD v1.5 是 Stable Diffusion 系列中最经典的基座模型之一。尽管参数量只有 860M,但它凭借极高的生态兼容性成为了无数开发者的首选。对于中国玩家来说,它的核心价值不在于单打独斗,而在于极其庞大的社区支持:无论是想要精准控图的 ControlNet,还是追求特定画风的 LoRA 插件,都能在 v1.5 上完美运行。上手难度较低,对显存要求也相对亲民,非常适合作为进阶玩家学习提示词工程(Prompt Engineering)和模型微调(Fine-tuning)的起点。如果你想在本地搭建一套完整的 AI 创作工作流,v1.5 是绕不开的基础底座。

text to imageCreativeML Open RAIL++-M
8.7K 星标查看详情

Llama 3 70B

Meta
70B

作为 Meta 开源系列的旗舰级选手,Llama 3 70B 是目前全球范围内最顶尖的开源大模型之一。相比于轻量级的 8B 版本,70B 凭借庞大的参数规模,在逻辑推理、复杂指令遵循以及多轮对话的连贯性上有了质的飞跃,表现直逼 GPT-4 等闭源模型。对于开发者而言,它非常适合作为企业级应用的核心引擎,处理代码生成、长文本分析或复杂的知识问答任务。虽然对本地部署的显存要求较高,但其优秀的生态兼容性意味着你可以轻松通过 Ollama 或 vLLM 等工具将其跑在自己的服务器上,实现高度定制化的私有化部署,是构建高性能 AI 应用的理想基石。

text generationLlama 3.1
8.2K 星标查看详情

stable-diffusion-xl-base-1.0

stabilityai
Not specified

SDXL 1.0 是目前开源图像生成领域的事实标准,相比早期的 v1.5 版本,它在画质、构图以及对复杂提示词的理解力上有质的飞跃。它最大的特点是原生支持 1024x1024 分辨率,解决了以往模型在生成大图时经常出现的“肢体重复”或“画面崩坏”问题。对于中国开发者而言,SDXL 的生态极其丰富,通过加载各种社区微调的 LoRA 模型,可以轻松实现极高精准度的国风、二次元或写实人像效果。虽然对显存要求有所提高,但其强大的出图能力使其成为搭建商业 AI 绘画工作流的首选底模。

text to imageopenrail++
8.2K 星标查看详情

Llama-3.1-8B-Instruct

meta-llama
模型

Llama 3.1 8B Instruct 是 Meta 推出的轻量级高性能指令微调模型。它在保持小参数量的同时,通过大规模高质量数据训练,在逻辑推理、代码编写和多语言处理上有了显著提升。对于中国开发者而言,该模型最大的价值在于其极高的部署性价比:它能轻松跑在消费级 GPU 甚至高性能笔记本上,非常适合作为 RAG(检索增强生成)的本地底座,或在需要低延迟、隐私敏感的端侧场景中替代闭源 API。上手难度极低,兼容 Ollama、vLLM 等主流推理框架。

text generationllama3.1
8.1K 星标查看详情

Gemini 1.5 Pro

Google
Unknown

Gemini 1.5 Pro 是 Google 推出的重量级多模态模型,其核心杀手锏在于处理超长上下文的能力。它支持高达 100 万 token 的上下文窗口,这意味着你可以一次性把几本书、长达数小时的视频或整个代码库扔给它,它能精准地在海量信息中进行检索和逻辑推理。在实际应用中,它非常适合处理复杂的长文档分析、大规模代码重构以及深度视频理解任务。相比 GPT-4,它在处理“超长记忆”任务时表现得更为游刃有余。虽然作为闭源模型需要通过 Google AI Studio 或 Vertex AI 调用,但其强大的多模态理解能力,让它成为了开发者构建复杂智能体(Agent)的理想底座。

text generation专有
8.0K 星标查看详情

Llama 3 8B

Meta
8B

Meta 推出的 Llama 3 8B 是目前开源界极具性价比的“小钢炮”模型。虽然只有 80 亿参数,但其逻辑推理和指令遵循能力在同尺寸模型中表现极其出色。对于开发者来说,它的核心价值在于“轻量化”:你不需要昂贵的 H100 集群,甚至在消费级显卡甚至部分移动端设备上,都能流畅运行并进行微调。它非常适合作为个人 AI 助手、智能客服或特定垂直领域的知识库底座。相比于动辄千亿参数的大模型,Llama 3 8B 的响应速度极快,上手门槛低,是构建端侧 AI 应用或进行模型实验的首选基座。

text generationLlama 3.1
7.5K 星标查看详情

Mixtral 8x7B

Mistral AI
47B

Mixtral 8x7B 是由 Mistral AI 推出的高性能混合专家(MoE)模型。它在架构上采用了“稀疏激活”设计,虽然总参数量达到 47B,但推理时仅激活部分参数,这使其在保持强大逻辑推理和多语言处理能力的同时,推理速度远快于同规模的稠密模型。对于开发者而言,它在代码编写和复杂指令遵循方面表现出色,且由于采用了 Apache 2.0 开源协议,部署门槛较低,是目前替代闭源大模型、构建私有化 AI 应用的极佳选择。

text-generationApache 2.0
7.2K 星标查看详情

stable-diffusion-v1-4

CompVis
Not specified

Stable Diffusion v1.4 是开源图像生成领域的里程碑之作。它最大的特点是极高的自由度和低门槛的本地部署能力,让开发者无需依赖昂贵的云端 API 即可在消费级显卡上运行。相比于闭源模型,v1.4 拥有极其庞大的社区生态,支持通过 LoRA、ControlNet 等插件进行精准控制。虽然在原生画质上不及最新的大模型,但其极快的生成速度和极强的可定制性,使其成为目前 AI 绘画工作流(如 ComfyUI 或 WebUI)中最稳健的基石模型之一。

text to imagecreativeml-openrail-m
7.1K 星标查看详情

Mistral 7B v0.3

Mistral AI
7B

Mistral 7B v0.3 是来自法国 Mistral AI 的明星级开源模型迭代版本。作为 7B 参数量级的佼佼者,它在保持轻量化的同时,通过扩展词表显著提升了多语言处理能力和文本生成的效率。对于开发者而言,它的核心优势在于极高的“性能功耗比”:你可以在消费级显卡甚至高性能笔记本上流畅运行,非常适合用于构建本地知识库、智能助手或进行特定领域的微调。相比于 Llama 系列,它在指令遵循和逻辑推理上表现得更加精炼,上手门槛极低,是目前个人开发者和中小企业进行私有化部署、实现低成本 AI 应用的首选基座模型之一。

text generationApache 2.0
6.8K 星标查看详情

Meta-Llama-3-8B

meta-llama
模型

Meta 推出的 Llama 3 系列中的 8B 版本,是目前开源界极具性价比的轻量化“小钢炮”。虽然参数量仅为 80 亿,但在逻辑推理、指令遵循和文本创作能力上表现惊人,足以媲美许多规模大得多的闭源模型。对于开发者而言,它的上手门槛极低,可以在消费级显卡(如 RTX 3090/4090)上实现流畅的本地部署,非常适合用于构建个人知识库、自动化 Agent 或作为垂直领域微调的基础底座。如果你正在寻找一个既能跑得动、响应又快,且生态支持极佳(兼容 LangChain、Ollama 等主流工具)的开源模型,Llama 3-8B 是目前的首选基准。

text generationllama3
6.7K 星标查看详情

CLIP ViT-L/14

OpenAI
428M

CLIP ViT-L/14 是 OpenAI 推出的经典视觉-语言预训练模型,它打破了传统图像分类必须依赖固定标签集的局限。通过将图像与文本描述在统一的特征空间内进行对齐,它具备极强的“零样本(Zero-shot)”学习能力——这意味着你无需针对特定任务重新训练,只需输入一段文字描述,它就能准确识别图中内容。对于开发者而言,它是构建图文检索、自动打标以及 Stable Diffusion 等生成式 AI 提示词理解的核心组件。虽然 428M 的参数量在当前大模型时代不算巨大,但其在跨模态理解上的效率极高,上手门槛低,是目前多模态应用开发中不可或缺的基石工具。

image classificationMIT
6.2K 星标查看详情

Stable Diffusion 3 Medium

Stability AI
2B

Stable Diffusion 3 Medium 是 Stability AI 推出的新一代图像生成模型。相比前代,它最直观的进化在于对文字排版的理解力,终于解决了 AI 绘图长期以来“单词乱码”的痛点,能够精准地在画面中生成你指定的文本。凭借 2B 参数量的架构优化,它在构图逻辑和指令遵循度上表现更稳,不再需要用户反复通过复杂的提示词工程(Prompt Engineering)去“猜”模型意图。对于开发者和设计师来说,它上手门槛适中,非常适合用于需要文字元素的视觉设计、海报制作以及高质量的插画创作,是目前开源社区中极具竞争力的文本转图像工具。

text to imageCommunity
6.2K 星标查看详情

Mistral Large 2

Mistral AI
123B

Mistral Large 2 是来自法国顶尖 AI 实验室 Mistral AI 的旗舰级大模型。它在 123B 的参数规模下,实现了极高的推理效率与性能平衡,尤其在多语言处理、代码编写和逻辑推理方面表现强劲。对于开发者而言,它不仅能处理长达 128k token 的超长上下文,在数学与编程任务上的表现甚至足以比肩顶尖的闭源模型。虽然它是闭源商业模型,但其设计理念非常注重效率,非常适合作为企业级应用中的核心引擎,用于构建复杂的自动化工作流、智能客服或高质量的内容生成工具。相比于过度臃肿的模型,Mistral Large 2 更加精炼,是追求高性能与响应速度平衡开发者的理想选择。

text generation专有
6.1K 星标查看详情

FLUX.1-schnell

black-forest-labs
Not specified

FLUX.1 schnell 是由原 Stable Diffusion 核心团队打造的极速版图像生成模型。它最大的特点是在极低步数(通常 1-4 步)下就能输出高质量图像,极大提升了出图效率。相比于复杂的 Prompt 调优,schnell 对自然语言的理解力更强,能精准还原复杂的构图指令,且在文字渲染和人体结构上比以往的开源模型更稳。对于习惯使用 ComfyUI 或 WebUI 的开发者来说,它是一个高性能的轻量化替代方案,非常适合需要快速迭代原型或部署在端侧设备的场景。

text to imageapache-2.0
5.9K 星标查看详情

Qwen2.5 72B

Alibaba
72B

作为阿里通义千问系列的最新旗舰,Qwen2.5 72B 是目前开源界中文能力最顶尖的大模型之一。它不仅在中文语境下的逻辑推理、代码编写和数学解题上表现出了极高的精准度,在处理中英双语混合任务时也丝毫不逊色于闭源模型。对于开发者来说,它最大的优势在于极高的性价比和强大的指令遵循能力,非常适合用于构建复杂的智能体(Agent)、长文本分析或作为企业级知识库的底层大脑。由于采用了 Apache 2.0 开源协议,你可以根据业务需求进行深度微调或私有化部署,上手门槛适中,是构建高性能本地 AI 应用的理想底座。

text generationApache 2.0
5.8K 星标查看详情

Qwen3.8-Flash-Next

Qwen
模型

Qwen3.8-Flash-Next 是通义千问团队推出的新一代多模态轻量化模型,主打“快”与“灵”。它不仅能读懂文字,更具备出色的图文理解能力,能够直接通过图像内容进行逻辑推理和对话。相比于参数庞大的巨型模型,Flash 系列在保持极高响应速度的同时,大幅降低了推理成本,非常适合需要实时视觉反馈的应用场景,比如移动端视觉助手、自动化文档扫描或实时图像内容识别。对于开发者而言,它的上手门槛极低,通过 Hugging Face 即可快速集成,是构建高性价比多模态应用、替代传统 OCR 或复杂视觉任务的理想选择。

image text to textother
5.8K 星标查看详情

DeepSeek-V4-Pro

deepseek-ai
模型

DeepSeek-V4-Pro 是由 DeepSeek 团队推出的新一代高性能文本生成模型,延续了该系列在逻辑推理与代码能力上的强悍基因。相比于前代版本,Pro 版本在处理复杂指令遵循和长文本逻辑连贯性上有了显著提升,非常适合开发者用于构建智能 Agent、自动化代码编写以及高难度的逻辑问答场景。对于国内用户而言,它的优势在于对中文语境的深度理解,能精准捕捉细微的语义差别。上手难度极低,通过 Hugging Face 或 API 即可快速接入现有工作流,是目前开源界极具性价比、能直接对标顶级闭源模型的强力竞争者。

text generationmit
5.6K 星标查看详情

Whisper Large V3

OpenAI
1.5B

Whisper Large V3 是 OpenAI 推出的语音识别(ASR)领域“天花板”级开源模型。相比前代,它在处理复杂环境噪音、多语种混杂以及方言识别上有了显著的鲁棒性提升。对于开发者来说,它最大的价值在于其极高的准确率和开源特性,你可以将其轻松集成到自己的语音转文字工具、视频字幕生成器或会议纪要插件中。虽然 1.5B 的参数量对显存有一定的要求,但通过 Faster-Whisper 等优化版本,在消费级显卡甚至高性能 CPU 上也能实现流畅运行。如果你正在寻找一个能够替代商业付费 API、且能高度定制化的语音识别引擎,V3 是目前的首选方案。

automatic speech recognitionMIT
5.5K 星标查看详情

FLUX.1-dev

black-forest-labs
Not specified

FLUX.1-dev 是 Black Forest Labs 推出的开放权重文生图模型,采用修正流 Transformer 架构,参数量 12B,在提示词遵循、细节渲染和字体生成上表现接近闭源 SOTA。模型原生支持 Hugging Face diffusers 生态,配合 fp8 量化或 NF4 量化后,24GB 显存即可跑通推理,适合二次开发、LoRA 微调或集成到 ComfyUI / WebUI 工作流。官方采用非标准许可,允许学术研究与非商业用途,商业落地需单独申请授权。相比同量级 SD3 Medium,FLUX.1-dev 在复杂空间关系与长提示词理解上更稳健,但显存占用略高,建议搭配 xFormers 或 FlashAttention 优化吞吐。

text to imageother
5.4K 星标查看详情