Stable Diffusion XL
Stability AI3.5BStable Diffusion XL (SDXL) 是目前开源图像生成领域的标杆之作。相比前代,它通过更大的参数量显著提升了画质和对复杂提示词的理解力,尤其是解决了人体结构和文字渲染的痛点。对于开发者和创作者而言,SDXL 的最大价值在于其极强的生态可塑性:你可以通过 LoRA 轻松微调出特定风格,或配合 ControlNet 实现精准的构图控制。它无需依赖昂贵的云端订阅,支持本地部署,是追求极致自定义和私有化部署用户的首选方案。
text-to-imageCreativeML Open RAIL++-M
Stable Diffusion v1.5
Runway860M作为 AI 绘画界的“常青树”,SD v1.5 是 Stable Diffusion 系列中最经典的基座模型之一。尽管参数量只有 860M,但它凭借极高的生态兼容性成为了无数开发者的首选。对于中国玩家来说,它的核心价值不在于单打独斗,而在于极其庞大的社区支持:无论是想要精准控图的 ControlNet,还是追求特定画风的 LoRA 插件,都能在 v1.5 上完美运行。上手难度较低,对显存要求也相对亲民,非常适合作为进阶玩家学习提示词工程(Prompt Engineering)和模型微调(Fine-tuning)的起点。如果你想在本地搭建一套完整的 AI 创作工作流,v1.5 是绕不开的基础底座。
text to imageCreativeML Open RAIL++-M
stable-diffusion-xl-base-1.0
stabilityaiNot specifiedSDXL 1.0 是目前开源图像生成领域的事实标准,相比早期的 v1.5 版本,它在画质、构图以及对复杂提示词的理解力上有质的飞跃。它最大的特点是原生支持 1024x1024 分辨率,解决了以往模型在生成大图时经常出现的“肢体重复”或“画面崩坏”问题。对于中国开发者而言,SDXL 的生态极其丰富,通过加载各种社区微调的 LoRA 模型,可以轻松实现极高精准度的国风、二次元或写实人像效果。虽然对显存要求有所提高,但其强大的出图能力使其成为搭建商业 AI 绘画工作流的首选底模。
text to imageopenrail++
stable-diffusion-v1-4
CompVisNot specifiedStable Diffusion v1.4 是开源图像生成领域的里程碑之作。它最大的特点是极高的自由度和低门槛的本地部署能力,让开发者无需依赖昂贵的云端 API 即可在消费级显卡上运行。相比于闭源模型,v1.4 拥有极其庞大的社区生态,支持通过 LoRA、ControlNet 等插件进行精准控制。虽然在原生画质上不及最新的大模型,但其极快的生成速度和极强的可定制性,使其成为目前 AI 绘画工作流(如 ComfyUI 或 WebUI)中最稳健的基石模型之一。
text to imagecreativeml-openrail-m
Stable Diffusion 3 Medium
Stability AI2BStable Diffusion 3 Medium 是 Stability AI 推出的新一代图像生成模型。相比前代,它最直观的进化在于对文字排版的理解力,终于解决了 AI 绘图长期以来“单词乱码”的痛点,能够精准地在画面中生成你指定的文本。凭借 2B 参数量的架构优化,它在构图逻辑和指令遵循度上表现更稳,不再需要用户反复通过复杂的提示词工程(Prompt Engineering)去“猜”模型意图。对于开发者和设计师来说,它上手门槛适中,非常适合用于需要文字元素的视觉设计、海报制作以及高质量的插画创作,是目前开源社区中极具竞争力的文本转图像工具。
text to imageCommunity
FLUX.1-schnell
black-forest-labsNot specifiedFLUX.1 schnell 是由原 Stable Diffusion 核心团队打造的极速版图像生成模型。它最大的特点是在极低步数(通常 1-4 步)下就能输出高质量图像,极大提升了出图效率。相比于复杂的 Prompt 调优,schnell 对自然语言的理解力更强,能精准还原复杂的构图指令,且在文字渲染和人体结构上比以往的开源模型更稳。对于习惯使用 ComfyUI 或 WebUI 的开发者来说,它是一个高性能的轻量化替代方案,非常适合需要快速迭代原型或部署在端侧设备的场景。
text to imageapache-2.0
FLUX.1-dev
black-forest-labsNot specifiedFLUX.1-dev 是 Black Forest Labs 推出的开放权重文生图模型,采用修正流 Transformer 架构,参数量 12B,在提示词遵循、细节渲染和字体生成上表现接近闭源 SOTA。模型原生支持 Hugging Face diffusers 生态,配合 fp8 量化或 NF4 量化后,24GB 显存即可跑通推理,适合二次开发、LoRA 微调或集成到 ComfyUI / WebUI 工作流。官方采用非标准许可,允许学术研究与非商业用途,商业落地需单独申请授权。相比同量级 SD3 Medium,FLUX.1-dev 在复杂空间关系与长提示词理解上更稳健,但显存占用略高,建议搭配 xFormers 或 FlashAttention 优化吞吐。
text to imageother
Z-Image-Turbo
Tongyi-MAINot specifiedZ Image Turbo 是由阿里通义团队推出的高性能文本生成图像模型。它主打“快”与“准”,通过优化推理效率,在保证画面质量的同时极大地缩短了出图时间,非常适合需要快速迭代视觉方案的开发者和设计师。该模型对中文语义理解到位,能精准还原复杂的提示词细节,上手门槛低,无需复杂的参数调优即可获得商用级别的图像效果,是目前追求生产力效率的理想之选。
text to imageapache-2.0
sdxl-turbo
stabilityaiNot specifiedsdxl-turbo 是 Stability AI 基于 SDXL 蒸馏出的极速生成模型,采用对抗扩散蒸馏(ADD)技术,仅需 1-4 步即可出图,推理速度较基础版提升一个数量级,适合实时交互、视频关键帧生成或作为控制网(ControlNet)的底模快速出草图。它在 diffusers、ComfyUI、WebUI 生态中原生支持,加载即用无需额外适配,但受限于蒸馏损失,细节纹理与提示词遵循度不如完整 SDXL,且官方许可证限制商用,国内开发者多用于原型验证、直播实时绘图演示或本地离线娱乐。上手难度极低,只要会跑基础 SDXL 工作流,换掉 checkpoint 并把步数调到 1-4 步即可。
text to imageother
OpenJourney v4
PromptHero860M如果你在寻找一种无需订阅 Midjourney 就能获得类似质感的生成方案,OpenJourney v4 是一个非常值得尝试的 Stable Diffusion 微调模型。它通过在 PromptHero 的大规模数据集上进行深度训练,精准捕捉了 Midjourney 那种极具艺术感、光影细腻且构图考究的视觉风格。相比于原版 SD 模型,它在理解艺术指令和色彩氛围上表现得更加“懂行”。对于开发者和创作者来说,它的上手难度极低,可以直接集成在 WebUI 或 ComfyUI 等主流工具链中使用,非常适合用于快速生成高质量的插画、概念设计或社交媒体配图,是低成本复刻顶级 AI 绘画审美的高效路径。
text to imageCreativeML Open RAIL++-M
Qwen-Image
QwenNot specifiedQwen Image 是由阿里通义千问团队推出的文本生成图像模型。它延续了 Qwen 系列在中文语义理解上的深厚积淀,能够精准捕捉中文提示词中的微妙语境,有效解决了许多开源模型在处理中文描述时容易出现的“理解偏差”问题。无论是生成写实风格的商业素材,还是具有中国文化元素的艺术创作,它都能提供较高的出图质量。对于开发者而言,得益于 Apache-2.0 协议,该模型在部署和商业化上非常灵活,上手难度低,是替代部分闭源绘图工具、构建自有图像生成管线的理想选择。
text to imageapache-2.0
FLUX.1-dev-gguf
city96Not specifiedFLUX.1-dev-gguf 是由 city96 社区大佬对顶尖图像生成模型 FLUX.1-dev 进行量化后的版本。简单来说,它解决了原版模型对显存要求过高的“痛点”。通过引入 GGUF 这种高效的量化格式,开发者可以在家用显卡甚至配置稍低的电脑上,流畅运行原本只能在专业工作站上跑的高质量文生图任务。如果你追求极致的画面细节、精准的语义理解(尤其是文字渲染能力),但又不想折腾昂贵的硬件,这个版本是目前本地部署的最佳平衡点。它完美适配 ComfyUI 等主流工作流,上手门槛较低,是追求性价比的 AI 绘画玩家必试的进阶工具。
text to imageother
stable-diffusion-v1-5
stable-diffusion-v1-5Not specifiedStable Diffusion v1.5 是目前 AI 绘画社区生态最繁荣的经典模型。虽然它不是最新的版本,但凭借极低的硬件门槛和开放的权重,成为了无数开发者和创作者的首选。它最大的优势在于极强的可塑性,用户可以通过加载海量的 LoRA 微调模型或 ControlNet 插件,精准控制人物姿态、画风和细节。对于习惯使用 WebUI 或 ComfyUI 的用户来说,v1.5 是一个极其稳定且灵活的底模,非常适合需要高度自定义图像生成流程的场景。
text to imagecreativeml-openrail-m
Qwen-Image-Lightning
lightx2vNot specifiedQwen Image Lightning 是一款主打极致生成速度的文本到图像模型。它针对中文语境进行了深度优化,能够精准理解复杂的中文提示词,有效解决了许多海外模型在处理中文意境时出现的“理解偏差”。该模型上手门槛极低,非常适合需要快速出图、进行创意脑暴或在实时应用场景中集成图像生成的开发者。相比于传统的重量级扩散模型,它在保证视觉质量的同时大幅降低了推理延迟,是追求效率与质量平衡的理想选择。
text to imageapache-2.0
playground-v2.5-1024px-aesthetic
playgroundaiNot specifiedPlayground v2.5 1024px Aesthetic 是 Playground AI 发布的文生图模型,主打 1024×1024 分辨率下的审美表现。模型在色彩平衡、构图细节和光影层次上经过针对性调优,适合需要高质量插画、概念设计或社交媒体配图的场景。基于 Diffusers 生态,配合 Hugging Face 的 pipeline 即可快速接入,无需额外微调即可产出可用结果;若追求特定风格,可结合 LoRA 或 ControlNet 做轻量适配。许可证标注为“other”,商用前需仔细阅读模型卡确认权限边界。整体上手门槛低,适合已有 Stable Diffusion 基础的开发者直接集成到现有工作流中。
text to imageother
animagine-xl-3.1
cagliostrolabNot specifiedAnimagine XL 3.1 是 CagliostroLab 基于 SDXL 微调的二次元特化模型,在 Danbooru 标签理解、角色还原度和构图质量上表现突出。原生支持原生分辨率 1024x1024,配合 ComfyUI 或 WebUI 直接加载即用,无需额外 VAE。擅长动漫线稿上色、角色一致性生成及复杂场景渲染,Tag 顺序敏感度高,建议按质量、角色、场景顺序提示。OpenRAIL++ 协议允许商用但需注意衍生模型共享条款,适合二创插画、轻小说封面、游戏立绘快速出图。
text to imageopenrail++
animagine-xl-4.0
cagliostrolabNot specifiedAnimagine XL 4.0 是一款深耕二次元领域的开源图像生成模型,基于 SDXL 架构并经过大规模动漫数据集精调。它解决了以往模型在处理复杂角色特征和特定画风时容易“崩坏”的痛点,能够精准还原动漫角色的服装与细节。对于国内创作者而言,它不仅支持高质量的立绘和场景生成,且对提示词的理解力更强,上手门槛低,是目前替代商业绘图软件、构建个人动漫资产的理想选择。
text to imageopenrail++
sd-turbo
stabilityaiNot specifiedSD Turbo 是 Stability AI 推出的实时图像生成模型,其核心突破在于将生成速度提升到了极致。它采用了先进的蒸馏技术,能够将原本需要数十步的迭代过程压缩到 1 步,实现了真正的“边输入边出图”。对于开发者而言,它极大地降低了 GPU 推理成本,让实时交互式 AI 绘画成为可能。如果你习惯于 Stable Diffusion 的生态,上手 SD Turbo 几乎没有门槛,它非常适合用于快速原型设计、实时滤镜或对响应速度要求极高的轻量级应用场景。
text to imageSee model card
Juggernaut-XL-v9
RunDiffusionNot specifiedJuggernaut-XL-v9 是 RunDiffusion 团队发布的文本生成图像模型,属于 T2I 领域的实用选择。它基于 SDXL 架构,适用于 Diffusers 等工具链,生成效果在写实与艺术风格间有一定平衡。模型参数量未公开,但凭借 fine-tune 优化,在人物、场景等常见内容上表现尚佳,特别适合快速原型开发或个人创作。需要注意的是其许可为 CreativeML OpenRAIL-M,商业用途需谨慎评估,建议部署前查阅模型卡并测试适配性。
text to imagecreativeml-openrail-m
Realistic_Vision_V5.1_noVAE
SG161222Not specifiedRealistic Vision V5.1 是一款在 Stable Diffusion 社区极具口碑的写实风微调模型。它专注于消除 AI 绘画常见的“塑料感”,在皮肤纹理、光影过渡和真实场景还原上表现出色,非常适合需要出高质量人像摄影、产品实拍图的开发者和创作者。由于该版本标注为 noVAE,用户在部署时需自行加载合适的 VAE 文件以确保色彩正常且无灰边。对于习惯使用 WebUI 或 ComfyUI 的用户来说,该模型上手门槛低,且能通过简单的提示词实现电影级的写实效果。
text to imagecreativeml-openrail-m
Z-Image-Turbo-GGUF
unslothNot specifiedZ-Image-Turbo-GGUF 是由 Unsloth 团队推出的文本生成图像模型,采用 GGUF 量化格式发布。对于开发者而言,这款模型最大的价值在于其对内存效率的极致优化,非常适合在显存有限的个人电脑或边缘设备上本地运行。相比于动辄占用巨大显存的原始权重,GGUF 版本显著降低了硬件门槛,让你能在普通的消费级显卡甚至高性能 CPU 上体验快速的生图过程。它主要面向需要低延迟、轻量化部署的 AI 绘画场景,如果你正在寻找一种既能保证生成质量,又能在本地环境顺畅跑起来的生图方案,这款模型是一个非常务实的选择。
text to imageapache-2.0
RealVisXL_V5.0
SG161222Not specifiedRealVisXL V5.0 是一款基于 SDXL 架构微调的高质量写实类图像生成模型。它专注于解决 AI 绘图中常见的“塑料感”问题,通过优化皮肤纹理、光影细节和真实比例,能产出极具摄影感的照片级图像。对于习惯使用 Stable Diffusion 的开发者或设计师来说,该模型上手门槛低,无需复杂的提示词堆砌即可获得自然的人像和场景效果,是目前替代通用模型、追求极致写实视觉表达的理想选择。
text to imageopenrail++
Flux2-Klein-9B-True-V2
wikeeyangNot specifiedFlux2-Klein-9B-True-V2 是开发者 wikeeyang 基于 Flux.1 架构训练的 9B 参数蒸馏/量化变体,主打在有限算力下复现 Flux 级别的文生图效果。模型适配 diffusers 生态,加载即用,无需额外适配代码。实测在中文提示词理解、复杂构图遵循及文本渲染上接近官方 dev 版,显存占用显著降低,12-16GB 显存即可跑全精度或 FP8 推理。适合二次开发、ComfyUI/WebUI 工作流集成、本地化部署及中小团队快速验证创意。许可证标注为 other,商用前务必核对模型卡原文确认权利边界。
text to imageother
Pony_Diffusion_V6_XL
LyliaEngineNot specifiedPony Diffusion V6 XL 是基于 SDXL 微调的图像生成模型,在二次元和动漫风格领域具有极强的统治力。它最核心的突破在于对自然语言指令的深度理解,用户不再需要堆砌冗长的提示词标签,通过简单的描述即可精准控制角色姿势和场景。对于习惯了 Stable Diffusion 的开发者和创作者来说,它在构图准确度和画风纯净度上显著优于原版 SDXL,是目前制作高质量动漫插画、角色同人图的首选模型,上手门槛低且出图效率极高。
text to imagecdla-permissive-2.0