模型分类

AI 模型广场

探索最新最热门的 AI 模型,涵盖 LLM、视觉、音频等多种类型,助你选型与集成。

Ace Step1.5

mit
Ace Step1.5 是一款专注于文本到音频生成的开源模型,旨在为开发者提供更灵活的音频合成方案。不同于传统的 TTS(语音合成),它更强调对音频质感和环境氛围的还原。该模型采用 MIT 协议,意味着开发者可以低成本地将其集成到自己的应用...
ACE-Step 文本生成音频
63.4K 44

Ace Step1.5 XL DF11 ComfyUI

mit
Ace Step1.5 XL DF11 是一款专为 ComfyUI 生态设计的文本转音频(Text-to-Audio)模型。它将高质量的音频生成能力集成到了节点式工作流中,让开发者能够像控制图像生成一样,通过精准的参数调节来掌控声音的质感与...
mingyi456 文本生成音频
9.7K 0

fastspeech2 conformer

apache-2.0
FastSpeech2 Conformer 是由 ESPnet 提供的文本转语音(TTS)模型,它在 FastSpeech2 的非自回归架构基础上引入了 Conformer 模块,通过结合卷积和自注意力机制,显著提升了对语音韵律和细节的建模...
espnet 文本生成音频
9.6K 0

fastspeech2 conformer with hifigan

apache-2.0
这是一个由 ESPnet 提供的端到端语音合成方案,结合了 FastSpeech 2 的非自回归架构、Conformer 的上下文建模能力以及 HiFi-GAN 的高保真声码器。相比传统的 TTS 模型,它在保证语音自然度和韵律感的同时,极...
espnet 文本生成音频
8.8K 0

MiniMax Music3

Apache-2.0
MiniMax Music3 是一款由 MiniMax 推出的文本生成音频模型,专注于将文字描述直接转化为高质量的音乐片段。它打破了传统音乐创作的高门槛,用户无需掌握乐理或复杂的 DAW 软件,只需通过自然语言描述风格、情绪或场景,即可快速...
MiniMaxAI 文本生成音频
8.6K 0

acestep 5Hz lm 0.6B

mit
acestep 5Hz lm 0.6B 是一款轻量级的文本转音频(Text-to-Audio)模型。尽管参数量仅为 0.6B,但其设计目标是在保持极低推理开销的同时,实现高效的音频生成。对于中国开发者而言,该模型最大的吸引力在于其极低的硬件...
ACE-Step 文本生成音频
5.4K 0

acestep v15 xl sft

mit
acestep v15 xl sft 是一款基于 MIT 协议开源的文本转音频(Text-to-Audio)模型。不同于简单的语音合成,它更侧重于通过自然语言描述生成高质量的音频片段或音效。对于开发者而言,该模型在 SFT(有监督微调)后对...
ACE-Step 文本生成音频
4.5K 10

acestep 5Hz lm 4B

mit
acestep 5Hz lm 4B 是一款由 ACE-Step 推出的轻量级文本转音频(Text-to-Audio)模型。与传统的 TTS 语音合成不同,它更侧重于从文本描述直接生成丰富的音频片段或环境音效。4B 的参数规模使其在保证生成质...
ACE-Step 文本生成音频
3.1K 2