模型分类

AI 模型广场

探索最新最热门的 AI 模型,涵盖 LLM、视觉、音频等多种类型,助你选型与集成。

Qwen3 TTS GGUF

apache-2.0
Qwen3 TTS GGUF 是基于通义千问最新语音生成能力并经过 GGUF 量化的版本。它将原本沉重的语音模型轻量化,使得开发者能够在消费级硬件(如个人 PC 或 Mac)上高效部署高质量的文本转语音服务。该模型在自然度与语调起伏上表现出...
Serveurperso 语音合成
571.8K 0

VieNeu TTS v3 Turbo

apache-2.0
VieNeu TTS v3 Turbo 是一款主打高效能的文本转语音模型,旨在提供更自然、流畅的语音合成体验。相比于传统的 TTS 工具,它在推理速度和音质平衡上做了优化,能够快速生成具有情感起伏的语音,有效减少了机械感。对于开发者而言,该...
pnnbao-ump 语音合成
350.0K 0

Qwen3 TTS 12Hz 1.7B VoiceDesign

apache-2.0
Qwen3 TTS 12Hz 1.7B VoiceDesign 是阿里通义千问团队推出的一款轻量化语音合成模型。它打破了传统 TTS 机械感强的局限,重点优化了音色的自然度与情感表达。1.7B 的参数规模在保证高质量输出的同时,极大降低了端...
Qwen 语音合成
312.0K 86

VoxCPM2

apache-2.0
VoxCPM2 是由 OpenBMB 推出的开源文本转语音(TTS)模型,旨在提供更自然、更具情感表现力的语音合成体验。不同于传统的机械合成音,它在语调起伏和自然度上做了深度优化,能够较好地还原人类说话的节奏感。对于开发者而言,该模型采用 ...
openbmb 语音合成
271.9K 214

Qwen3 TTS 12Hz 1.7B CustomVoice

apache-2.0
Qwen3 TTS 12Hz 1.7B CustomVoice 是一款由阿里 Qwen 团队推出的轻量级语音合成模型。它主打高自然度和个性化定制,通过 1.7B 的参数规模在端侧推理性能与音质之间取得了良好平衡。对于开发者而言,该模型最核心...
Qwen 语音合成
130.6K 60

Qwen3 TTS 12Hz 0.6B Base

apache-2.0
Qwen3 TTS 12Hz 0.6B Base 是阿里通义千问团队推出的轻量级语音合成基座模型。不同于传统的 TTS 插件,它采用了更现代的端到端架构,在极小的参数量(0.6B)下实现了较高的语音自然度。该模型主打低延迟和高效能,非常适合...
Qwen 语音合成
78.9K 33

Qwen3 TTS 12Hz 0.6B CustomVoice

apache-2.0
Qwen3 TTS 12Hz 0.6B 是一款由通义千问团队推出的轻量级语音合成模型。它主打极低的任务延迟和高效的推理速度,0.6B 的小参数量使其能够轻松部署在端侧设备或低配服务器上。该模型支持自定义声音(CustomVoice),能够通...
Qwen 语音合成
62.2K 20

VibeVoice Realtime 0.5B

mit
VibeVoice Realtime 0.5B 是微软推出的一款轻量级实时语音合成模型。不同于传统的 TTS,它专注于极低延迟的音频生成,能够实现接近人类自然语调的实时交互。由于参数量仅为 0.5B,该模型对硬件要求极低,非常适合开发者部署...
microsoft 语音合成
15.7K 27

Kokoro 82M

apache-2.0
Kokoro 82M 是一款极具性价比的轻量级文本转语音 (TTS) 模型。它最核心的竞争力在于用极小的参数量(仅 82M)实现了媲美大型模型的自然语音合成效果,有效解决了端侧部署时显存占用高和推理延迟大的痛点。对于开发者而言,它非常适合集...
hexgrad 语音合成
6.7K 1

OmniVoice

Apache-2.0
OmniVoice 是一款由 k2-fsa 推出的开源语音合成(TTS)模型。它主打高保真的声音克隆能力,能够通过极短的音频样本快速捕捉说话人的音色和情感细节,生成的语音自然度较高,有效缓解了传统 TTS 常见的“机器感”。对于开发者而言,...
k2-fsa 语音合成
5.4K 28

chatterbox

mit
Chatterbox 是由 ResembleAI 推出的轻量级开源文本转语音 (TTS) 工具。与追求极致拟人但计算量巨大的商业模型不同,它在保持自然语调的同时,极大地降低了部署门槛。对于开发者而言,它非常适合集成到需要实时语音反馈的轻量级...
ResembleAI 语音合成
3.6K 7

Kokoro 82M v1.0 ONNX

apache-2.0
Kokoro 82M 是一款极其轻量级且高效的文本转语音(TTS)模型。虽然参数量仅为 82M,但其音质表现出人意料地自然,远超传统的轻量级合成方案。该版本采用 ONNX 格式,这意味着它脱离了沉重的深度学习框架,可以在 CPU 上实现极速...
onnx-community 语音合成
1.3K 2

indic parler tts

apache-2.0
Indic Parler TTS 是由 AI4Bharat 推出的一个专注于印度语系的多语言语音合成模型。与传统的 TTS 不同,它采用了类似 Parler-TTS 的可控生成架构,允许用户通过自然语言描述来调整语音的语气、情感和环境音,而...
ai4bharat 语音合成
62 0