模型分类

AI 模型广场

探索最新最热门的 AI 模型,涵盖 LLM、视觉、音频等多种类型,助你选型与集成。

bigvgan v2 22khz 80band 256x

mit
BigVGAN v2 是由 NVIDIA 推出的高性能神经声码器,专门用于将梅尔频谱图还原为高质量的音频波形。相比前代,v2 版本在 22kHz 采样率下表现出极强的鲁棒性,能有效消除合成语音中的金属感和电音,使人声更加自然、饱满。对于开发...
nvidia 语音分离
1.8M 0

bigvgan v2 44khz 128band 512x

mit
BigVGAN v2 是由 NVIDIA 开发的高性能神经声码器,专门用于将频谱图还原为高质量的音频波形。该版本支持 44.1kHz 高采样率和 128 频段,旨在解决传统 TTS 或语音合成中常见的金属感和伪影问题。对于开发者而言,它不仅...
nvidia 语音分离
755.8K 0

TIGER DnR

apache-2.0
TIGER DnR 是一款专注于音频去噪与修复(De-noising & Restoration)的音频到音频模型。它旨在解决录音环境嘈杂、底噪过大或音质受损等痛点,能够将受干扰的音频信号还原为纯净的人声或背景音。对于播客主、视频创作者或需...
JusperLee 语音分离
107.5K 0

bigvgan v2 24khz 100band 256x

mit
BigVGAN v2 是由 NVIDIA 开发的高质量神经声码器,专门用于将频谱图还原为高质量音频。相比前代,v2 版本在 24kHz 采样率下表现出极强的鲁棒性,能够有效消除合成语音中常见的金属感或电音杂质,使人声更加自然、纯净。对于开发...
nvidia 语音分离
47.3K 0

MP SENet DNS

mit
MP SENet DNS 是一款专注于语音增强(DNS)的音频处理模型,旨在从嘈杂的背景音中精准提取纯净的人声。它采用了 SENet 架构,能够有效抑制环境噪音并减少回声,非常适合需要高质量语音输入但缺乏专业录音环境的开发者。对于习惯使用 ...
JacobLinCool 语音分离
39.9K 0

Qwen3 TTS Tokenizer 12Hz

apache-2.0
Qwen3 TTS Tokenizer 12Hz 是阿里 Qwen 团队推出的音频离散化分词工具,旨在将连续的音频信号转换为模型可理解的 Token 序列。它采用了 12Hz 的采样率,在保证语音关键特征(如语调、情感)不丢失的同时,极大地...
Qwen 语音分离
22.3K 7

TIGER speech

apache-2.0
TIGER speech 是一款基于 Apache-2.0 协议的开源语音到语音(Audio-to-Audio)模型。与传统的“语音转文字再转语音”的级联方案不同,它旨在实现更自然、低延迟的端到端语音交互,能更好地保留说话人的语气、情感和语...
JusperLee 语音分离
14.3K 0

ConvTasNet Libri1Mix enhsingle 16k

cc-by-sa-4.0
ConvTasNet Libri1Mix 是一款专注于单通道语音增强(Speech Enhancement)的深度学习模型。它能够从嘈杂的背景中提取纯净的人声,有效消除环境噪音。对于开发者而言,该模型特别适用于语音识别(ASR)的前处理环节...
JorisCos 语音分离
11.2K 0

BSRoformer GGUF

Apache-2.0
BSRoformer GGUF 是一款专注于语音增强和噪声消除的音频模型。它通过 GGUF 格式化,极大降低了运行门槛,使得开发者和爱好者无需昂贵的 GPU 也能在本地设备上高效运行。该模型擅长将嘈杂环境中的人声精准提取,有效去除背景噪音,...
chenmozhijin 语音分离
9.3K 0

metricgan plus voicebank

apache-2.0
MetricGAN+ VoiceBank 是由 SpeechBrain 团队开发的一款专注于语音质量增强的深度学习模型。它不同于传统的语音合成,而是通过对抗学习机制来预测语音的客观质量得分(如 PESQ),从而引导模型对受损语音进行修复。对...
speechbrain 语音分离
1.1K 0

neucodec

apache-2.0
NeuCodec 是一款由 Neuphonic 推出的高效音频编解码模型,专注于实现极高压缩比下的高质量音频还原。与传统的音频压缩工具不同,它采用神经音频编解码技术,能够将音频信号压缩至极小尺寸且在解码后保持极高的保真度。对于开发者而言,它...
neuphonic 语音分离
269 0

distill neucodec

apache-2.0
Distill NeuCodec 是由 Neuphonic 推出的音频编解码模型,专注于高效的音频压缩与重建。与传统的音频压缩方案不同,它利用神经编码技术在极低比特率下依然能保持极高还原度的音质,有效解决了音频传输中的带宽压力与质量损耗之间...
neuphonic 语音分离
90 0

MioCodec 25Hz 44.1kHz v2

mit
MioCodec 25Hz 44.1kHz v2 是一款专注于音频编解码的轻量化模型。它采用了较低的采样频率(25Hz)进行特征表征,同时支持 44.1kHz 的高保真音频输出,旨在实现高效的音频压缩与重建。对于开发者而言,该模型适合用于语...
Aratako 语音分离
47 0

MioCodec 25Hz 24kHz

mit
MioCodec 25Hz 24kHz 是一款由 Aratako 提供的轻量级音频编解码模型,专注于高效的音频信号处理。它采用了 25Hz 的低采样率量化和 24kHz 的高质量重构,在保证音频还原度的同时极大地压缩了数据量。对于开发者而言...
Aratako 语音分离
45 0