模型分类

AI 模型广场

探索最新最热门的 AI 模型,涵盖 LLM、视觉、音频等多种类型,助你选型与集成。

sepformer wham16k enhancement

apache-2.0
SepFormer WHAM16k 是一款由 SpeechBrain 团队开发的语音增强模型,专注于从嘈杂的环境背景中提取纯净的人声。它采用了先进的 Transformer 架构来处理时间-频率域的信号,能够有效抑制复杂的背景噪音并减少语音...
speechbrain 语音降噪
2.3K 0

sepformer dns4 16k enhancement

apache-2.0
SepFormer DNS4 16k 是一款由 SpeechBrain 提供的专业语音增强模型,专门用于从嘈杂的音频中分离并提取纯净的人声。它针对 16kHz 采样率进行了优化,能够有效抑制背景噪音和环境干扰。对于开发者而言,该模型非常适合...
speechbrain 语音降噪
563 0

sepformer whamr enhancement

apache-2.0
SepFormer WHAMR 是一款由 SpeechBrain 团队开发的语音增强模型,专注于从嘈杂的背景环境中提取纯净的人声。它采用了先进的 Transformer 架构来处理频谱分离,特别擅长处理复杂的真实场景噪声(如街道、餐厅等)。...
speechbrain 语音降噪
274 0

sepformer wham enhancement

apache-2.0
SepFormer WHAM Enhancement 是一款由 SpeechBrain 团队开发的语音增强模型,专注于从嘈杂的背景中提取清晰的人声。它采用了先进的 SepFormer 架构,能够有效处理复杂的真实场景噪声(如 WHAM 数据...
speechbrain 语音降噪
135 0

denoising model

apache-2.0
这是一个专注于语音增强(Speech Enhancement)的去噪模型,旨在通过算法剔除背景杂音,还原清晰的人声。对于需要处理嘈杂环境录音、提升播客质量或优化语音识别(ASR)前处理的开发者来说,它是一个实用的工具。该模型采用 Apach...
irfansyhptra 语音降噪
44 0

denoising diffusion implicit models

Apache-2.0
DDIM 是一种针对扩散模型的加速采样算法,旨在解决传统 DDPM 推理速度慢的痛点。它通过引入非马尔可夫过程,允许在生成过程中跳过部分步骤,从而在保持生成质量的同时,大幅提升采样效率。在语音增强场景下,DDIM 能快速剔除背景噪声并还原清...
keras-io 语音降噪
40 0

histlux ocr error denoising lrec

agpl-3.0
HistLux OCR Error Denoising LREC 是一款专注于历史文献数字化修复的专项模型。它并非通用 OCR,而是针对 OCR 识别后产生的噪声和错误进行“去噪”和校正。对于处理古籍、旧报纸等扫描件的开发者来说,该模型能有...
impresso-project 语音降噪
32 0

satellite denoising models

Apache-2.0
Satellite Denoising Models 是一类专注于卫星通信场景的语音增强模型。它旨在解决卫星通话中常见的背景噪声、信号干扰及低信噪比问题,将受损的语音信号还原为清晰的人声。对于需要处理远距离通信录音或开发卫星通信增强插件的开...
Krupa1420 语音降噪
31 0

DenoisingAutoencoder

Apache-2.0
DenoisingAutoencoder 是一款专注于语音增强(Speech Enhancement)的深度学习模型。它通过自编码器结构,能够有效地从嘈杂的音频信号中分离并还原纯净的人声。对于需要处理背景噪音、提升语音识别(ASR)准确率或...
Bmo411 语音降噪
23 0

speech enhancement sgmse

mit
SGMSE 是一款基于分数生成模型(Score-based Generative Models)的语音增强工具,旨在解决复杂环境下的噪声去除问题。与传统的谱减法或简单的滤波不同,它通过生成式方法重建纯净语音,能更有效地处理非平稳噪声,显著提...
sp-uhh 语音降噪
16 0

mpse smoe speech enhancement

mit
mpse-smoe 是一款专注于语音增强的轻量化模型,采用了高效的混合专家(MoE)架构。它旨在解决录音环境中的背景噪声干扰,在保持语音自然度的同时,通过动态激活参数来提升降噪质量。对于需要处理低质量音频、播客后期清理或实时语音增强的开发者...
AdityaRaikar 语音降噪
11 0

mt5 small denoising en es final

Apache-2.0
这是一个基于 mT5 架构的轻量级语音增强模型,专注于英语和西班牙语的去噪处理。它不同于传统的通用 LLM,而是一个专门用于提升音频质量的工具,能够有效滤除背景杂音,还原清晰的人声。对于开发者而言,该模型参数量小,部署压力低,非常适合集成到...
Eshan210352R 语音降噪
10 0

whisper small denoising

Apache-2.0
whisper small denoising 是一款基于 OpenAI Whisper 架构的语音增强模型,专门用于解决音频录制中的背景噪音问题。它并非用于语音转文字,而是在前处理阶段将嘈杂的音频“洗干净”,提升信噪比。对于经常处理嘈杂环...
Taeyeun72 语音降噪
9 0

Lightweight Speech Denoising.axera

mit
Lightweight Speech Denoising.axera 是一款由 AXERA-TECH 推出的轻量化语音去噪模型。它专注于在保证语音清晰度的前提下,高效剔除背景环境噪音,非常适合对实时性要求较高且计算资源受限的端侧设备。对于开...
AXERA-TECH 语音降噪
8 0

asl denoising.published.1

gpl-3.0
asl denoising.published.1 是一款专注于语音增强(Speech Enhancement)的轻量化模型,旨在将嘈杂环境中的人声从背景噪音中精准分离。对于开发者而言,它非常适合集成到实时语音通话、播客后期处理或智能家居语...
ilex-hub 语音降噪
8 0

unet speech enhancement

Apache-2.0
U-Net Speech Enhancement 是一款基于经典 U-Net 架构的语音增强模型,旨在通过深度学习手段从嘈杂的背景中提取纯净的人声。它通过编码器-解码器结构捕捉语音的时频特征,能够有效过滤环境噪音并降低回声,非常适合处理录音...
SSB258369 语音降噪
6 0

gemma 3 1b it ocr denoising en

Apache-2.0
Gemma 3 1B IT OCR Denoising EN 是一款基于 Google Gemma 3 轻量级架构的专项微调模型,核心能力在于对英文 OCR(光学字符识别)结果进行后处理去噪。它能有效识别并修正 OCR 扫描过程中产生的乱码...
ClemensK 语音降噪
6 0

speech enhancement mask unet

Apache-2.0
这是一个基于 Mask UNet 架构的语音增强模型,旨在通过掩码机制有效分离语音信号与背景噪声。与传统的滤波方法不同,它能更精准地在时频域还原人声,特别适合处理环境嘈杂的录音素材。对于开发者而言,该模型上手门槛较低,可作为语音预处理管线中...
huseinzol05 语音降噪
0 0

speech enhancement mask resnet unet

Apache-2.0
这是一个基于 Mask ResNet-UNet 架构的语音增强模型,旨在通过深度学习去除音频中的背景噪声。它结合了 UNet 的多尺度特征提取能力和 ResNet 的残差连接,能够更精准地构建掩码(Mask)来过滤噪声并还原纯净语音。对于需...
huseinzol05 语音降噪
0 0

speech enhancement mask resnet unet quantized

Apache-2.0
这是一个基于 Mask ResNet 和 UNet 架构的语音增强模型,并经过量化处理以优化推理速度。它专注于从嘈杂的音频信号中提取纯净的人声,通过掩码机制过滤背景噪声。相比于全精度模型,量化版本在保持核心降噪能力的同时,显著降低了内存占用...
huseinzol05 语音降噪
0 0