ConvTasNet Libri1Mix enhsingle 16k

提供商JorisCos
分类audio-to-audio
许可证cc-by-sa-4.0
下载量11.2K
星标0

简介

ConvTasNet Libri1Mix 是一款专注于单通道语音增强(Speech Enhancement)的深度学习模型。它能够从嘈杂的背景中提取纯净的人声,有效消除环境噪音。对于开发者而言,该模型特别适用于语音识别(ASR)的前处理环节,通过提升输入音频的信噪比来提高识别准确率。由于其基于卷积时间分离网络架构,处理速度快且无需复杂的预处理,上手难度较低,是构建智能语音助手或音频修复工具的理想组件。

核心亮点

  • 高效去除背景噪声,还原纯净人声
  • 可作为 ASR 系统的前置降噪模块
  • 端到端处理,无需复杂的频谱变换
  • 适用于 16kHz 采样率的单通道音频

使用方法

安装依赖
# 安装 Hugging Face transformers
pip install transformers torch
SDK 使用
# 使用 transformers 加载模型
from transformers import AutoModel, AutoTokenizer

model = AutoModel.from_pretrained("JorisCos/ConvTasNet_Libri1Mix_enhsingle_16k")
tokenizer = AutoTokenizer.from_pretrained("JorisCos/ConvTasNet_Libri1Mix_enhsingle_16k")

Hugging Face 下载

我们推荐使用命令行或者 Hugging Face Hub SDK 来进行模型的下载。

操作指引:在下载前,请先通过如下命令安装 huggingface_hub:

操作指引
pip install -U huggingface_hub

命令行下载

下载完整模型库

下载完整模型库
huggingface-cli download JorisCos/ConvTasNet_Libri1Mix_enhsingle_16k

下载单个文件到指定本地文件夹(以下载 config.json 到当前路径下 ./dir 目录为例)

下载单个文件到指定本地文件夹(以下载 config.json 到当前路径下 ./dir 目录为例)
huggingface-cli download JorisCos/ConvTasNet_Libri1Mix_enhsingle_16k config.json --local-dir ./dir

更多命令行下载选项,可参见官方文档

SDK 下载

SDK 下载
# 模型下载
from huggingface_hub import snapshot_download
model_dir = snapshot_download('JorisCos/ConvTasNet_Libri1Mix_enhsingle_16k')

Git 下载

请确保 lfs 已经被正确安装

Git 下载
git lfs install
git clone https://huggingface.co/JorisCos/ConvTasNet_Libri1Mix_enhsingle_16k

如果您希望跳过 lfs 大文件下载,可以使用如下命令

跳过 LFS
GIT_LFS_SKIP_SMUDGE=1 git clone https://huggingface.co/JorisCos/ConvTasNet_Libri1Mix_enhsingle_16k

模型文件托管在 Hugging Face Hub,使用 HF CLI / SDK / Git 直接下载,不经过本站。

PyTorch / Transformers 使用

安装 Transformers

安装 Transformers
pip install -U transformers torch

模型加载和推理

模型加载和推理
from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained('JorisCos/ConvTasNet_Libri1Mix_enhsingle_16k')
tokenizer = AutoTokenizer.from_pretrained('JorisCos/ConvTasNet_Libri1Mix_enhsingle_16k')

完整文档

来源: HuggingFace

---
tags:

  • asteroid

  • audio

  • ConvTasNet

  • audio-to-audio

datasets:
  • Libri1Mix

  • enh_single

license: cc-by-sa-4.0
---

Asteroid model JorisCos/ConvTasNet_Libri1Mix_enhsignle_16k

Description:

This model was trained by Joris Cosentino using the librimix recipe in Asteroid.
It was trained on the enh_single task of the Libri1Mix dataset.

Training config:

yml
data:
  n_src: 1
  sample_rate: 16000
  segment: 3
  task: enh_single
  train_dir: data/wav16k/min/train-360
  valid_dir: data/wav16k/min/dev
filterbank:
  kernel_size: 32
  n_filters: 512
  stride: 16
masknet:
  bn_chan: 128
  hid_chan: 512
  mask_act: relu
  n_blocks: 8
  n_repeats: 3
  n_src: 1
  skip_chan: 128
optim:
  lr: 0.001
  optimizer: adam
  weight_decay: 0.0
training:
  batch_size: 6
  early_stop: true
  epochs: 200
  half_lr: true
  num_workers: 4

Results:

On Libri1Mix min test set :

yml
si_sdr: 14.743051006476085
si_sdr_imp: 11.293269700616385
sdr: 15.300522933671061
sdr_imp: 11.797860134458015
sir: Infinity
sir_imp: NaN
sar: 15.300522933671061
sar_imp: 11.797860134458015
stoi: 0.9310514162434267
stoi_imp: 0.13513159270288563

License notice:

This work "ConvTasNet_Libri1Mix_enhsignle_16k" is a derivative of LibriSpeech ASR corpus by Vassil Panayotov,
used under CC BY 4.0; of The WSJ0 Hipster Ambient Mixtures
dataset by Whisper.ai, used under CC BY-NC 4.0 (Research only).
"ConvTasNet_Libri1Mix_enhsignle_16k" is licensed under Attribution-ShareAlike 3.0 Unported by Joris Cosentino