这是一个基于 AST (Audio Spectrogram Transformer) 架构并在 AudioSet 数据集上微调的音频分类模型。它将音频信号转化为频谱图,利用 Transformer 的全局注意力机制来识别声音类别,在环境音识...
MIT
音频分类
1.3M
0
这是一个基于 Meta 的 wav2vec2-large-xlsr-53 预训练模型微调而来的性别识别工具。它利用了强大的跨语言语音表征能力,专门针对 LibriSpeech 数据集进行了优化,能够从音频片段中高效提取声学特征以判断说话者性...
alefiury
音频分类
639.4K
0
这是一个基于 ECAPA-TDNN 架构并在 VoxCeleb 数据集上预训练的性别分类模型。它将语音识别中先进的声纹特征提取能力应用于性别判定,能够高效地从音频片段中分辨男女声。对于需要快速集成语音预处理流程的开发者来说,该模型上手难度极...
griko
音频分类
347.5K
0
这是一个轻量级的音频分类模型,专注于通过语音特征自动识别说话者的性别。对于需要处理大量语音数据的开发者来说,它能快速实现性别标签的自动化标注,而无需人工听写。该模型上手门槛极低,非常适合集成到用户画像分析、智能客服分流或语音交互系统的预处理...
JaesungHuh
音频分类
330.0K
0
这是一个基于 HuBERT-Large 预训练模型、针对俄语语音情感识别(SER)进行微调的专项模型。它专注于从俄语语音片段中提取情绪特征,能够识别说话者的情感状态。对于需要处理俄语音频分析、智能客服情感监控或多语言语音交互的开发者来说,这...
xbgoose
音频分类
251.5K
0
CLAP HTSAT Fused 是一款由 LAION 推出的音频分类模型,它通过融合 HTSAT 架构,显著增强了对复杂声音信号的表征能力。与传统的音频处理工具不同,它专注于将音频片段映射到语义空间,能够高效识别环境音、语音及音乐等多种音...
laion
音频分类
6.9K
2
Common Voice Gender Detection 是一个专注于音频性别识别的轻量级分类模型。它基于 Mozilla 的 Common Voice 开源数据集训练,能够快速分析语音片段并判断说话者的性别。对于需要处理大量语音数据的开...
prithivMLmods
音频分类
2.8K
0
VoxLingua107 ECAPA 是由 SpeechBrain 团队推出的语言识别模型,专门用于从音频片段中自动检测说话人的语言种类。它基于强大的 ECAPA-TDNN 架构,能够高效提取语音特征,在处理短音频时具有较强的鲁棒性。对于需...
speechbrain
音频分类
1.1K
0
Audiobox Aesthetics 是由 Meta (Facebook) 开发的一款专注于音频质量评估的分类模型。与传统的语音识别或生成模型不同,它更像是一个“音频品鉴师”,能够量化分析音频的听感质量、自然度及美学特征。对于需要自动化筛...
facebook
音频分类
379
0
Ced GGUF 是一款轻量级的音频分类模型,采用 GGUF 格式以优化在本地端侧的推理性能。它专注于音频信号的类别识别,适合需要快速部署在个人电脑或边缘设备上的开发者。由于采用了量化格式,它极大地降低了对内存的依赖,无需昂贵的 GPU 即...
mudler
音频分类
32
0