模型分类

AI 模型广场

探索最新最热门的 AI 模型,涵盖 LLM、视觉、音频等多种类型,助你选型与集成。

ast finetuned audioset 10 10 0.4593

bsd-3-clause
这是一个基于 AST (Audio Spectrogram Transformer) 架构并在 AudioSet 数据集上微调的音频分类模型。它将音频信号转化为频谱图,利用 Transformer 的全局注意力机制来识别声音类别,在环境音识...
MIT 音频分类
1.3M 0

wav2vec2 large xlsr 53 gender recognition librispeech

apache-2.0
这是一个基于 Meta 的 wav2vec2-large-xlsr-53 预训练模型微调而来的性别识别工具。它利用了强大的跨语言语音表征能力,专门针对 LibriSpeech 数据集进行了优化,能够从音频片段中高效提取声学特征以判断说话者性...
alefiury 音频分类
639.4K 0

gender cls svm ecapa voxceleb

apache-2.0
这是一个基于 ECAPA-TDNN 架构并在 VoxCeleb 数据集上预训练的性别分类模型。它将语音识别中先进的声纹特征提取能力应用于性别判定,能够高效地从音频片段中分辨男女声。对于需要快速集成语音预处理流程的开发者来说,该模型上手难度极...
griko 音频分类
347.5K 0

voice gender classifier

mit
这是一个轻量级的音频分类模型,专注于通过语音特征自动识别说话者的性别。对于需要处理大量语音数据的开发者来说,它能快速实现性别标签的自动化标注,而无需人工听写。该模型上手门槛极低,非常适合集成到用户画像分析、智能客服分流或语音交互系统的预处理...
JaesungHuh 音频分类
330.0K 0

hubert large speech emotion recognition russian dusha finetuned

apache-2.0
这是一个基于 HuBERT-Large 预训练模型、针对俄语语音情感识别(SER)进行微调的专项模型。它专注于从俄语语音片段中提取情绪特征,能够识别说话者的情感状态。对于需要处理俄语音频分析、智能客服情感监控或多语言语音交互的开发者来说,这...
xbgoose 音频分类
251.5K 0

clap htsat fused

apache-2.0
CLAP HTSAT Fused 是一款由 LAION 推出的音频分类模型,它通过融合 HTSAT 架构,显著增强了对复杂声音信号的表征能力。与传统的音频处理工具不同,它专注于将音频片段映射到语义空间,能够高效识别环境音、语音及音乐等多种音...
laion 音频分类
6.9K 2

Common Voice Gender Detection

apache-2.0
Common Voice Gender Detection 是一个专注于音频性别识别的轻量级分类模型。它基于 Mozilla 的 Common Voice 开源数据集训练,能够快速分析语音片段并判断说话者的性别。对于需要处理大量语音数据的开...
prithivMLmods 音频分类
2.8K 0

lang id voxlingua107 ecapa

apache-2.0
VoxLingua107 ECAPA 是由 SpeechBrain 团队推出的语言识别模型,专门用于从音频片段中自动检测说话人的语言种类。它基于强大的 ECAPA-TDNN 架构,能够高效提取语音特征,在处理短音频时具有较强的鲁棒性。对于需...
speechbrain 音频分类
1.1K 0

audiobox aesthetics

cc-by-4.0
Audiobox Aesthetics 是由 Meta (Facebook) 开发的一款专注于音频质量评估的分类模型。与传统的语音识别或生成模型不同,它更像是一个“音频品鉴师”,能够量化分析音频的听感质量、自然度及美学特征。对于需要自动化筛...
facebook 音频分类
379 0

ced gguf

apache-2.0
Ced GGUF 是一款轻量级的音频分类模型,采用 GGUF 格式以优化在本地端侧的推理性能。它专注于音频信号的类别识别,适合需要快速部署在个人电脑或边缘设备上的开发者。由于采用了量化格式,它极大地降低了对内存的依赖,无需昂贵的 GPU 即...
mudler 音频分类
32 0