模型分类

AI 模型广场

探索最新最热门的 AI 模型,涵盖 LLM、视觉、音频等多种类型,助你选型与集成。

whisper large v3 turbo

mit
Whisper large-v3-turbo 是 OpenAI 推出的语音识别加速版模型。它在保持 v3 强悍的多语言识别和翻译能力的同时,通过优化解码速度,极大地降低了推理延迟。对于开发者而言,它解决了原版 large 模型部署成本高、实...
openai 语音识别
7.9M 0

whisper base

apache-2.0
Whisper Base 是 OpenAI 开源的语音识别模型中的轻量化版本。它在保持较高识别准确率的同时,极大地降低了计算资源占用,非常适合在个人电脑甚至边缘设备上本地部署。对于中国开发者来说,它不仅能高效地将语音转为文字,还能处理多种语...
openai 语音识别
3.1M 0

whisper small

apache-2.0
Whisper Small 是 OpenAI 开源的语音识别模型中的“轻量级选手”。它在识别精度和运行速度之间取得了极佳的平衡,能够高效地将多语言语音转写为文本。对于中国开发者而言,它非常适合部署在消费级 GPU 甚至部分高性能 CPU 上...
openai 语音识别
2.6M 0

wav2vec2 indonesian javanese sundanese

apache-2.0
这是一个基于 wav2vec2 架构的专项语音识别模型,专注于印尼语及其主要方言(爪哇语和巽他语)的转写。对于需要处理东南亚多语种语音数据的开发者来说,它解决了通用模型在印尼地方语言上识别率低的问题。该模型上手门槛较低,可通过 Huggin...
indonesian-nlp 语音识别
2.2M 0

Qwen3 ASR 1.7B

apache-2.0
Qwen3 ASR 1.7B 是阿里通义千问团队推出的轻量级自动语音识别模型。它在保持极小参数规模的同时,优化了语音到文本的转换效率,非常适合部署在端侧设备或对响应延迟要求极高的实时场景中。对于开发者而言,该模型上手门槛低,可作为语音助手、...
Qwen 语音识别
675.6K 162

Qwen3 ASR 0.6B

apache-2.0
Qwen3 ASR 0.6B 是阿里通义千问团队推出的轻量级语音识别模型。虽然参数量仅 0.6B,但它在保持极低推理成本的同时,实现了高效的语音转文字能力。对于开发者而言,这款模型非常适合部署在端侧设备或作为大规模语音处理管线的预处理模块。...
Qwen 语音识别
168.8K 46

speaker diarization 3.1

mit
Speaker Diarization 3.1 是由 pyannote 团队推出的专业级“说话人日志”模型,简单来说就是解决“谁在什么时候说了什么”的问题。它不同于传统的语音转文字(ASR),而是专注于音频中的身份切分。对于需要处理多人会议...
pyannote 语音识别
23.2K 11

speaker diarization community 1

cc-by-4.0
Speaker Diarization Community 1 是一款由 pyannote 提供的开源说话人日志(Diarization)模型,简单来说就是解决“谁在什么时候说了什么”的问题。它不像传统的 ASR 仅将语音转为文字,而是能精...
pyannote 语音识别
5.8K 1

Voxtral Mini 4B Realtime 2602

apache-2.0
Voxtral Mini 4B Realtime 2602 是一款由 Mistral AI 推出的轻量级实时语音识别(ASR)模型。它主打低延迟和高响应速度,旨在将语音实时转化为文本。对于开发者而言,该模型在端侧部署或实时交互场景(如语音助...
mistralai 语音识别
2.9K 4

wav2vec2 large xlsr 53 japanese

apache-2.0
这是一个基于 Meta 的 wav2vec 2.0 架构并经过大规模多语言预训练(XLSR-53)的日语语音识别模型。它采用了自监督学习机制,能够高效地将日语语音转化为文本。对于开发者而言,该模型在处理日语口语识别、会议记录转写等场景时表现...
jonatasgrosman 语音识别
2.0K 0

wav2vec2 large xlsr 53 dutch

apache-2.0
这是一个基于 Facebook wav2vec 2.0 架构并经过大规模跨语言预训练(XLSR-53)的荷兰语语音识别模型。它专注于将荷兰语语音高效转化为文本,适合需要处理荷兰语语音数据的开发者。由于采用了自监督学习预训练,该模型在小规模标...
jonatasgrosman 语音识别
2.0K 0

wav2vec2 large xlsr 53 portuguese

apache-2.0
这是一个基于 Meta 的 wav2vec 2.0 架构,针对葡萄牙语进行微调的开源语音识别(ASR)模型。它采用了 XLS-R 跨语言预训练权重,这意味着它在处理语音信号时具有更强的鲁棒性,能够将葡萄牙语语音高效地转化为文本。对于需要处理...
jonatasgrosman 语音识别
2.0K 0

voice activity detection

mit
pyannote 的 VAD(语音活动检测)是一个专注于从音频流中精准剔除静音和背景噪音、仅保留人声片段的轻量级工具。对于开发者来说,它不是一个完整的语音转文字模型,而是 ASR(语音识别)流程中的关键预处理步骤。通过在进入大模型识别前先过...
pyannote 语音识别
1.9K 0

wav2vec2 large xlsr 53 russian

apache-2.0
这是一个基于 Meta wav2vec 2.0 架构的俄语语音识别(ASR)模型,采用了 XLS-R 跨语言预训练技术。它专门针对俄语进行了微调,能够将语音信号高效转化为文本。对于需要处理俄语语音转写、构建语音助手或进行多语言数据集标注的开...
jonatasgrosman 语音识别
1.8K 0

wav2vec2 large xlsr 53 polish

apache-2.0
这是一个基于 Facebook wav2vec 2.0 架构并经过大规模多语言预训练(XLSR-53)的波兰语语音识别模型。它通过自监督学习在海量无标注音频上习得通用特征,再针对波兰语进行微调,能将语音高效转化为文本。对于需要处理波兰语语音...
jonatasgrosman 语音识别
1.4K 0

whisperkit coreml

Apache-2.0
WhisperKit CoreML 是将 OpenAI 的 Whisper 语音识别模型针对苹果生态深度优化的版本。它通过 Core ML 框架,让模型能高效调用 iPhone、iPad 和 Mac 的 NPU(神经网络引擎),在保证识别精...
argmaxinc 语音识别
274 0