全球 AI 聊天室 · 现在 16 人在线 进去聊聊
DIRECTORY / 02

AI 模型广场|开源大模型与 LLM 目录

开源大模型和多模态模型目录:看能力、参数规模、许可证、下载量和来源页,方便对比 Qwen、Llama 等怎么选、怎么部署。PromptCube 模型广场持续收录。

比较模型为你的下一个工作流找到合适的选择
目录概览
15
已收录条目
24 个主题分类持续更新
02 / MODEL INDEX

找到适合任务的模型

先看清楚,再做选择。每个条目都保留关键上下文。

精选目录15 个结果

Whisper Large V3

OpenAI
1.5B

Whisper Large V3 是 OpenAI 推出的语音识别(ASR)领域“天花板”级开源模型。相比前代,它在处理复杂环境噪音、多语种混杂以及方言识别上有了显著的鲁棒性提升。对于开发者来说,它最大的价值在于其极高的准确率和开源特性,你可以将其轻松集成到自己的语音转文字工具、视频字幕生成器或会议纪要插件中。虽然 1.5B 的参数量对显存有一定的要求,但通过 Faster-Whisper 等优化版本,在消费级显卡甚至高性能 CPU 上也能实现流畅运行。如果你正在寻找一个能够替代商业付费 API、且能高度定制化的语音识别引擎,V3 是目前的首选方案。

automatic speech recognitionMIT
5.5K 星标查看详情

Whisper Small 模型

OpenAI
244M

Whisper Small 是 OpenAI 推出的轻量化语音识别模型,在性能与资源消耗之间找到了极佳的平衡点。相比于参数量巨大的 Large 版本,Small 模型仅有 2.44 亿参数,这意味着它不仅推理速度极快,而且对硬件要求极低,非常适合部署在个人电脑、移动端甚至各类边缘计算设备上。它在处理日常对话、播客转录以及视频字幕生成等任务时,准确度依然能维持在较高水准。对于开发者而言,它是一个理想的“生产力工具”,既能保证识别的鲁棒性,又不会像大模型那样让算力成本飙升,是构建实时语音交互应用或离线转录工具的首选基座。

automatic speech recognitionMIT
3.8K 星标查看详情

speaker-diarization-3.1

pyannote
Not specified

Speaker Diarization 3.1 是由 pyannote 团队推出的专业级“说话人日志”模型,简单来说就是解决“谁在什么时候说了什么”的问题。它不同于传统的语音转文字(ASR),而是专注于音频中的身份切分。对于需要处理多人会议记录、访谈转录的开发者来说,它是极佳的预处理工具,可以与 Whisper 等 ASR 模型配合使用,将原本混在一起的文字流精准地标注出不同发言人。该模型采用 MIT 协议,上手难度中等,适合集成到自动化办公或智能录音分析工作流中。

automatic speech recognitionmit
3.7K 星标查看详情

speaker-diarization-community-1

pyannote
Not specified

Speaker Diarization Community 1 是一款由 pyannote 提供的开源说话人日志(Diarization)模型,简单来说就是解决“谁在什么时候说了什么”的问题。它不像传统的 ASR 仅将语音转为文字,而是能精准识别音频中不同说话人的身份并进行切分。该模型非常适合处理会议记录、访谈录音等多角色对话场景。对于开发者而言,它能与 Whisper 等语音转文字工具完美配合:先用此模型区分说话人,再用 ASR 转写,从而实现带角色标签的完整对话文本,上手难度中等,是构建专业语音分析流水线的核心组件。

automatic speech recognitioncc-by-4.0
1.9K 星标查看详情

Qwen3-ASR-1.7B

Qwen
Not specified

Qwen3 ASR 1.7B 是阿里通义千问团队推出的轻量级自动语音识别模型。它在保持极小参数规模的同时,优化了语音到文本的转换效率,非常适合部署在端侧设备或对响应延迟要求极高的实时场景中。对于开发者而言,该模型上手门槛低,可作为语音助手、会议纪要或实时字幕功能的底层组件。相比于体积庞大的通用模型,它在特定 ASR 任务上提供了更好的能效比,是构建轻量化语音交互应用的理想选择。

automatic speech recognitionapache-2.0
1.1K 星标查看详情

Voxtral-Mini-4B-Realtime-2602

mistralai
Not specified

Voxtral Mini 4B Realtime 2602 是一款由 Mistral AI 推出的轻量级实时语音识别(ASR)模型。它主打低延迟和高响应速度,旨在将语音实时转化为文本。对于开发者而言,该模型在端侧部署或实时交互场景(如语音助手、会议实时转写)中具有很高的实用价值。由于参数量较小且采用 Apache-2.0 开源协议,它在保证识别准确率的同时,极大地降低了计算资源开销,上手门槛低,非常适合集成到需要快速反馈的 AI 工作流中。

automatic speech recognitionapache-2.0
986 星标查看详情

Qwen3-ASR-0.6B

Qwen
Not specified

Qwen3 ASR 0.6B 是阿里通义千问团队推出的轻量级语音识别模型。虽然参数量仅 0.6B,但它在保持极低推理成本的同时,实现了高效的语音转文字能力。对于开发者而言,这款模型非常适合部署在端侧设备或作为大规模语音处理管线的预处理模块。它不像大型多模态模型那样臃肿,上手门槛极低,能够快速集成到实时转写、会议记录等实际业务场景中,是追求响应速度与资源占用平衡的理想选择。

automatic speech recognitionapache-2.0
342 星标查看详情

voice-activity-detection

pyannote
Not specified

pyannote 的 VAD(语音活动检测)是一个专注于从音频流中精准剔除静音和背景噪音、仅保留人声片段的轻量级工具。对于开发者来说,它不是一个完整的语音转文字模型,而是 ASR(语音识别)流程中的关键预处理步骤。通过在进入大模型识别前先过滤掉无意义的空白段,能显著降低 API 调用成本并提升识别效率。该模型上手简单,支持 MIT 开源协议,非常适合集成到会议记录、智能客服等需要实时监测说话状态的本地化场景中。

automatic speech recognitionmit
241 星标查看详情

whisperkit-coreml

argmaxinc
Not specified

WhisperKit CoreML 是将 OpenAI 的 Whisper 语音识别模型针对苹果生态深度优化的版本。它通过 Core ML 框架,让模型能高效调用 iPhone、iPad 和 Mac 的 NPU(神经网络引擎),在保证识别精度几乎不打折的前提下,大幅降低了端侧运行的功耗并提升了推理速度。对于开发者来说,它解决了原版模型在 iOS/macOS 上部署时内存占用高、发热严重的问题,非常适合构建需要离线语音转文字、实时字幕或隐私敏感的本地 AI 应用,上手门槛较低,可直接集成到 Swift 项目中。

automatic speech recognitionmit
228 星标查看详情

mms-300m-1130-forced-aligner

MahmoudAshraf
Not specified

mms-300m-1130-forced-aligner 是一个面向语音识别任务的开源模型,由MahmoudAshraf发布于Hugging Face,隶属自动语音识别(ASR)类别。该模型主要用于语音到文本的转录与对齐场景,特别是在需要将语音信号精确匹配到对应文本时间戳的应用中表现出色。它基于常见的transformers框架,用户可通过Hugging Face的接口方便地加载与调用,适配多种 Python 环境。由于参数量未公开,推理资源占用有待实测,但其命名中的“forced-aligner”提示表明其在语音对齐领域具有潜在优势。需要注意的是,该模型遵循CC-BY-NC 4.0许可,仅允许非商业用途,故在商业项目中需谨慎评估。总体而言,mms-300m-1130-forced-aligner 更适合研究人员或开发者在语音处理实验、音频字幕生成等非商业场景中使用。

automatic speech recognitioncc-by-nc-4.0
103 星标查看详情

wav2vec2-large-xlsr-53-japanese

jonatasgrosman
Not specified

这是一个基于 Meta 的 wav2vec 2.0 架构并经过大规模多语言预训练(XLSR-53)的日语语音识别模型。它采用了自监督学习机制,能够高效地将日语语音转化为文本。对于开发者而言,该模型在处理日语口语识别、会议记录转写等场景时表现稳健,且由于基于 Hugging Face 生态,上手门槛极低,可通过几行代码快速集成到 Python 项目中。相比于闭源的 API 服务,它提供了更好的私有化部署灵活性,是构建日语 ASR 应用的理想基准模型。

automatic speech recognitionapache-2.0
87 星标查看详情

wav2vec2-large-xlsr-53-russian

jonatasgrosman
Not specified

这是一个基于 Meta wav2vec 2.0 架构的俄语语音识别(ASR)模型,采用了 XLS-R 跨语言预训练技术。它专门针对俄语进行了微调,能够将语音信号高效转化为文本。对于需要处理俄语语音转写、构建语音助手或进行多语言数据集标注的开发者来说,这是一个极佳的开源选择。该模型在 Hugging Face 上易于部署,通过 Transformers 库即可快速上手,无需从零训练,极大降低了俄语语音处理的门槛。

automatic speech recognitionapache-2.0
77 星标查看详情

wav2vec2-large-xlsr-53-portuguese

jonatasgrosman
Not specified

这是一个基于 Meta 的 wav2vec 2.0 架构,针对葡萄牙语进行微调的开源语音识别(ASR)模型。它采用了 XLS-R 跨语言预训练权重,这意味着它在处理语音信号时具有更强的鲁棒性,能够将葡萄牙语语音高效地转化为文本。对于需要处理葡语语音转写、构建语音助手或进行多语言数据集分析的开发者来说,这是一个极佳的轻量化选择。由于其基于 Hugging Face 生态,上手难度低,可以通过 Transformers 库快速集成到现有 Python 工作流中,无需从零开始训练。

automatic speech recognitionapache-2.0
58 星标查看详情

wav2vec2-large-xlsr-53-arabic

jonatasgrosman
Not specified

如果你正在开发针对阿拉伯语市场的语音应用,这款由 jonatasgrosman 发布的 wav2vec2-large-xlsr-53-arabic 模型是不错的选择。它基于 Meta 的 XLSR-53 架构,通过大规模多语言预训练,专门针对阿拉伯语的语音识别(ASR)进行了微调。相比于通用的语音模型,它在处理阿拉伯语的语音转文字任务时,准确度和鲁棒性更强。上手难度方面,由于它完全兼容 Hugging Face 的 Transformers 库,开发者只需几行 Python 代码即可调用,非常适合集成到智能客服、语音笔记或翻译工具等实际业务场景中。不过,在生产环境落地前,建议针对特定方言进行小规模测试。

automatic speech recognitionapache-2.0
55 星标查看详情

faster-whisper-small

Systran
Not specified

如果你正在寻找一种既快又准的语音转文字方案,faster-whisper-small 是一个非常平衡的选择。它是对 OpenAI Whisper 模型的工程化重构,通过使用 CTranslate2 推理引擎,在保持了原版模型高精度识别能力的同时,大幅提升了推理速度并降低了显存占用。相比于原版 Whisper,它更适合部署在个人电脑或资源有限的服务器上进行实时或批量的语音转写任务。对于开发者来说,它的上手难度极低,可以无缝集成到各类自动化工作流中,是构建语音助手、会议记录工具或视频字幕生成插件的理想底层引擎。

automatic speech recognitionmit
52 星标查看详情