silero vad coreml

提供商FluidInference
分类voice-activity-detection
许可证mit
下载量31.4K
星标0

简介

Silero VAD CoreML 是专为苹果生态优化的语音活动检测模型。它能高效地从音频流中实时分辨“有人在说话”还是“环境静默”,且由于采用了 CoreML 加速,在 iOS 和 macOS 设备上运行功耗极低,响应极快。对于开发者来说,它解决了语音识别前置过滤的痛点,无需将音频传到云端即可在本地完成精准截断,是构建离线语音助手、实时字幕或录音精简工具的理想预处理组件,上手门槛低且部署便捷。

核心亮点

  • 原生 CoreML 加速,极低功耗运行于苹果设备
  • 毫秒级实时检测,精准区分人声与环境噪音
  • 本地离线处理,无需联网,保障用户隐私
  • MIT 协议开源,适合快速集成至各类 App

使用方法

安装依赖
# 安装 Hugging Face transformers
pip install transformers torch
SDK 使用
# 使用 transformers 加载模型
from transformers import AutoModel, AutoTokenizer

model = AutoModel.from_pretrained("FluidInference/silero-vad-coreml")
tokenizer = AutoTokenizer.from_pretrained("FluidInference/silero-vad-coreml")

Hugging Face 下载

我们推荐使用命令行或者 Hugging Face Hub SDK 来进行模型的下载。

操作指引:在下载前,请先通过如下命令安装 huggingface_hub:

操作指引
pip install -U huggingface_hub

命令行下载

下载完整模型库

下载完整模型库
huggingface-cli download FluidInference/silero-vad-coreml

下载单个文件到指定本地文件夹(以下载 config.json 到当前路径下 ./dir 目录为例)

下载单个文件到指定本地文件夹(以下载 config.json 到当前路径下 ./dir 目录为例)
huggingface-cli download FluidInference/silero-vad-coreml config.json --local-dir ./dir

更多命令行下载选项,可参见官方文档

SDK 下载

SDK 下载
# 模型下载
from huggingface_hub import snapshot_download
model_dir = snapshot_download('FluidInference/silero-vad-coreml')

Git 下载

请确保 lfs 已经被正确安装

Git 下载
git lfs install
git clone https://huggingface.co/FluidInference/silero-vad-coreml

如果您希望跳过 lfs 大文件下载,可以使用如下命令

跳过 LFS
GIT_LFS_SKIP_SMUDGE=1 git clone https://huggingface.co/FluidInference/silero-vad-coreml

模型文件托管在 Hugging Face Hub,使用 HF CLI / SDK / Git 直接下载,不经过本站。

PyTorch / Transformers 使用

安装 Transformers

安装 Transformers
pip install -U transformers torch

模型加载和推理

模型加载和推理
from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained('FluidInference/silero-vad-coreml')
tokenizer = AutoTokenizer.from_pretrained('FluidInference/silero-vad-coreml')

完整文档

来源: HuggingFace

---
license: mit
tags:

  • audio

  • voice-activity-detection

  • coreml

  • silero

  • speech

  • ios

  • macos

  • swift

library_name: coreml
pipeline_tag: voice-activity-detection
datasets:
  • alexwengg/musan_mini50

  • alexwengg/musan_mini100

metrics:
  • accuracy

  • f1

language:
  • en

base_model:
  • onnx-community/silero-vad

---

<span style="color:#5DAF8D">🧃 CoreML Silero VAD </span>

![Discord](https://discord.gg/WNsvaCtmDe) ![GitHub Repo stars](https://github.com/FluidInference/FluidAudio)

A CoreML implementation of the Silero Voice Activity
Detection (VAD) model, optimized for Apple platforms
(iOS/macOS). This repository contains pre-converted
CoreML models ready for use in Swift applications.

See FluidAudio Repo link at the top for more information

Model Description

Developed by: Silero Team (original), converted by
FluidAudio

Model type: Voice Activity Detection

License: MIT

Parent Model:
silero-vad

This is how the model performs against the silero-vad v6.0.0 basline Pytorch JIT version

!graphs/yc_standard_comparison_20250915_205721_2c04b81.png
!graphs/yc_256ms_comparison_20250915_205721_2c04b81.png

Note that we tested the quantized versions, as the model is already tiny, theres no performance imporvement at all.

This is how the different models compare in terms of speed, the 256s takes in 8 chunks of 32ms and processes it in batches so its much faster
!graphs/yc_performance_20250915_205721_2c04b81.png

Conversion code is available here: FluidInference/mobius

Intended Use

Primary Use Cases

  • Real-time voice activity detection in iOS/macOS
applications
  • Speech preprocessing for ASR systems
  • Audio segmentation and filtering

How to Use

Citation

@misc{silero-vad-coreml,
title={CoreML Silero VAD},
author={FluidAudio Team},
year={2024},

url={https://huggingface.co/alexwengg/coreml-silero-vad}
}

@misc{silero-vad,
title={Silero VAD},
author={Silero Team},
year={2021},
url={https://github.com/snakers4/silero-vad}
}

  • GitHub: https://github.com/FluidAudio/FluidAudioSwift