Audio Models
Collection
20 items • Updated
Configuration Parsing Warning:Invalid JSON for config file config.json
流式语音端点识别
本仓库只放预编译产物,不放 C++ 源码(C++ SDK 源码如需交付请以 GitHub 源码仓库为准)。
| 产物 | 芯片 | NPU | 板子型号 |
|---|---|---|---|
| silero_vad_ax650.axmodel | AX650 | NPU3 | AX650N |
| silero_vad_ax630c.axmodel | AX620E | NPU2 | AX630C |
这两个 axmodel 也已打包进 silero-vad-axera(PyPI / GitHub),
load_silero_vad('ax650' | 'ax630c') 会直接使用;这里提供单独下载。
本仓库只支持 axmodel(NPU)推理(AX650 / AX630C),不再支持 onnx CPU 后端。
sudo apt install libsndfile1
pip install -r requirements.txt
python main.py --input demo.wav --backend ax650 --output_dir output # AX650 板
python main.py --input demo.wav --backend ax630c --output_dir output # AX620E/AX630C 板
被分段的语音后保存在output目录中
pip install gradio
python gradio_app.py
vad = StreamVAD(args.backend,
sensitivity=0.5,
silence_ms=200)
运行
for result in vad.run(audio, vad.sr):
if result:
print(result)
vad.sr 为模型采样率,固定 16000;run() 支持 16000 的整数倍采样率
(自动按比例换算帧长)。
result的格式为:
{
'start_ts': 语音开始的时间
'end_ts': 语音结束的时间
'audio': 语音数据
}
时间戳的格式可通过StreamVAD.datetime_format设置