SenseVoice-Small ONNX 量化版部署与 Gradio 使用记录
环境准备
先确认机器能跑得动。这个版本对环境要求不算高,但也别指望一台内存紧张的老机器顺手就能把模型和前端一起扛起来。
- 操作系统:Linux(Ubuntu 18.04+)、Windows 10+ 或 macOS
- Python 版本:Python 3.8 或更高
- 内存:至少 4GB,实际使用里 8GB 会舒服很多
- 存储空间:预留约 2GB 给模型文件和缓存
如果本机还没装 Python,可以去 Python 官网 下载对应安装包。
安装依赖
在终端或命令提示符里执行:
# 安装 ModelScope 和 Gradio
pip install modelscope gradio
# 安装音频处理相关库
pip install soundfile librosa
# 安装 ONNX 运行时(如果尚未安装)
pip install onnxruntime
这几个库各司其职:modelscope 负责拉起模型,gradio 提供网页界面,soundfile 和 librosa 处理音频,onnxruntime 则是量化版 ONNX 模型真正跑起来的关键。
启动 Gradio 界面
SenseVoice-Small 已经带了现成的 WebUI,启动方式比较直接:
# 进入 webui.py 所在目录(通常在/usr/local/bin/)
cd /usr/local/bin/
# 启动 Gradio 界面
python webui.py
启动后终端会看到类似输出:
Running on local URL: http://127.0.0.1:7860
这就说明服务起来了。直接用浏览器打开这个地址就行。
第一次跑通常会多等一会儿,因为模型要先下载到本地。这个过程慢一点很正常,等它缓存完,后面启动会快得多。
在界面里做语音识别
打开 http://127.0.0.1:7860 后,界面里主要就这几块:示例音频、上传音频、录音、识别按钮。没什么花活,够用。
示例音频
这是最省事的入口。点一个示例,系统会自动载入音频,再点'开始识别'即可。适合先确认模型和前端都没问题。
上传本地音频
如果你有自己的文件,直接上传就行。常见的 MP3、WAV 这类格式基本都能处理。上传完点'开始识别',结果会显示在右侧。
实时录音
浏览器里点'点击录音',授权麦克风权限后就能直接录。录完停止,再点'开始识别'。这个方式更适合临时测试,但麦克风质量一般的话,识别结果也会跟着飘。
识别结果怎么看
识别完成后,页面会返回富文本格式的结果,常见内容包括:
- 文字内容:转写出来的文本
- 情感标识:说话时的情感状态
- 事件标记:笑声、掌声之类的声音事件
- :如果开启了对应能力,会显示片段时间信息

