sherpa-onnx:手机与嵌入式端的离线语音推理框架
语音 AI 模型更新迭代非常快,Whisper、Moonshine、SenseVoice 几乎每个月都有新版本。但对开发者而言,选好模型只是第一步,真正的工程挑战在于如何把它跑在手机上、嵌入式设备上或浏览器里,以及如何在没有网络的环境下运行。
sherpa-onnx 是 next-gen Kaldi 团队开源的语音推理部署框架(Apache 2.0 协议),它的核心定位很明确:将多种语音模型统一转成 ONNX 格式,部署到各类平台上。最新版 v1.12.29 于 3 月 12 日发布,支持 12 项语音功能、12 种编程语言,覆盖从服务器到嵌入式设备的全场景。
功能覆盖:不止是识别
sherpa-onnx 的功能矩阵远不止 ASR 识别,它覆盖了 12 项核心能力:
| 功能 | 说明 |
|---|---|
| 语音识别(ASR) | 流式 + 非流式两种模式 |
| 语音合成(TTS) | 支持多种 TTS 引擎 |
| 说话人分离 | 多说话人场景处理 |
| 说话人识别 | 声纹匹配 |
| 说话人验证 | 一对一声纹确认 |
| 语种识别 | 自动检测语言 |
| 语音活动检测(VAD) | 基于 silero-vad 轻量级模型 |
| 关键词检测 | 唤醒词 / 热词触发 |
| 音频标签 | 环境音分类 |
| 标点恢复 | 为识别结果添加标点 |
| 语音增强 | 降噪(gtcrn、DPDFNet 等) |
| 音源分离 | 人声/伴奏分离(spleeter、UVR 等) |
多平台覆盖
除了常见的 x64/x86/arm64 架构外,它还支持 WebAssembly(浏览器端)、WearOS、openKylin、NVIDIA Jetson(Orin NX / Nano B01)、Raspberry Pi、RISC-V 开发板等。
| 架构 | Android | iOS | Windows | macOS | Linux | HarmonyOS |
|---|---|---|---|---|---|---|
| x64 | ✔ | ✔ | ✔ | ✔ | ✔ | |
| x86 | ✔ | ✔ | ||||
| arm64 | ✔ | ✔ | ✔ | ✔ | ✔ | ✔ |


