FunASR 离线文件转写服务开发指南
1. 简介
FunASR(Automatic Speech Recognition)离线文件转写软件包提供了一套功能完整的语音识别链路。它集成了语音端点检测(VAD)、语音识别、标点预测等模型,能够将长音频或视频转换为带标点的文字,并支持字级别时间戳输出。服务端集成 ffmpeg,兼容多种音视频格式,支持上百路并发请求。
推荐硬件配置如下:
- 基础型:4 核 vCPU,8G 内存,单机约支持 32 路请求
- 标准型:16 核 vCPU,32G 内存,单机约支持 64 路请求
- 高性能型:64 核 vCPU,128G 内存,单机约支持 200 路请求
2. 快速上手
2.1 Docker 安装
使用官方脚本安装 Docker:
# 下载安装脚本
curl -O https://isv-data.oss-cn-hangzhou.aliyuncs.com/ics/MaaS/ASR/shell/install_docker.sh
# 执行安装命令
sudo bash install_docker.sh
2.2 镜像拉取与启动
创建资源目录并拉取镜像:
mkdir -p ./funasr-runtime-resources/models
交互式启动容器:
docker run -p 10095:10095 -it --privileged=true \
-v $PWD/funasr-runtime-resources/models:/workspace/models \
registry.cn-hangzhou.aliyuncs.com/funasr_repo/funasr:funasr-runtime-sdk-cpu-0.4.7
2.3 服务端启动
进入容器后启动服务程序。默认开启 SSL,如需关闭可添加 --certfile 0 参数。
cd FunASR/runtime
nohup bash run_server.sh \
--download-model-dir /workspace/models \
--vad-dir damo/speech_fsmn_vad_zh-cn-16k-common-onnx \
--model-dir damo/speech_paraformer-large-vad-punc_asr_nat-zh-cn-16k-common-vocab8404-onnx \
--punc-dir damo/punc_ct-transformer_cn-en-common-vocab471067-large-onnx \
--lm-dir damo/speech_ngram_lm_zh-cn-ai-wesp-fst \
--itn-dir thuduj12/fst_itn_zh \
--hotword /workspace/models/hotwords.txt > log.txt 2>&1 &
注意:
- 热词文件格式为每行一个,例如
阿里巴巴 20。建议热词长度不超过 10,个数不超过 1k,权重 1~100。 - 若需使用 SenseVoiceSmall 模型或开启时间戳,请调整
--model-dir参数。 - 日志中若出现
Unable to open hotwords file且未设置热词,可忽略该警告。
3. 客户端用法详解
部署完成后,可通过 Python、C++、Java 或 HTML 网页版进行调用。
