跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客GitHub 精选镜像AI 生图工具UI配色美学隐私政策关于联系
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
PythonAI算法

WhisperLiveKit 本地部署实时语音转文字与说话人识别

WhisperLiveKit 是一款开源的本地语音转文字工具,支持实时转录与说话人识别。它利用 SimulStreaming 和 WhisperStreaming 技术实现低延迟处理,集成 Silero VAD 抗噪,并支持 GPU/CPU 加速。该工具注重隐私安全,数据完全本地化。提供 Docker 部署、多语言翻译及 Chrome 插件扩展,适用于会议记录、字幕生成等场景。

锁机制发布于 2026/4/6更新于 2026/7/2447 浏览
WhisperLiveKit 本地部署实时语音转文字与说话人识别

WhisperLiveKit:本地部署实时语音转文字与说话人识别

项目地址:github.com/QuentinFuxa/WhisperLiveKit

核心特性

WhisperLiveKit 解决了传统语音转文字工具延迟高、多人发言混淆及云端隐私风险等问题。

  • 实时性:基于 SimulStreaming 技术,转录延迟低至秒级,支持说话内容同步显示。
  • 多人识别:搭载 Streaming Sortformer 和 Diart 双引擎,可清晰标注不同发言者(如 Speaker 1, Speaker 2)。
  • 本地运行:所有处理在本地完成,不上传云端,保障会议机密与隐私安全。
  • 抗噪能力:内置 Silero VAD 语音活动检测,自动过滤背景噪音与键盘声。

技术架构

  • 转录核心:结合 WhisperStreaming 和 SimulStreaming 技术,平衡准确率与延迟。
  • 翻译功能:集成 NLLB 模型,支持 100+ 种语言实时互译。
  • 硬件适配:支持 GPU 加速(NVIDIA),兼容 CPU 运行,并对 Apple M 系列芯片有优化。

安装与部署

第一步:安装 FFmpeg

FFmpeg 是音频处理的基础依赖。

  • Windows:下载 exe 并添加到系统 PATH。
  • Mac:brew install ffmpeg
  • Ubuntu/Debian:sudo apt install ffmpeg

第二步:安装核心库

使用 pip 安装:

pip install whisperlivekit

或克隆仓库开发模式安装:

git clone https://github.com/QuentinFuxa/WhisperLiveKit.git
cd WhisperLiveKit
pip install -e .

第三步:启动服务

输入启动指令:

whisperlivekit-server --model base --language zh

参数说明:

  • --model:基础模型为 base,高精度可选 large-v3。
  • --language:指定语言,如 zh(中文)、en(英文)或 auto。

启动后访问浏览器 http://localhost:8000,即可通过麦克风进行实时转录。

高级功能

  • Docker 部署:支持 Docker 镜像一键运行,适配 GPU 加速与纯 CPU 模式。
  • 说话人识别增强:默认开启 Sortformer 引擎,可额外安装 NVIDIA NeMo 提升精度。
  • 翻译模式:添加 --task translate 参数实现外文转中文,支持多语种互译。
  • Chrome 插件:捕获网页音频(如线上会议),实时转录成文字。

适用场景

  • 办公会议:自动生成纪要,减少整理时间。
  • 内容创作:录制播客或视频时生成字幕初稿。
  • 教育辅助:课堂讨论转录,辅助听障学生回顾重点。
  • 开发者集成:提供 Python API 和前端组件,便于二次开发。

注意事项

项目版本持续更新,支持 Python 3.9 至 3.15。使用大模型(如 large-v3)建议配备至少 8G 显存的 GPU 以保证流畅度;普通用户可使用 base 或 small 模型在笔记本上运行。

目录

  1. WhisperLiveKit:本地部署实时语音转文字与说话人识别
  2. 核心特性
  3. 技术架构
  4. 安装与部署
  5. 第一步:安装 FFmpeg
  6. 第二步:安装核心库
  7. 第三步:启动服务
  8. 高级功能
  9. 适用场景
  10. 注意事项
  • 免费图片AI生成工具免费生成了解详情
  • Magick API 一键接入全球大模型注册送1000万token查看
  • 免费图片视频在线生成30秒,将你的创意变成现实开始设计
  • X/Twitter免费视频下载器免登陆无限额度免费视频解析下载了解详情
  • 100+免费在线小游戏爽一把
极客日志微信公众号二维码

微信扫一扫,关注极客日志

微信公众号「极客日志V2」,在微信中扫描左侧二维码关注。展示文案:极客日志V2 zeeklog

更多推荐文章

查看全部
  • Eino ADK 体系篇:ChatModelAgent 核心机制与实战解析
  • 在 Apple Silicon Mac 上折腾 Whisper-WebUI 的记录
  • Yuan2.0 数据预处理
  • 基于 ARX 结构和反馈机制的序列密码算法 Phelix
  • AI 时代的软件工程:使用 OpenSpec 驱动自动化开发
  • 鸿蒙 APP 运维监控、生态运营与专属变现实战
  • Inception 网络:多尺度卷积结构与图像识别应用
  • ComfyUI Manager 插件管理工具安装与使用指南
  • Odoo 模型继承体系详解:BaseModel 到 TransientModel
  • 国产数据库新机遇:电科金仓以融合技术同步全球竞争
  • 基于深度学习的智能害虫识别系统
  • CVPR 2024 论文阅读:Fusion-Mamba 跨模态目标检测
  • JiuwenClaw AI 智能体实战:任务规划与上下文管理
  • WhisperX 快速上手指南:基于 OpenAI Whisper 的语音识别工具
  • Llama-Factory 快速迭代 NLP 模型微调指南
  • DeerFlow 2.0 开源:从研究工具到超级智能体架构
  • FPGA 工程师职业方向详解:岗位分类与核心能力
  • Rokid JSAR 基于 Web 技术栈的 AR 开发环境搭建与 3D 时钟实战
  • 无线联邦学习:隐私保护下的 AI 协同进化
  • OpenClaw Gateway 代理连接被拒绝问题排查

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • curl 转代码

    解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online