跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客我的书AI学习GitHub 精选镜像AI 生图工具UI配色美学关于
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
PythonAI算法

Whisper 与 Faster-Whisper 模型下载及安装指南

Whisper 和 Faster-Whisper 两种语音识别模型的分类、安装方法及运行示例。模型可通过 pip 安装获取 .pt 文件,也可从 Hugging Face 下载特定版本。提供了基于 Python 的代码示例,展示了如何在 CPU 或 GPU 环境下加载模型、检测语言及转录音频。对于使用 Hugging Face 模型的部署场景,推荐参考 vLLM 框架。

ApiHolic发布于 2026/4/5更新于 2026/9/268 浏览

1. 模型种类

Whisper 支持多种模型规格,包括 tiny、base、small、medium、large 等。Faster-Whisper 的模型种类与 Whisper 类似。

2. 模型安装

Whisper 和 Faster-Whisper 的模型主要有两种获取方式:

  1. 通过 pip 安装:

    • Whisper: 运行 pip install -U openai-whisper,下载结果为 .pt 文件。参考文档:OpenAI Whisper。
    • Faster-Whisper: 运行 pip install faster-whisper,下载结果为 .pt 文件。参考文档:SYSTRAN Faster-Whisper。
  2. 通过 Hugging Face 下载:

    • 访问 Hugging Face 搜索 whisper,可下载 large-v3 和 large-v3-turbo 等模型。文件格式与上述 pip 安装方式有所不同。

3. 模型运行

3.1 使用 pip 安装的模型(Whisper)

参考官方示例代码如下:

import whisper

model = whisper.load_model("turbo")

# load audio and pad/trim it to fit 30 seconds  
audio = whisper.load_audio("audio.mp3")  
audio = whisper.pad_or_trim(audio)

# make log-Mel spectrogram and move to the same device as the model  
mel = whisper.log_mel_spectrogram(audio, n_mels=model.dims.n_mels).to(model.device)

# detect the spoken language  
_, probs = model.detect_language(mel)  
print(f"Detected language: {max(probs, key=probs.get)}")

# decode the audio  
options = whisper.DecodingOptions()  
result = whisper.decode(model, mel, options)

# print the recognized text  
print(result.text)

注意:Whisper 模型通常建议音频时长适中,如果音频时间太短,可能识别结果不准确,具体请自行尝试。

3.2 使用 pip 安装的模型(Faster-Whisper)

参考官方示例代码如下:

from faster_whisper import WhisperModel

model_size = "large-v3"

# Run on GPU with FP16  
model = WhisperModel(model_size, device="cuda", compute_type="float16")

# or run on GPU with INT8  
# model = WhisperModel(model_size, device="cuda", compute_type="int8_float16")  
# or run on CPU with INT8  
# model = WhisperModel(model_size, device="cpu", compute_type="int8")

segments, info = model.transcribe("audio.mp3", beam_size=5)

print("Detected language '%s' with probability %f" % (info.language, info.language_probability))

for segment in segments:  
    print("\[%.2fs -> %.2fs] %s" % (segment.start, segment.end, segment.text))

在初始化 WhisperModel 时,可以指定 cuda 编号以便合理利用资源。

3.3 使用 Hugging Face 模型的部署

若采用 Hugging Face 下载的模型,可参考 vLLM 框架。vLLM 框架中的 Whisper 模型和 Faster-Whisper 模型通常来自 Hugging Face。关于 vLLM 安装踩坑问题,后续将另行发布。

目录

  1. 1. 模型种类
  2. 2. 模型安装
  3. 3. 模型运行
  4. 3.1 使用 pip 安装的模型(Whisper)
  5. load audio and pad/trim it to fit 30 seconds
  6. make log-Mel spectrogram and move to the same device as the model
  7. detect the spoken language
  8. decode the audio
  9. print the recognized text
  10. 3.2 使用 pip 安装的模型(Faster-Whisper)
  11. Run on GPU with FP16
  12. or run on GPU with INT8
  13. model = WhisperModel(modelsize, device="cuda", computetype="int8_float16")
  14. or run on CPU with INT8
  15. model = WhisperModel(modelsize, device="cpu", computetype="int8")
  16. 3.3 使用 Hugging Face 模型的部署

更多推荐文章

查看全部
  • 国内大模型公司面试经验总结与技术要点分析
  • 什么是 llama.cpp:本地高效运行大语言模型的核心框架
  • AI 产品经理新人简明入门指南:核心能力与准备路径
  • ClawWork:香港大学开源 AI 智能体经济模拟平台技术解析
  • Java + AI 混合编程落地实施方案
  • C++ list 模拟实现:带头双向链表的增删查改
  • ESP32 小智 AI 机器人开发:原理与云端部署实战
  • Gitee 本地账号与密码配置步骤
  • 本地部署 Llama3 8B/70B 大模型:CPU/GPU 运行方案详解
  • GitSync:Android 移动端 Git 仓库同步工具
  • CVE-2026-21962 Oracle WebLogic 代理插件漏洞深度解析与防护方案
  • Apache Arrow FFI 接口详解:C 与 Rust 数据零拷贝交互
  • 平衡二叉搜索树之 AVL 树的模拟实现
  • 基于 ZeroMQ 构建具身智能分布式通信系统 Python 实战
  • 飞算 JavaAI 插件深度体验:AI 辅助开发全流程解析
  • LeetCode 27 题:移除元素
  • FPGA 基础概念与架构面试题详解
  • VSCode GitHub Copilot 安装与实战指南
  • 国内外主流 AI 大模型盘点与技术趋势分析
  • 即梦 AI 基础操作指南:从绘画到视频生成

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • curl 转代码

    解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online