
openai-whisper 实现音频转文本?最近很多小伙伴咨询 如何在本地环境使用 OpenAI 的 Whisper 模型把音频文件转换成文本。今天,猫头虎就来给大家手把手教学,流程完整,保姆级教程🛠️!
在开始之前,确保你的本地电脑具备以下条件:
ffmpegWhisper 需要 ffmpeg 来处理音频文件,按以下步骤安装:
Windows 系统:
前往 FFmpeg 官网:https://ffmpeg.org/download.html 下载并解压,然后将 ffmpeg.exe 所在目录加入系统环境变量。

Linux / macOS 系统: 打开终端,运行以下命令:
# Linux (Ubuntu)
sudo apt update && sudo apt install ffmpeg
# macOS (使用 Homebrew)
brew install ffmpeg
openai-whisperWhisper 是一个开源的 Python 包,使用 pip 安装即可。在终端输入:
pip install openai-whisper如果你的网络不稳定,可以使用国内镖像加速:
pip install openai-whisper -i https://pypi.tuna.tsinghua.edu.cn/simple
Whisper 模型依赖 PyTorch 库,安装 PyTorch:
无 GPU(CPU 环境):
pip install torch torchvision torchaudio有 GPU(CUDA 环境): 前往 PyTorch 官网 查看 CUDA 版本对应的安装命令。
如果你的网络无法连接 OpenAI 下载模型,可以采用手动方式下载模型。
前往 HuggingFace,下载对应模型的 .pt 文件:
下载后,将 .pt 文件存储在本地,如:
~/models/whisper/base.pt在 Python 脚本中,加载本地模型,使用以下代码:
import whisper
# 指定本地 Whisper 模型路径
model_path = "~/models/whisper/base.pt" # 修改为你的模型路径
model = whisper.load_model(model_path)
# 音频文件路径
audio_path = "audio.m4a"
# 转录音频
print("\ud83c\udfa7 开始音频转文字...")
result = model.transcribe(audio_path)
# 输出转录文本
print("\n\ud83c\udf89 转录结果如下:")
print(result["text"])
# 保存结果到文件
with open("transcribed_text.txt", "w", encoding="utf-8") as f:
f.write(result["text"])
print("\n\u2705 转录文本已保存至 transcribed_text.txt")在终端中运行 Python 脚本:
python transcribe_audio.py等待片刻,你会看到以下输出:
🎧 开始音频转文字...
🎉 转录结果如下:
<转录的文本内容>
✅ 转录文本已保存至 transcribed_text.txt模型 | 大小 | 速度 | 适用场景 |
|---|---|---|---|
tiny | 39 MB | 非常快 | 快速测试、低资源设备 |
base | 74 MB | 快 | 小型项目 |
small | 244 MB | 中等 | 普通项目,效果较好 |
medium | 769 MB | 较慢 | 高精度需求 |
large | 1550 MB | 较慢 | 最高精度 |
通过以上步骤,你已经成功在本地环境中使用 openai-whisper 模型实现了音频转文本 🎉。
未来,随着 Whisper 模型的不断优化,我们可以期待: