首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >猫头虎分享:如何在本地使用 openai-whisper 实现音频转文本?

猫头虎分享:如何在本地使用 openai-whisper 实现音频转文本?

作者头像
猫头虎
发布2024-12-18 18:48:21
发布2024-12-18 18:48:21
4.8K0
举报
🐯 猫头虎分享:如何在本地使用 openai-whisper 实现音频转文本?

最近很多小伙伴咨询 如何在本地环境使用 OpenAI 的 Whisper 模型把音频文件转换成文本。今天,猫头虎就来给大家手把手教学,流程完整,保姆级教程🛠️!

正文

📌 1. 准备工具和环境

在开始之前,确保你的本地电脑具备以下条件:

  1. Python 环境:Python 3.8 及以上版本
  2. ffmpeg:处理音频所必需的工具
  3. openai-whisper:OpenAI 提供的开源语音识别模型
  4. GPU(可选):如果你有显卡,Whisper 可以更快运行

🚀 2. 安装必备依赖

🔧 步骤 1:安装 ffmpeg

Whisper 需要 ffmpeg 来处理音频文件,按以下步骤安装:

Windows 系统: 前往 FFmpeg 官网:https://ffmpeg.org/download.html 下载并解压,然后将 ffmpeg.exe 所在目录加入系统环境变量。

如何在本地使用 openai-whisper 实现音频转文本?
如何在本地使用 openai-whisper 实现音频转文本?

Linux / macOS 系统: 打开终端,运行以下命令:

代码语言:javascript
复制
# Linux (Ubuntu)
sudo apt update && sudo apt install ffmpeg

# macOS (使用 Homebrew)
brew install ffmpeg
如何在本地使用 openai-whisper 实现音频转文本?
如何在本地使用 openai-whisper 实现音频转文本?
🛠️ 步骤 2:安装 openai-whisper

Whisper 是一个开源的 Python 包,使用 pip 安装即可。在终端输入:

代码语言:javascript
复制
pip install openai-whisper

如果你的网络不稳定,可以使用国内镖像加速:

代码语言:javascript
复制
pip install openai-whisper -i https://pypi.tuna.tsinghua.edu.cn/simple
如何在本地使用 openai-whisper 实现音频转文本?
如何在本地使用 openai-whisper 实现音频转文本?
📦 步骤 3:安装 PyTorch

Whisper 模型依赖 PyTorch 库,安装 PyTorch:

无 GPU(CPU 环境):

代码语言:javascript
复制
pip install torch torchvision torchaudio

有 GPU(CUDA 环境): 前往 PyTorch 官网 查看 CUDA 版本对应的安装命令。


📈 3. 手动下载模型:解决无网环境

如果你的网络无法连接 OpenAI 下载模型,可以采用手动方式下载模型。

📏 下载地址:

前往 HuggingFace,下载对应模型的 .pt 文件:

下载后,将 .pt 文件存储在本地,如:

代码语言:javascript
复制
~/models/whisper/base.pt

💲 安装步骤:指定本地模型

在 Python 脚本中,加载本地模型,使用以下代码:

代码语言:javascript
复制
import whisper

# 指定本地 Whisper 模型路径
model_path = "~/models/whisper/base.pt"  # 修改为你的模型路径
model = whisper.load_model(model_path)

# 音频文件路径
audio_path = "audio.m4a"

# 转录音频
print("\ud83c\udfa7 开始音频转文字...")
result = model.transcribe(audio_path)

# 输出转录文本
print("\n\ud83c\udf89 转录结果如下:")
print(result["text"])

# 保存结果到文件
with open("transcribed_text.txt", "w", encoding="utf-8") as f:
    f.write(result["text"])
    print("\n\u2705 转录文本已保存至 transcribed_text.txt")

🔢 4. 开始运行代码

在终端中运行 Python 脚本:

代码语言:javascript
复制
python transcribe_audio.py

等待片刻,你会看到以下输出:

代码语言:javascript
复制
🎧 开始音频转文字...

🎉 转录结果如下:
<转录的文本内容>

✅ 转录文本已保存至 transcribed_text.txt

📊 5. 性能与模型对比

模型

大小

速度

适用场景

tiny

39 MB

非常快

快速测试、低资源设备

base

74 MB

小型项目

small

244 MB

中等

普通项目,效果较好

medium

769 MB

较慢

高精度需求

large

1550 MB

较慢

最高精度


☀️ 6. 总结与展望

通过以上步骤,你已经成功在本地环境中使用 openai-whisper 模型实现了音频转文本 🎉。

未来,随着 Whisper 模型的不断优化,我们可以期待:

  • 更快的识别速度
  • 更高的转写出错率
  • 支持更多语言和口音
本文参与 腾讯云自媒体同步曝光计划,分享自作者个人站点/博客。
原始发表:2024-12-17,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 🐯 猫头虎分享:如何在本地使用 openai-whisper 实现音频转文本?
  • 正文
    • 📌 1. 准备工具和环境
    • 🚀 2. 安装必备依赖
      • 🔧 步骤 1:安装 ffmpeg
      • 🛠️ 步骤 2:安装 openai-whisper
      • 📦 步骤 3:安装 PyTorch
    • 📈 3. 手动下载模型:解决无网环境
      • 📏 下载地址:
      • 💲 安装步骤:指定本地模型
    • 🔢 4. 开始运行代码
    • 📊 5. 性能与模型对比
    • ☀️ 6. 总结与展望
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档