录音躺在硬盘里,往往不是因为没价值,而是因为整理成本太高。
一小时对谈,两条老路都不舒服:戴耳机一句句敲;或者传到在线转写排队,还要先判断里面有没有不该离开电脑的内容。
Buzz 把这件事挪回本地:文件拖进去,模型在自己机器上跑,稿子在自己磁盘上出。
仓库:https://github.com/chidiwilliams/buzz
文档:https://chidiwilliams.github.io/buzz/docs
MIT 许可,约 2.1 万 Star。定位很清楚——Transcribe and translate audio offline on your personal computer,后端主要建立在 OpenAI Whisper 及兼容实现上。
它实际能做的事
- 导入本地音频、视频,也可贴 YouTube 链接(只应处理你有权转写的内容)
- 导出 TXT / SRT / VTT,字幕场景直接用 SRT 或 VTT
- 麦克风实时转写;另有演示/活动用的展示窗口
- 转写前做人声分离,嘈杂录音更稳一点
- 说话人识别,对谈可以标出谁在说话
- 转写结果可搜索、跟播放定位、调倍速
- 监视文件夹:新文件进来自动转
- 命令行与插件(如摘要、稿件处理)
对「访谈归档、会议纪要、课程字幕、播客粗稿」这类重复劳动,桌面壳比每次打开终端敲 Whisper 参数更接近日常。
后端不是绑死一种 Whisper
文档里的模型路径比「装个 Whisper」宽:
类型 | 更适合谁 |
原版 Whisper | 精度取向,更吃内存、更慢 |
Faster Whisper | 有 NVIDIA 显卡(常见建议 ≥6GB 显存) 时明显更快 |
Whisper.cpp | 非 N 卡、核显、纯 CPU、Mac 上的务实默认;Vulkan 可加速 |
Hugging Face Transformers | 要换特定语言或社区微调模型 |
其他 ASR 系列 | 文档还提到 Parakeet、Qwen3-ASR、VibeVoice 等选项 |
OpenAI Whisper API | 本机算力不够时走远程(音频会离开电脑) |
加速方面:NVIDIA CUDA、Apple Silicon、Whisper.cpp 的 Vulkan(含核显)都在支持列表里。没独显也能跑,只是大模型会慢;先用 tiny/base/small 试通,再按机器升级。
实时转写在文档里写得很诚实:吃资源,不一定跟得上真人语速。把它当辅助草稿,不要当庭审级速记。
平台与安装注意
Windows、macOS、Linux 都有发行(macOS 常见 dmg,Linux 有 Flatpak / Snap 等,也可用 PyPI,需 ffmpeg,Python 环境以文档为准)。
一条容易踩坑的限制:新版 macOS 客户端只要 Apple Silicon。Intel Mac 最后可用版本停在 1.4.5。买二手 Intel 机或还没换芯的人,先看 Releases 再装。
第一次跑会下载模型,磁盘和内存都要留空。这不是「绿色小工具」,是套了图形界面的本地推理。
和在线转写、纯 CLI 怎么选
需求 | 更可能合适 |
访谈里有内部信息、不想上传 | Buzz 或本机 Whisper |
偶尔转一段、机器很弱 | 在线服务或官方 API(接受上传) |
要批处理、进脚本 | Buzz CLI,或直接 whisper.cpp / faster-whisper |
只要一条命令、不要窗口 | 不必为 Buzz 改工作流 |
Buzz 的价值是把「选模型、看进度、改稿、导出字幕、盯文件夹」收在一个本地应用里。已经在终端里把流水线跑顺的人,它是可选的 GUI,不是必须换栈。
使用预期(避免神器落差)
- 口齿不清、严重串音、强口音、专有名词,仍要人工校对;说话人识别也会错。
- 模型越大越准、也越慢。先小模型出草稿,关键稿再用大模型。
- 贴视频链接转写,版权和平台条款仍在。工具能下能转,不代表你有权保存或公开。
- 若在偏好里改用 OpenAI API,隐私模型和「全程本地」就不再成立。
小结
Buzz 没有发明新的识别算法,它把 Whisper 生态做成了能拖文件的桌面工具:本地跑、能出字幕、能实时听写、能分说话人。对经常面对录音、又不想把内容交给云端的人,这比收藏又一个在线转写站更有用。
仓库:https://github.com/chidiwilliams/buzz
录音还是那些录音。差别只是:现在可以在自己电脑上,把它们从死文件变成能搜、能剪、能改的稿。
