做视频后期这些年,字幕一直是我最不想碰、又不得不碰的一环。
短视频还好,独白或口播用剪映之类的工具凑合能过。一旦遇到访谈、播客、圆桌、双人对话,问题就来了:
- 自动识别要钱,或者精度一般
- 手动打轴,时间轴对齐要靠耳朵和手速
- 多人说话时,谁说了哪句全靠听辨,后期对轨和改样式特别耗神
被折腾几次之后,我开始认真找「本地、能分说话人、最好能直接进时间线」的方案,后来试到了 AutoSubs。
GitHub:https://github.com/tmoroney/auto-subs
它解决的核心痛点
AutoSubs 的定位很明确:本地优先的 AI 字幕工具。
不上传云端、不强制订阅,音视频在你自己机器上跑完转录和说话人分离。主要能力包括:
- 一键转录
支持 Whisper、Parakeet、Moonshine 等本地模型,多语言可用。 - 自动说话人分离(Speaker Diarization)
识别不同说话人,并打上颜色标签。多人场景里,谁说了什么扫一眼就能分清,后期按人改样式也方便很多。 - 内置字幕编辑器
时间轴和文本可以精细调整,支持多行显示、按说话人单独设样式。 - 深度集成剪辑软件
尤其和 DaVinci Resolve 结合得好:字幕可以一键发到时间线。也支持 Premiere Pro、After Effects(通过扩展)。不想开工程时,也能用独立模式直接处理文件。 - 跨平台
Windows、macOS(Apple Silicon / Intel)、Linux 都有安装包。
对做访谈、会议录屏、双人/多人播客的人来说,「自动分说话人 + 分色」这一点,比单纯出 SRT 实用得多。
实际使用感受
我更在意这几件事:
- 本地跑:素材不离开本机,隐私和版权敏感内容更安心。
- 说话人标签:多人对话不用再靠耳朵硬猜「这句是谁」。
- 进时间线顺:在 Resolve 里能直接落到字幕轨,减少导出再导入的来回。
- 可调:识别错了、时间轴偏了,编辑器里能改,而不是只能接受一版结果。
当然,它也不是万能的。背景噪音大、口音重、说话重叠严重时,转录和分人都会掉精度,需要人工修。模型首次下载会占空间,机器配置一般时大模型会慢一些。这些是本地 AI 字幕工具的共同边界,心里有数就好。
适合谁?
- 经常剪访谈、播客、会议、双人/多人对话的创作者
- 用 DaVinci Resolve 做后期、想少踩手动打轴的人
- 在意数据不出本机、不想为字幕长期付订阅的人
- 需要按说话人区分样式(不同颜色、不同轨)的场景
如果只是偶尔给短口播加一行字幕,现成在线工具可能更省事;一旦进入「多人、要分轨、要长期用」的阶段,本地方案的优势就会明显起来。
小结
字幕这件事,工具再好也替代不了最终的人工校对,但能把「从零打轴 + 猜说话人」变成「机器出一版 + 人改细节」,已经省下大量重复劳动。
AutoSubs 把本地转录、说话人分色、字幕编辑和剪辑软件集成放在一起,方向对、也够实用。
项目地址:
https://github.com/tmoroney/auto-subs
下次再遇到多人对话成片,可以先让它跑一版,再决定要不要继续手搓时间轴。对长期做内容的人来说,这种能进工作流的本地工具,往往比又一个「演示很炫」的在线服务更有价值。




No comments yet