偶尔剪条视频,就为「识别字幕」被要求开会员,确实挺让人别扭。
GitHub 上有个开源项目 FlyCut Caption,基于 Whisper 等本地语音识别,把「生成字幕 → 可视化改稿 → 导出」这条链路尽量放在自己电脑上完成,适合不想为单一功能续费的人。
项目地址:https://github.com/x007xyz/flycut-caption
它能做什么?
- 语音转字幕
用 Whisper(浏览器端)或桌面端 FunASR 等方案做识别,带时间戳。口播、教程类视频,准确率通常比「错字连篇还要逐句手改」好用不少。 - 可视化编辑
字幕可以拖位置、改字体颜色,改完实时预览。也支持按字幕片段做基础裁剪(例如去掉空白、不要的句段),相当于「改字幕顺带理时间线」。 - 本地处理
识别和编辑尽量在本地跑,视频不必上传到剪辑平台云端,对在意素材隐私的人更友好。 - 导出灵活
支持 SRT、JSON 等常见字幕格式,也可以硬烧进成片再导出,方便丢进其他剪辑软件或直接发布。
另外还有双语字幕、翻译相关能力(视版本与配置而定),技术栈是现代前端 + 可选桌面端(Tauri),开发者也能当组件集成。
和剪映比,差在哪?
维度 | 剪映等商业工具 | FlyCut Caption |
字幕识别 | 常与会员/权益绑定 | 开源,本地识别 |
完整剪辑 | 功能很全 | 偏字幕 + 轻量剪辑 |
隐私 | 云端流程更多 | 本地优先 |
上手 | 安装即用 | 需按文档部署/启动 |
适合 | 高频、全流程剪辑 | 偶尔做片、主需求是字幕 |
如果你本来就要用剪映做复杂包装、模板、多轨道,它替代不了整套工作流;
如果你只是「给口播加个靠谱字幕再导出」,它往往就够了。
使用注意
- 首次跑 Whisper / 模型会占磁盘和内存,机器太弱时识别会慢一些。
- 方言、嘈杂环境、多人叠音仍可能需要手工校对,别指望零修改。
- 以仓库 README 的安装方式为准(常见是 Node 环境克隆后本地启动)。
- 开源协议与依赖许可发布前自己确认一下,尤其是商用场景。
小结
平台把基础能力收进会员里,用户就会去找「只解决这一个痛点」的开源替代。FlyCut Caption 把 Whisper 级识别和可视化字幕编辑拼在一起,还强调本地、可导出,对偶尔剪视频的人是个务实选项。
下次再因为「就想加个字幕」被催着续费,可以先让本地 AI 跑一轮——不一定非要为整个软件生态买单。




No comments yet