Notebook and pen on a desk

剪映字幕要会员?试试开源的 FlyCut Caption

介绍开源字幕工具 FlyCut Caption:基于 Whisper 本地语音识别,支持可视化编辑、样式调整与 SRT/JSON 导出,视频可不上云。适合不想为剪映等平台的字幕会员单独付费、只是偶尔剪片的创作者。

偶尔剪条视频,就为「识别字幕」被要求开会员,确实挺让人别扭。

GitHub 上有个开源项目 FlyCut Caption,基于 Whisper 等本地语音识别,把「生成字幕 → 可视化改稿 → 导出」这条链路尽量放在自己电脑上完成,适合不想为单一功能续费的人。

项目地址:https://github.com/x007xyz/flycut-caption

它能做什么?

  1. 语音转字幕
    用 Whisper(浏览器端)或桌面端 FunASR 等方案做识别,带时间戳。口播、教程类视频,准确率通常比「错字连篇还要逐句手改」好用不少。
  2. 可视化编辑
    字幕可以拖位置、改字体颜色,改完实时预览。也支持按字幕片段做基础裁剪(例如去掉空白、不要的句段),相当于「改字幕顺带理时间线」。
  3. 本地处理
    识别和编辑尽量在本地跑,视频不必上传到剪辑平台云端,对在意素材隐私的人更友好。
  4. 导出灵活
    支持 SRT、JSON 等常见字幕格式,也可以硬烧进成片再导出,方便丢进其他剪辑软件或直接发布。

另外还有双语字幕、翻译相关能力(视版本与配置而定),技术栈是现代前端 + 可选桌面端(Tauri),开发者也能当组件集成。

和剪映比,差在哪?

维度

剪映等商业工具

FlyCut Caption

字幕识别

常与会员/权益绑定

开源,本地识别

完整剪辑

功能很全

偏字幕 + 轻量剪辑

隐私

云端流程更多

本地优先

上手

安装即用

需按文档部署/启动

适合

高频、全流程剪辑

偶尔做片、主需求是字幕

如果你本来就要用剪映做复杂包装、模板、多轨道,它替代不了整套工作流;
如果你只是「给口播加个靠谱字幕再导出」,它往往就够了。

使用注意

  • 首次跑 Whisper / 模型会占磁盘和内存,机器太弱时识别会慢一些。
  • 方言、嘈杂环境、多人叠音仍可能需要手工校对,别指望零修改。
  • 以仓库 README 的安装方式为准(常见是 Node 环境克隆后本地启动)。
  • 开源协议与依赖许可发布前自己确认一下,尤其是商用场景。

小结

平台把基础能力收进会员里,用户就会去找「只解决这一个痛点」的开源替代。FlyCut Caption 把 Whisper 级识别和可视化字幕编辑拼在一起,还强调本地、可导出,对偶尔剪视频的人是个务实选项。

下次再因为「就想加个字幕」被催着续费,可以先让本地 AI 跑一轮——不一定非要为整个软件生态买单。

No comments yet