别再把合同丢给在线PDF网站:开源自托管Stirling-PDF,50+功能、Docker一键部署,还能给AI Agent当PDF引擎

合并、拆分、签名、脱敏、OCR、压缩、格式转换……PDF处理需求又杂又敏感,却总被逼去用来路不明的在线网站。Stirling-PDF是GitHub上最受关注的开源PDF平台之一,现约9万星,内置50多种工具,支持无代码Pipeline批量处理,一行Docker即可私有化部署。文件留在自己的机器上,最近还在向MCP/Agent能力延伸,适合个人、团队和把PDF当成基础设施的自动化场景。

合同、发票、扫描件、标书、论文——现代工作几乎都被PDF拴住。

更烦的是工具本身:合并要一个站,压缩要一个站,OCR再换一个站。文件上传时那一下,你其实把整份材料交给了不知道服务器在哪、日志留多久的第三方。

家里宽带再快,也快不过一次误传带来的风险。

开源项目 Stirling-PDF 火起来,靠的不是又一个“在线转PDF”落地页,而是把Acrobat级常见能力收进可自托管的平台里:浏览器里用、Docker里跑、API可接,文件默认留在你自己的环境。

GitHub仓库:https://github.com/Stirling-Tools/Stirling-PDF
官方定位就是GitHub上最受关注的PDF应用之一,目前星标已到约9万量级。下载量和镜像拉取很高,说明它已经从“开发者玩具”走进大量真实部署。

它不是单一功能脚本,是一套PDF工作台

常见开源PDF工具往往只做一件事:有的只会合并,有的只会抽文本。Stirling-PDF把高频动作放到同一个入口:

  • 编辑、合并、拆分、旋转、重排页面
  • 电子签名、水印、页码
  • 敏感信息脱敏/涂黑
  • PDF与图片、Office等格式转换
  • OCR文字识别,让扫描件可检索
  • 压缩,减小体积但不把流程拆成三个网站
  • 批量处理和Pipeline,同一套步骤可重复跑

对个人,这意味着少记十个网址。
对小团队,这意味着财务、法务、行政可以共用一台内网工具,而不是每人收藏不同的“免费PDF站”。

界面还支持40多种语言,上手成本比很多开源项目低得多。

真正拉开差距的是:文件不用出门

在线工具最方便,也最危险。招聘简历、身份证扫描件、未公开财报、客户合同,任何一次上传都可能变成数据足迹。

Stirling-PDF的默认哲学相反:

  • 本地或内网部署
  • 浏览器访问自己的服务
  • 提供私有API,而不是把文档交给外部SaaS

这就是它能从“好用”变成“能上生产”的原因。隐私不是附加功能,是架构选择。

部署也刻意压低门槛。官方快速启动就是一条Docker命令,跑起来后打开本机端口即可用。需要OCR语言包、配置持久化、日志和Pipeline目录时,再挂数据卷。机器资源紧用ultra-lite,功能要全上fat/standard,按场景选镜像,不必一开始就上最重的那一档。

Pipeline:从“每次点一遍”到“流程可复用”

PDF处理最耗人的不是某一个按钮,是重复。

每周把20份扫描件先OCR,再压缩,再合并,再加水印——手点三次还能忍,点三个月就是事故现场。Stirling-PDF支持无代码Pipeline:把常用步骤串起来,批量文件按同一流水线走。行政和运营也能用,不一定非要写脚本。

这已经接近“PDF操作系统”而不是“小工具合集”。工具解决单点;流水线解决组织里反复出现的同一类文件。

MCP与Agent:下一步不只是人点按钮

帖子里最值得注意的,是它开始往MCP和AI Agent方向靠。

意思很具体:以后不一定要人打开网页点“合并”“OCR”“脱敏”。Agent可以调用PDF能力引擎,按指令完成一串动作——从一堆扫描件生成可检索PDF,去掉页眉页脚和敏感字段,再按模板合并输出。

社区里已经出现对接Stirling-PDF的MCP Server/Agent项目,官方仓库也在向桌面端、浏览器、自托管API和自动化同时演进。方向一旦跑通,它就可能从“好用的开源Acrobat替代”变成很多自动化系统里的PDF基础设施。

现在就说“标准已经确立”还早,但信号明确:PDF处理正在从人工网页操作,变成可被Agent调用的底层能力。

谁该立刻部署?

  • 不想再把合同和证件上传到随机网站
  • 团队需要统一的合并、签名、脱敏、OCR入口
  • 有NAS/家用服务器/公司内网,希望私有化一台PDF工作台
  • 正在做文档自动化、RAG入库前处理、Agent办公流

需要心里有数的限制:

  • 完整OCR、Office转换会更吃镜像体积和内存,小机器先选精简版
  • 公网裸奔前先做访问控制,不要把无鉴权实例直接暴露到互联网
  • 复杂版式、扫描质量差的文件,OCR和转换仍可能要人工抽检
  • Agent/MCP是加分能力,日常价值首先来自那50多个稳定工具和私有化部署

最小可行用法

先不要设计宏大平台。今晚只做三步:

  1. 用Docker把实例跑在本机或NAS
  2. 拿一份自己的扫描件试OCR和压缩
  3. 把“合并+加水印”存成一条Pipeline

如果这三步比打开三个在线网站更顺手,这个服务就值得留着。等团队真开始用了,再开安全选项、账号和API。

仓库与文档:
https://github.com/Stirling-Tools/Stirling-PDF
https://docs.stirlingpdf.com

写在最后

PDF工具从来不缺。缺的是一个你敢把真文件放进去、又不必每个月换订阅的入口。

Stirling-PDF把编辑、签名、脱敏、OCR、压缩和批量流水线收进可自托管的开源平台,再用Docker把启动成本压到足够低。营销不是它的主场,重复出现的真实文件工作才是。

下次再准备把合同拖进某个“免费PDF网站”之前,先问一句:这份文件,你是否接受它离开自己的电脑?

如果答案是否定的,就在自己的机器上起一个Stirling-PDF。那不是极客情怀,是把文档处理权收回来。

No comments yet