再见复制粘贴灾难!开源神器Marker把PDF变成干净Markdown:表格不乱、公式变LaTeX,速度还比MinerU快5倍

从PDF里复制表格会错位、公式变乱码、双栏文档读成一团?开源工具Marker专门解决这件事:把PDF、Word、Excel、PPT、EPUB等文件转成干净Markdown或JSON,表格保持结构、公式输出真LaTeX、页眉页脚自动去掉,还能直接喂给RAG。数字PDF准确率约83.5%,吞吐量约为MinerU的5倍,CPU/GPU/Mac都能跑。pip install marker-pdf即可上手。

你有没有过这种瞬间想砸电脑的体验?

打开一份几十页的PDF,想把里面的表格贴进笔记或代码里——结果列全乱了。
复制一个公式,出来的是一堆看不懂的符号。
双栏论文更狠:左边一段、右边一段被硬拼在一起,阅读顺序完全错乱。

这不是你不会复制,是PDF本身就不是给人“干净拿走”的格式。

做知识库、做RAG、做资料整理的人,几乎天天撞这堵墙。在线工具要么压缩画质、要么限页、要么把结构拆得面目全非。直到开源项目 Marker(GitHub:datalab-to/marker,约3.9万星)把这件事做成了可落地的流水线。

它的目标很简单:你把文档丢进去,它吐出干净的Markdown或JSON。

Marker到底解决了什么?

不是“能提取文字”那么浅。它针对的是真实文档里最难处理的那一层:

  • 表格还是表格,而不是一堆错位空格
  • 公式转成真正的LaTeX,而不是乱码
  • 双栏、多栏按正确阅读顺序还原
  • 页眉、页脚、页码等杂质自动去掉
  • 图片单独抽出来保存
  • 不只PDF,还支持Word、Excel、PowerPoint、EPUB、HTML和图片
  • 多语言都能处理
  • 需要喂给RAG时,可以直接输出JSON或chunks

一句话:从“勉强能看”变成“能直接用”。

为什么它比很多同类工具更值得试?

社区里常拿它和MinerU、Docling比。Marker官方在olmOCR-bench上的对比很直白:在可比的pipeline方案里,它同时追准确率和速度。

  • Balanced模式整体约76.0分,数字PDF约83.5%
  • 吞吐量约2.9页/秒,约为MinerU pipeline的5倍量级
  • Fast模式更快,CPU无OCR模式还能再往上拉速度
  • GPU、CPU、Mac(MPS)都能跑

这意味着它不是“实验室里好看”的工具,而是能批量处理文档的工具。做资料入库、论文整理、企业知识库时,速度和结构完整度往往比再多一个花哨功能更重要。

可选LLM增强也是它的加分项:跨页表格合并、表格格式整理、表单取值这类脏活,可以用LLM再抬一档。默认也能纯本地跑,不一定非要接云端模型。

它适合谁?

  • 做RAG、知识库、文档问答,需要结构化输入
  • 经常处理论文、报告、教材、合同扫描件
  • 讨厌在线转换网站的压缩、限流和隐私风险
  • 想把Office文档和PDF统一进同一套Markdown/JSON流程

不适合把它当成“万能OCR神话”。复杂扫描件、极乱排版、超大表单,仍可能需要开OCR、调LLM或换参考图/参数。工具再强,源文件质量仍然决定上限。

怎么开始?

最简单的入口就是:

pip install marker-pdf

处理非PDF格式时,安装完整依赖:

pip install marker-pdf[full]

然后把文件丢给它,输出Markdown或JSON。需要小规模服务化时,它还提供FastAPI接口和批处理能力。

代码协议是Apache 2.0,商用友好。但要注意:模型权重有单独许可,研究、个人使用和较小规模团队通常更宽松,较大商业使用需要按官方说明核对。用之前先看仓库README,别只看“开源”两个字就上生产。

仓库地址:
https://github.com/datalab-to/marker

写在最后

文档智能化真正卡住大多数人的,不是大模型本身,而是进模型之前的那一层清洗。

表格乱了,RAG检索会漂。
公式丢了,技术文档会废。
阅读顺序错了,整篇摘要都会跑偏。

Marker做的就是把这层脏活标准化。它不是又一个“能读PDF”的玩具,而是把PDF、Office文档变成可计算文本的生产线。

下次再从PDF里复制表格、复制公式之前,先问自己一句:
要的是“看起来像复制成功了”,还是“结构真的还在”?

如果是后者,这个仓库值得立刻Star,然后拿自己最头疼的那份PDF试一遍。

No comments yet