你看到的内容可能由第三方 AI 基于小众软件文章提炼总结而成,可能与原文真实意图存在偏差。不代表小众软件观点和立场。请 点击链接阅读原文 细致比对和校验。
AI 处理文档这事,卡点往往不在模型,而在格式。PDF 里的扫描页、Word 里的表格、PPT 里的文本框……喂给大模型之前,得先变成它看得懂的 Markdown。最近 Firecrawl 开源了两个工具,专治这种“格式不服”。
先拆 PDF:不是所有页都值得 OCR
PDF Inspector 是个 Rust 写的分析库,思路挺聪明:先看 PDF 内部结构,再决定怎么处理。
- 有真实文字层 → 直接解析,不折腾
- 扫描件 / 纯图片 → 才交给 OCR
- 混合型 → 只对图片页动手
比如一份 40 页的文档,35 页是文本,5 页是图片,它就只 OCR 那 5 页,成本省一大截。
OCR 用的是 PP-OCRv6 本地模型(飞桨家的),完全离线,不烧 API 钱。
再来一个全家桶:AnyDoc 统一所有格式
如果说 PDF Inspector 是“专科医生”,AnyDoc 就是“全科门诊”。除了 PDF,它还能处理 Word、Excel、PPT、EPUB、CSV 等常见格式。
最大卖点是输出结构统一:
- 表格、标题、脚注、链接的格式完全一致
- 粗体、斜体、删除线、代码块、列表也都有统一规范
这太重要了——以前用不同工具转出来的 Markdown 五花八门,喂给 RAG 系统时还得清洗,现在一步到位。
PDF 支持就是靠上面的 PDF Inspector 实现的,两个项目配合默契。
我的看法:本地、免费、可折腾
这两个工具都是纯本地运行,不需要任何 API,对隐私敏感的场景特别友好。还支持 Agent skill,意味着 AI 可以自己调用它来预处理文档。
如果你经常让 AI 处理各种文档,先拿它过一遍,效率、准确性、钱包都能兼顾。
唯一的小门槛是 Rust 环境,但 GitHub 上有现成 release,下载即用。反正我打算拿它把积攒的 PDF 全转成 Markdown,再丢给本地知识库试试。
说实话,这类“格式转换器”看起来不起眼,但确实是 AI 落地的基础设施。Firecrawl 这波开源,挺良心。
评论 (0)