pdf-inspector 是 Firecrawl 团队出品的纯 Rust PDF 智能解析与分类库,定位是 RAG 和 Agent 文档摄取层的前置路由器。它先把 PDF 分成文字型、扫描型、图片型、混合型四类并保留字体坐标,再判断哪些页面真正值得送 OCR,从而把算力花在刀刃上。整个流程不依赖大模型、不调用外部服务,输出 LLM-ready 的 Markdown,性能远超 Python 系方案,曾冲上 GitHub Trending 总榜。最新版 v1.18.0(2026-09-08 发布):改进文本几何与上下标处理、修复 PDF 加载、新增旋转文本边界与旋转元数据、嵌入粗体字体元数据恢复、修复经典交叉引用表。 定价:开源免费(MIT,可自托管)。编辑评分:⭐ 4.5。
pdf-inspector 是什么?
pdf-inspector 是 Firecrawl 团队出品的纯 Rust PDF 智能解析与分类库,定位是 RAG 和 Agent 文档摄取层的前置路由器。它不是又一个通用 PDF 解析器,而是先把 PDF 分成文字型(TextBased)、扫描型(Scanned)、图片型(ImageBased)、混合型(Mixed)四类,并保留字体坐标,再判断哪些页面真正值得送 OCR,从而把算力花在刀刃上。整个流程不依赖大模型、不调用外部服务,输出 LLM-ready 的 Markdown,性能远超 Python 系方案。它曾冲上 GitHub Trending 总榜,是 PDF-to-LLM 赛道里少见的硬核 Rust 实现。
核心功能
- 低延迟分类:先把每页归到 Text/Scanned/Image/Mixed 四类,决定后续处理路径。
- 字体坐标保留:尽量按正常阅读顺序还原文本,多栏布局也不乱。
- 表格结构识别:结合表格边框与文本对齐,支持财务表、脚注与跨页表,输出 Markdown 表格。
- 智能 OCR 路由:约一半 PDF 是文字型,直接原生提取;只有扫描页才进 GPU OCR。
- LLM-ready 输出:可输出 Markdown 或结构化 JSON,直接喂给知识库或大模型。
- 多形态接入:提供 Rust 库、Node/Bun 包、Python 绑定、CLI 与 WebAssembly 版本。
版本/套餐对比
项目 MIT 开源、可自托管,无 SaaS 套餐;若需要 OCR 与规模化,可使用 Firecrawl 托管的 /parse API(按 credits 计费)。
值不值得用?
如果你在做 RAG、知识库或 Agent 的文档摄取,pdf-inspector 非常值得。纯 Rust 让它单文档毫秒级完成,且因为只在必要时 OCR,成本和时间都显著低于无脑全量 OCR 的方案。对隐私敏感、不想把文件传外部 API 的场景尤其合适。
使用建议
- 先本地跑 CLI 验证分类与提取质量,再集成到摄取流水线。
- 文字型为主的文档直接原生提取,省掉 OCR 开销。
- 极端复杂版式(如特殊财务报表)抽取后做一次人工抽检。
适合谁用?(三档)
- 重度用户:做企业知识库/RAG 的团队,把它当文档摄取前置。
- 中度用户:个人开发者处理论文、财报、法律文件转 Markdown。
- 轻度用户:偶尔需要把 PDF 转成干净文本的用户,WebAssembly 版即可。