开源项目开源项目3 次浏览 · 2026-10-10
pdf-inspector:高性能 PDF 分类与文本提取引擎
资源链接
https://github.com/firecrawl/pdf-inspectorpdf-inspector 是一款本地运行的高性能 PDF 智能分类与文本排版提取引擎,旨在解决 PDF 解析效率低和 OCR 调用成本高的痛点。

- 智能路由分流:可在 10-50ms 内判定 PDF 属于原生文本、扫描件、图片或混合件,避免盲目送入昂贵耗时的 OCR 接口。
- 零 OCR 无损转 Markdown:从原生 PDF 内容流中高保真还原分级标题、代码块、列表及对齐表格,直接输出适合大模型(LLM)处理的 clean Markdown。
适合 AI 开发者、数据清洗工程师以及需要构建大模型知识库并高效处理 PDF 文档的技术团队使用。

