ahhhhfs|A姐分享: post #13060 — TG.ME

很多 PDF 本身就带文字层,再跑一遍 OCR 其实是重复处理。

Firecrawl 开源的 pdf-inspector 会先在本地检查 PDF 类型,几十毫秒判断哪些能直接提取,哪些页面或区域才需要 OCR。能读的转 Markdown,缺文本的再识别。

他们自己的数据里,约 54% 的 PDF 不需要 OCR。

适合拿来给 AI 知识库、文档问答做 PDF 预检。

👉https://www.ahhhhfs.com/82072/
❤8🤡3🤓2
August 18, 2026 24K 79