pdf-inspector:一半的PDF根本不用过OCR
Firecrawl开源了pdf-inspector,一个Rust库,10到50毫秒回答一个问题:这个PDF到底需不需要OCR?他们的数据:大约54%的PDF是文本型的,根本不需要。本地分类、带坐标和字体信息的文本提取、直接转成干净的Markdown(标题、表格、代码块都保留),只把真正的扫描件路由给昂贵的OCR服务。一天涨了1700多星,总量8千星,MIT协议,Python、Node、浏览器WASM、CLI全有。
为什么这算agent新闻:所有文档工作流——RAG管道、读合同读发票读论文的agent——一直在给每一个PDF交OCR税,因为没人信得过一个便宜的办法来做区分。视觉模型OCR每页要花真金白银、加几秒延迟;一个200毫秒内跑完的本地Rust预检,在他们的提取benchmark上拿0.875(五个对手里最高),把默认管道从"全部过OCR"变成"只让那46%该过的过"。只有一个依赖(lopdf),双模式表格检测,CID字体、RTL文字、多栏排版都处理。
Firecrawl一直在重复同一个动作:找到agent数据摄入栈里最无聊的卡点,写个快的,开源。无聊的卡点才是基础设施复利所在。
仓库:https://github.com/firecrawl/pdf-inspector
← 返回所有文章
为什么这算agent新闻:所有文档工作流——RAG管道、读合同读发票读论文的agent——一直在给每一个PDF交OCR税,因为没人信得过一个便宜的办法来做区分。视觉模型OCR每页要花真金白银、加几秒延迟;一个200毫秒内跑完的本地Rust预检,在他们的提取benchmark上拿0.875(五个对手里最高),把默认管道从"全部过OCR"变成"只让那46%该过的过"。只有一个依赖(lopdf),双模式表格检测,CID字体、RTL文字、多栏排版都处理。
Firecrawl一直在重复同一个动作:找到agent数据摄入栈里最无聊的卡点,写个快的,开源。无聊的卡点才是基础设施复利所在。
仓库:https://github.com/firecrawl/pdf-inspector
评论