文档进大模型前,最烦的往往不是模型本身,而是「扫成图的PDF没法复制」。Firecrawl团队开源OCR It,联合创始人兼CTO Nicolas Camara公开称,可在约20ms量级把不可复制PDF中的文字提炼并转为Markdown;支持以打包的Tesseract实现离线运行,并提供Chrome/Firefox浏览器扩展形态。公开对比称,在质量与Docling相当的前提下,速度约快近300倍;演示口径还提到约3秒可处理约200份PDF量级的吞吐叙事。对做RAG与Agent的人来说,这是把「喂文档」前置成本往下砸一截。
Firecrawl以网页抓取与内容抽取能力为开发者所知,OCR It可看作其把「非结构化文档变可计算文本」能力开源外放的一环。产品形态不只是命令行:扩展侧强调框选区域后循环「截图—OCR—翻页」,并在识别到重复页、翻页失败、OCR失败或约300页上限时自动停止,避免在末页空转。仓库材料强调默认不索取广泛网站权限,也不强制API Key——本地优先叙事很明确。
公开能力与边界:
所谓OCR,白话是光学字符识别——把图上的字认出成可编辑文本;所谓转Markdown,白话是保留基本标题与段落结构,让大模型更好分段理解;所谓离线,白话是敏感扫描件不必先上传云端。速度数字很吸睛,但工程上真正决定能不能进流水线的,往往是表格还原率、双栏杂志版式与扫描倾斜矫正——这些正是项目方主动承认的短板。
放在Agent与知识库上下文里,文档解析是隐形基础设施:解析慢,整条RAG链路都慢;解析要上网,合规团队会拦。OCR It用开源与本地路线抢的是「隐私敏感 + 高通量」交集。竞品与开源替代很多,社区会用真实扫描件投票;若复杂版式进步够快,它有机会成为个人与小团队的默认前置组件,企业级则还要看权限、审计与批量调度。
产业影响上,这类工具会继续压低「文档进模型」的门槛,也会倒逼云端文档解析服务把价格与隐私方案讲得更清楚。开发者可以把简单合同、书籍扫描先走本地,把复杂财报表格仍交给更强版式引擎——分层策略会更常见。
需要把边界读清楚:速度与对比口径来自项目方公开表述,复杂版式准确率仍待社区复现;吞吐演示受硬件与页面复杂度影响。下一观察点是表格/公式支持进度、是否出现企业批量插件,以及与主流RAG框架的默认集成程度。