20ms把PDF变成Markdown!开源OCR神器快了近300倍

量子位 2026-08-29 11:59
文婷 发自 凹非寺
量子位 | 公众号 QbitAI

曾经只能手动摘取PDF文字、结果乱码一堆、LLM还看不懂的苦逼日子——

终于要结束了!

20ms把PDF变成Markdown!开源OCR神器快了近300倍图1

Y Combinator孵化的明星项目Firecrawl团队最近放了个大招:

其联合创始人兼CTO Nicolas Camara宣布,他们最新开发的OCR It可以在20ms内将一份不可复制的PDF文件内的所有文字内容提炼完,并将其转化成清晰的Markdown格式,AI读完马上就能看懂。

20ms把PDF变成Markdown!开源OCR神器快了近300倍图2

20ms是什么概念?

相当于你刚点完确定还没眨完眼,一份处理好的Markdown文件就已经清清爽爽地交到你手上了。

而且它还不需要联网,可以100%Offline via Bundled Tesseract

这个刚刚开源的OCR工具才刚发布,在GitHub上获得了热门关注。

Nicolas Camara骄傲地表示,在处理质量与Docling旗鼓相当的前提下,OCR It的处理速度比Docling快了近300倍

20ms把PDF变成Markdown!开源OCR神器快了近300倍图3

小伙伴们测完也纷纷在X上留言:

快,确实快得很啊!20ms把PDF变成Markdown!开源OCR神器快了近300倍图4

20ms把PDF变成Markdown!开源OCR神器快了近300倍图5

20ms把PDF变成Markdown!开源OCR神器快了近300倍图6
20ms把PDF变成Markdown!开源OCR神器快了近300倍图7

OCR It怎么用

首先,OCR It是一款适用于Chrome和Firefox的免费浏览器插件。

你只需框选一次区域,之后每按一次快捷键(或开启自动模式),它就能把整本书或整个文档变成完整且可编辑的纯文本,方便你直接喂给AI进行总结或提问。

期间,OCR It会默认在连续识别到两张相同页面、无法继续翻页、OCR失败或达到300页上限时自动停止,避免在末页无限重复抓取。

20ms把PDF变成Markdown!开源OCR神器快了近300倍图8

具体而言,手动和自动档可以分别按以下的几个步骤操作:
(注:用Windows和Linux的小伙伴们需将option键替换为Alt)

1、手动档:

首先按Option+Shift+R选定需要识别的文字区域,确认无误后按Enter保存

完成第一步框选文字区域之后,按一次Option+Shift+S,OCR It就会开始识别当前页面,并在识别完成后会自动翻到下一页。

接下来你只需要重复这个操作直到整份文档识别完毕就好了。

如果你希望进一步节省时间的话,你也可以一边翻页一边在每一页按一次Option+Shift+S,系统会立即截图并在后台自动排队执行识别任务。

20ms把PDF变成Markdown!开源OCR神器快了近300倍图9
20ms把PDF变成Markdown!开源OCR神器快了近300倍图10

2、自动档

自动挡的话就简单多了,你只需要按下Option+Shift+A点击Start auto-run,OCR It便会自动循环执行“截图—OCR—翻页”,直至文档结束。

如果你想中途结束任务的话,按ESC就行,检查流程几乎和手动档一致。

此外,OCR It仓库界面显示,它既不需要API Key、联网、安装时也不需要索取任何网站权限,它只会在需要自动运行或操作跨域iframe时才按需申请当前站点的权限。

另外,浏览器内置PDF阅读器目前也还暂时不支持自动翻页,所以大家在处理这类PDF时,还是尽量用手动档处理吧。

处理复杂任务时还不太稳定

不过,OCR It虽然看起来又快又方便,但还远没有到“以后把所有PDF都丢给它,就能高枕无忧”的程度。

20ms把PDF变成Markdown!开源OCR神器快了近300倍图11

网友们通过实测达成的一个共识是:

OCR It目前可以相当顺手地处理版式简单、文字清晰的PDF文档,但它还不太能处理一些标题、脚注、表格、数学公式和正文段落混排的复杂页面,所以它还有不小的提升空间。

20ms把PDF变成Markdown!开源OCR神器快了近300倍图12

让我们期待一下团队后续的更新吧!

感兴趣的小伙伴们可以点进文末第二个链接看看,欢迎跟我们分享你的测试结果~20ms把PDF变成Markdown!开源OCR神器快了近300倍图13

参考链接:
[1]https://x.com/nickscamara_/status/2083295265793212827
[2]https://github.com/thiagotigaz/ocr-it
[3]https://www.firecrawl.dev/about

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  —

🌟 点亮星标 🌟

科技前沿进展每日见

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AR 开源
more
RA-L 2026开源|一个公式通吃旋转LiDAR所有装法,自适应定位不惧白墙走廊,精度<1.5mm、1104米闭环误差<0.01m
英伟达拟超130亿美元收购Hugging Face,AI开源生态或迎巨变
突发|黄仁勋867亿元收购Hugging Face,拿下全球最大AI开源平台
英伟达拟130亿美元收购Hugging Face?巨头围猎开源模型背后的算力焦虑
英伟达拟129亿美元收购Hugging Face:开源生态的“云端”突围与算力霸权的深层博弈
单卡5090跑满血DeepSeek V4Flash,已开源,Token自由了!
港科大(广州)联合腾讯AI平台部开源VibeWorlding,3D世界构建迎来Vibe Coding时刻?
英伟达400亿押注开源,边卖铲子边挖矿
澳洲警方突袭TeamPCP黑客团伙,开源供应链安全再拉警报
【K230/K230D生态】韦东山面向 DshanPI CanMV-K230 V3 打造的开源嵌入式 AI 桌面
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号