PDF转Markdown成本压到200刀/百万页
推荐指数 78.0 NO. 001 · 2026.07.02
Stars18,205
为什么值得看
AllenAI开源的olmOCR用7B参数VLM把扫描版PDF、图片文档转成干净Markdown,支持公式表格手写体,自动去页眉页脚还原阅读顺序。做文档RAG或知识库的团队终于不用在PyMuPDF的乱码和商用API的高价之间二选一了。
Toolkit for linearizing PDFs for LLM datasets/training
媒体预览
编辑判断
文档解析这个环节长期被低估,做RAG的团队往往80%时间花在清洗PyMuPDF或pdfplumber吐出来的垃圾格式上,要么就咬牙上Azure Document Intelligence按页付费。olmOCR把成本打到200美元/百万页,大概是Azure DI的1/50,而且开源可私有化部署。
跟Marker、Nougat这些前辈比,olmOCR胜在工程化:原生支持多栏布局、图文混排的自然阅读顺序,这是学术向工具常年不管的场景。7B模型需要GPU是门槛,但FP8量化后单卡A100能跑,对中小团队可接受。
如果你正在用Unstructured或LlamaParse搭文档管线,建议直接拿olmOCR-benchmark测一轮,它的阅读顺序恢复能力可能是目前开源里最好的,多栏PDF终于不用人工分段了。
Star History
生态分析
Beta
AI2开源的PDF文档结构化解析工具,填补开源与商用API之间的空白
独特价值:7B VLM端到端PDF转Markdown,免商用API高成本,优于传统OCR方案