AMAZINGINDEX.COM 日报快照
49.5
VOL. 2026.07
2026.07.02
← 返回 2026.07.02 日报
日报快照 · Daily Snapshot
NO. 001

PDF转Markdown成本压到200刀/百万页

#REPO GitHub Trending 2026.07.02
推荐指数 78.0 NO. 001 · 2026.07.02
Stars18,205

AllenAI开源的olmOCR用7B参数VLM把扫描版PDF、图片文档转成干净Markdown,支持公式表格手写体,自动去页眉页脚还原阅读顺序。做文档RAG或知识库的团队终于不用在PyMuPDF的乱码和商用API的高价之间二选一了。

Toolkit for linearizing PDFs for LLM datasets/training

PDF转Markdown成本压到200刀/百万页

文档解析这个环节长期被低估,做RAG的团队往往80%时间花在清洗PyMuPDF或pdfplumber吐出来的垃圾格式上,要么就咬牙上Azure Document Intelligence按页付费。olmOCR把成本打到200美元/百万页,大概是Azure DI的1/50,而且开源可私有化部署。

跟Marker、Nougat这些前辈比,olmOCR胜在工程化:原生支持多栏布局、图文混排的自然阅读顺序,这是学术向工具常年不管的场景。7B模型需要GPU是门槛,但FP8量化后单卡A100能跑,对中小团队可接受。

如果你正在用Unstructured或LlamaParse搭文档管线,建议直接拿olmOCR-benchmark测一轮,它的阅读顺序恢复能力可能是目前开源里最好的,多栏PDF终于不用人工分段了。

Star History
Beta

AI2开源的PDF文档结构化解析工具,填补开源与商用API之间的空白

独特价值:7B VLM端到端PDF转Markdown,免商用API高成本,优于传统OCR方案

查看原文 →