AMAZINGINDEX.COM 日报快照
50.5
VOL. 2026.07
2026.07.14
← 返回 2026.07.14 日报
日报快照 · Daily Snapshot
NO. 019

视觉预训练挑战文本-only范式

#HF_PAPERS HuggingFace Papers 2026.07.14
推荐指数 73.0 NO. 019 · 2026.07.14
upvotes40comments0

该研究证明语言模型可直接从文档、网页的视觉布局(图表、公式、排版)中进行无监督预训练,无需先转为纯文本。这意味着大量被OCR丢弃的视觉信息可被利用,可能改变多模态模型的训练范式。

视觉预训练挑战文本-only范式

当前主流做法是用OCR或PDF解析把文档转成markdown再训练,比如Llama 4的PDF解析管线,信息损失极大。这篇论文直接拿原始视觉信号做预训练,相当于让模型自己学'怎么读排版',而不是人类 handcrafted 规则。

从工程角度看,这路线比Gemini的原生多模态更激进——不是加视觉encoder,而是完全用视觉替代文本作为预训练目标。如果scaling law成立,arxiv上那几百万篇带复杂公式的论文将成为全新数据金矿。

主要悬念是算力成本:视觉token序列长度通常是文本的10-100倍,论文未披露具体训练规模,需要等开源代码和训练细节才能判断实用性。

查看原文 →