视觉预训练挑战文本-only范式
推荐指数 73.0 NO. 019 · 2026.07.14
upvotes40comments0
为什么值得看
该研究证明语言模型可直接从文档、网页的视觉布局(图表、公式、排版)中进行无监督预训练,无需先转为纯文本。这意味着大量被OCR丢弃的视觉信息可被利用,可能改变多模态模型的训练范式。
媒体预览
编辑判断
当前主流做法是用OCR或PDF解析把文档转成markdown再训练,比如Llama 4的PDF解析管线,信息损失极大。这篇论文直接拿原始视觉信号做预训练,相当于让模型自己学'怎么读排版',而不是人类 handcrafted 规则。
从工程角度看,这路线比Gemini的原生多模态更激进——不是加视觉encoder,而是完全用视觉替代文本作为预训练目标。如果scaling law成立,arxiv上那几百万篇带复杂公式的论文将成为全新数据金矿。
主要悬念是算力成本:视觉token序列长度通常是文本的10-100倍,论文未披露具体训练规模,需要等开源代码和训练细节才能判断实用性。