AMAZINGINDEX.COM 日报快照
60.6
VOL. 2026.07
2026.07.16
← 返回 2026.07.16 日报
日报快照 · Daily Snapshot
NO. 020

合成文档基准拆解VLM失效根因

#HF_PAPERS HuggingFace Papers 2026.07.16
推荐指数 69.0 NO. 020 · 2026.07.16
upvotes48comments1

SynthDocBench 是一个全合成的长文档视觉理解基准,通过组合设计独立控制文档长度、布局、模态和题目难度。它解决了现有基准无法定位模型失败原因的问题,让工程师能精准优化 VLM 的特定短板。

合成文档基准拆解VLM失效根因

做文档 RAG 的团队应该都遇到过这种 frustration:模型在 DocVQA 上分数漂亮,一到真实合同、财报、手册就崩,但根本不知道是太长、太乱、还是图表太多导致的。这个基准的价值在于把变量拆开,像控制实验一样定位问题。

相比 MMLongBench-Doc 这些真实文档基准,合成数据的好处是零标注成本、无限扩展、因子可控,缺点是分布外泛化存疑。建议搭配使用:用 SynthDocBench 做诊断和迭代,用真实基准做最终验收。论文未提及是否开源生成 pipeline,如果开源会大幅提升实用价值。

查看原文 →