合成文档基准拆解VLM失效根因
推荐指数 69.0 NO. 020 · 2026.07.16
upvotes48comments1
为什么值得看
SynthDocBench 是一个全合成的长文档视觉理解基准,通过组合设计独立控制文档长度、布局、模态和题目难度。它解决了现有基准无法定位模型失败原因的问题,让工程师能精准优化 VLM 的特定短板。
媒体预览
编辑判断
做文档 RAG 的团队应该都遇到过这种 frustration:模型在 DocVQA 上分数漂亮,一到真实合同、财报、手册就崩,但根本不知道是太长、太乱、还是图表太多导致的。这个基准的价值在于把变量拆开,像控制实验一样定位问题。
相比 MMLongBench-Doc 这些真实文档基准,合成数据的好处是零标注成本、无限扩展、因子可控,缺点是分布外泛化存疑。建议搭配使用:用 SynthDocBench 做诊断和迭代,用真实基准做最终验收。论文未提及是否开源生成 pipeline,如果开源会大幅提升实用价值。