AMAZINGINDEX.COM 日报快照
54.2
VOL. 2026.06
2026.06.27
← 返回 2026.06.27 日报
日报快照 · Daily Snapshot
NO. 022

视觉分词器终于不丢细节了

#HF_PAPERS HuggingFace Papers 2026.06.27
推荐指数 71.0 NO. 022 · 2026.06.27
upvotes34comments1

ViQ 提出了一种视觉量化框架,让离散视觉表示同时保留语义信息和低层细节,支持任意分辨率原生输入。对做多模态预训练的团队来说,这意味着不用再在重建质量和语义对齐之间二选一。

视觉分词器终于不丢细节了

之前视觉分词器的困境很典型:VQ-VAE 路线重建细节好但语义弱,CLIP 特征语义强却丢细节,做多模态预训练时往往需要两套表示拼在一起。ViQ 的核心 trick 是把文本对齐约束直接灌进量化过程,让 codebook 向量天然携带语义,同时用分层量化保留高频细节。

从工程落地看,任意分辨率原生输入是个关键卖点——现有方法大多把图像 resize 到固定尺寸,高分辨率图直接压崩。如果开源代码和预训练权重能跟上,做文档理解、遥感、医学影像这些对分辨率敏感的场景,可以优先试 ViQ 替换掉现有的视觉编码器。

查看原文 →