视觉分词器终于不丢细节了
推荐指数 71.0 NO. 022 · 2026.06.27
upvotes34comments1
为什么值得看
ViQ 提出了一种视觉量化框架,让离散视觉表示同时保留语义信息和低层细节,支持任意分辨率原生输入。对做多模态预训练的团队来说,这意味着不用再在重建质量和语义对齐之间二选一。
媒体预览
编辑判断
之前视觉分词器的困境很典型:VQ-VAE 路线重建细节好但语义弱,CLIP 特征语义强却丢细节,做多模态预训练时往往需要两套表示拼在一起。ViQ 的核心 trick 是把文本对齐约束直接灌进量化过程,让 codebook 向量天然携带语义,同时用分层量化保留高频细节。
从工程落地看,任意分辨率原生输入是个关键卖点——现有方法大多把图像 resize 到固定尺寸,高分辨率图直接压崩。如果开源代码和预训练权重能跟上,做文档理解、遥感、医学影像这些对分辨率敏感的场景,可以优先试 ViQ 替换掉现有的视觉编码器。
相关内容
UniTok: A Unified Tokenizer for Visual Generation and Understanding 统一视觉生成与理解的Tokenizer,解决视觉分词器在生成与理解任务中的割裂问题,与原文主题高度相关。 Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations 提出Text-Aligned Tokenizer,用文本对齐的离散语义表示统一视觉理解与生成,避免细节丢失。 拒绝双分词器割裂!UNIAR:让视觉生成与理解在同一个大脑里闭环 通过Bitwise离散视觉token统一处理文本与图像,避免双分词器架构的信息损失。 Language Model Beats Diffusion — Tokenizer is Key to Visual Generation MAGVIT-v2视频分词器证明Tokenizer质量是视觉生成关键,为视觉分词器保真度研究提供基础。