[论文阅读] Vision Transformers Need More Than Registers
一句话总结 ViT使用语义无关的背景块作为表示全局语义的捷径,在全局注意力和粗粒度语义监督的驱动下。这篇论文选择性地将补丁特征集成到CLS token中,减少了背景主导的快捷方式的影响,并在标签、文本和自监督的情况下,在12个基准测试中提高性能。 论文信息 标题:Vision Transformers Need More Than Registers 作者:Cheng Shi, Yizhou Yu, Sibei Yang (University of Hong Kong & Sun Yat-sen University) 会议/期刊:arXiv preprint (2602.22394) 链接:https://arxiv.org/abs/2602.22394 代码:https://github.com/ChengShiest/LAST-ViT 前置工作:Vision Transformers Need Registers (Darcet et al., ICLR 2024) 研究背景与动机 原始 ViT 中的 CLS token 用于聚合全局图像表示 Darcet et al. (ICLR 2024) 发现 ViT 的特征图中会出现异常的 high-norm artifact patches,提出添加额外的 register tokens 来吸收这些 artifacts 但这篇论文认为问题不仅仅是 artifact patches —— ViT 存在更根本的 lazy aggregation 行为,Lazy Aggregation:在图像级粗粒度监督下,ViT倾向于将前景语义"扩散"到大量背景patch中,利用背景token作为编码全局语义的捷径。 lazy aggregation是这篇论文贡献中提出的一个关键假设,但是我不认为应该这么局限于vit,我认为这是对于目前整个学习范式的问题,数据不可能做到面面俱到,模型在寻找最优解的时候可能会偏向于利用背景分析,比如dataset中所有bird类图片的background都是类似的,模型就会把背景作为一个主要判断依据,但是从另一个角度来看,又不能完全不考虑背景信息,例如一个像狗又像狼的生物,在野外会判断成狼,但是在农村院子里就是狗,虽然通过主体自身信息能做到百分之八十到九十的准确性,但是背景并非完全无用,就像我在我的论文中描述的一样。 ...