<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>论文阅读 on Ganko Space</title><link>https://ganko.asia/tags/%E8%AE%BA%E6%96%87%E9%98%85%E8%AF%BB/</link><description>Recent content in 论文阅读 on Ganko Space</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Sun, 21 Jun 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://ganko.asia/tags/%E8%AE%BA%E6%96%87%E9%98%85%E8%AF%BB/index.xml" rel="self" type="application/rss+xml"/><item><title>[论文阅读] Vision Transformers Need More Than Registers</title><link>https://ganko.asia/posts/read_vit_lazy_aggregation/</link><pubDate>Sun, 21 Jun 2026 00:00:00 +0000</pubDate><guid>https://ganko.asia/posts/read_vit_lazy_aggregation/</guid><description>&lt;h2 id="一句话总结">一句话总结&lt;/h2>
&lt;p>ViT使用语义无关的背景块作为表示全局语义的捷径，在全局注意力和粗粒度语义监督的驱动下。这篇论文选择性地将补丁特征集成到CLS token中，减少了背景主导的快捷方式的影响，并在标签、文本和自监督的情况下，在12个基准测试中提高性能。&lt;/p>
&lt;h2 id="论文信息">论文信息&lt;/h2>
&lt;ul>
&lt;li>标题：Vision Transformers Need More Than Registers&lt;/li>
&lt;li>作者：Cheng Shi, Yizhou Yu, Sibei Yang (University of Hong Kong &amp;amp; Sun Yat-sen University)&lt;/li>
&lt;li>会议/期刊：arXiv preprint (2602.22394)&lt;/li>
&lt;li>链接：&lt;a href="https://arxiv.org/abs/2602.22394">https://arxiv.org/abs/2602.22394&lt;/a>&lt;/li>
&lt;li>代码：&lt;a href="https://github.com/ChengShiest/LAST-ViT">https://github.com/ChengShiest/LAST-ViT&lt;/a>&lt;/li>
&lt;li>前置工作：&lt;em>Vision Transformers Need Registers&lt;/em> (Darcet et al., ICLR 2024)&lt;/li>
&lt;/ul>
&lt;h2 id="研究背景与动机">研究背景与动机&lt;/h2>
&lt;ul>
&lt;li>原始 ViT 中的 CLS token 用于聚合全局图像表示&lt;/li>
&lt;li>Darcet et al. (ICLR 2024) 发现 ViT 的特征图中会出现异常的 high-norm artifact patches，提出添加额外的 register tokens 来吸收这些 artifacts&lt;/li>
&lt;li>但这篇论文认为问题不仅仅是 artifact patches —— ViT 存在更根本的 &lt;strong>lazy aggregation&lt;/strong> 行为，Lazy Aggregation：在图像级粗粒度监督下，ViT倾向于将前景语义&amp;quot;扩散&amp;quot;到大量背景patch中，利用背景token作为编码全局语义的捷径。&lt;/li>
&lt;/ul>
&lt;blockquote>
&lt;p>lazy aggregation是这篇论文贡献中提出的一个关键假设，但是我不认为应该这么局限于vit，我认为这是对于目前整个学习范式的问题，数据不可能做到面面俱到，模型在寻找最优解的时候可能会偏向于利用背景分析，比如dataset中所有bird类图片的background都是类似的，模型就会把背景作为一个主要判断依据，但是从另一个角度来看，又不能完全不考虑背景信息，例如一个像狗又像狼的生物，在野外会判断成狼，但是在农村院子里就是狗，虽然通过主体自身信息能做到百分之八十到九十的准确性，但是背景并非完全无用，就像我在我的论文中描述的一样。&lt;/p></description></item></channel></rss>