<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>CV on Ganko Space</title><link>https://ganko.asia/tags/cv/</link><description>Recent content in CV on Ganko Space</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Fri, 05 Jun 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://ganko.asia/tags/cv/index.xml" rel="self" type="application/rss+xml"/><item><title>CV领域的多任务统一模型</title><link>https://ganko.asia/posts/cv%E9%A2%86%E5%9F%9F%E7%9A%84%E5%A4%9A%E4%BB%BB%E5%8A%A1%E7%BB%9F%E4%B8%80%E6%A8%A1%E5%9E%8B/</link><pubDate>Fri, 05 Jun 2026 00:00:00 +0000</pubDate><guid>https://ganko.asia/posts/cv%E9%A2%86%E5%9F%9F%E7%9A%84%E5%A4%9A%E4%BB%BB%E5%8A%A1%E7%BB%9F%E4%B8%80%E6%A8%A1%E5%9E%8B/</guid><description>&lt;blockquote>
&lt;p>改论文intro的时候突然想到，看到过有人问为什么CV领域没一个Scaling law，很明显的原因是CV领域不同的任务太多了，先不说图片的信息密度问题，单是把所有任务统一到一个模型里，都很费时间。但是又想到，大部分cv任务本质上可以通过完美的理解图片来解决，比如：模型知道每一块每一个像素具体是哪个类别的（或者有一些任务是某种属性）。这样就有一个想法: 假设有一个模型，在给定一个框（可以是像素，也可以是规则/不规则的块）和完整图片，模型需要知道这个框是什么类别的，这样的话分类任务可以通过最高占比来决定（一张蜜蜂的图片，大部分是空白蓝天会分类错误，但是这并不能证明这个方法的缺陷，只能说明预先定义了空白蓝天是无意义的类别（从平常摄影的角度来说，也可能是对焦问题））；分割和定位任务可以通过对每一个像素点（或者说大patch，像素太小了）循环问是什么类别来得到，不过这个时候就会有一个问题，效率问题，很自然就想到一个办法，采样。 想到这里突然就联系起来了 ，SAM用的就是用的采样，但是依然很慢其实（）。想法就到这里了，虽然没什么结果，但是让我知道了这个领域，这篇就用来记一下试图去统一CV任务的论文阅读了（可能论文本身没写，但是确是有这种趋势或者可能的也会在这里放） 2026/6/5&lt;/p>&lt;/blockquote>
&lt;hr>
&lt;blockquote>
&lt;p>写完上边那些突然想到，超分、去雾、生成这些任务怎么统一啊，诶，看来还是论文看少了。最后感慨一下，如果放在以前，脑子里有这么一个奇怪的idea，我需要花费数周的时间查询阅读相关论文，但是现在只需要一个小时就能大概了解这个方向大家在做什么。 2026/6/5&lt;/p>&lt;/blockquote>
&lt;h2 id="gpt4roieccv-workshops-2024">GPT4RoI[ECCV WORKSHOPS 2024]&lt;/h2>
&lt;p>GPT最推荐我读的论文。它用户 instruction 里的 RoI / box 替换成 RoI features，再送进 LLM，做 region-level image understanding。它还强调 region-text pairs 对细粒度理解的重要性。&lt;/p></description></item></channel></rss>