改论文intro的时候突然想到,看到过有人问为什么CV领域没一个Scaling law,很明显的原因是CV领域不同的任务太多了,先不说图片的信息密度问题,单是把所有任务统一到一个模型里,都很费时间。但是又想到,大部分cv任务本质上可以通过完美的理解图片来解决,比如:模型知道每一块每一个像素具体是哪个类别的(或者有一些任务是某种属性)。这样就有一个想法: 假设有一个模型,在给定一个框(可以是像素,也可以是规则/不规则的块)和完整图片,模型需要知道这个框是什么类别的,这样的话分类任务可以通过最高占比来决定(一张蜜蜂的图片,大部分是空白蓝天会分类错误,但是这并不能证明这个方法的缺陷,只能说明预先定义了空白蓝天是无意义的类别(从平常摄影的角度来说,也可能是对焦问题));分割和定位任务可以通过对每一个像素点(或者说大patch,像素太小了)循环问是什么类别来得到,不过这个时候就会有一个问题,效率问题,很自然就想到一个办法,采样。 想到这里突然就联系起来了 ,SAM用的就是用的采样,但是依然很慢其实()。想法就到这里了,虽然没什么结果,但是让我知道了这个领域,这篇就用来记一下试图去统一CV任务的论文阅读了(可能论文本身没写,但是确是有这种趋势或者可能的也会在这里放) 2026/6/5
写完上边那些突然想到,超分、去雾、生成这些任务怎么统一啊,诶,看来还是论文看少了。最后感慨一下,如果放在以前,脑子里有这么一个奇怪的idea,我需要花费数周的时间查询阅读相关论文,但是现在只需要一个小时就能大概了解这个方向大家在做什么。 2026/6/5
GPT4RoI[ECCV WORKSHOPS 2024]
GPT最推荐我读的论文。它用户 instruction 里的 RoI / box 替换成 RoI features,再送进 LLM,做 region-level image understanding。它还强调 region-text pairs 对细粒度理解的重要性。