<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>胡思乱想 on Ganko Space</title><link>https://ganko.asia/tags/%E8%83%A1%E6%80%9D%E4%B9%B1%E6%83%B3/</link><description>Recent content in 胡思乱想 on Ganko Space</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Fri, 05 Jun 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://ganko.asia/tags/%E8%83%A1%E6%80%9D%E4%B9%B1%E6%83%B3/index.xml" rel="self" type="application/rss+xml"/><item><title>CV领域的多任务统一模型</title><link>https://ganko.asia/posts/cv%E9%A2%86%E5%9F%9F%E7%9A%84%E5%A4%9A%E4%BB%BB%E5%8A%A1%E7%BB%9F%E4%B8%80%E6%A8%A1%E5%9E%8B/</link><pubDate>Fri, 05 Jun 2026 00:00:00 +0000</pubDate><guid>https://ganko.asia/posts/cv%E9%A2%86%E5%9F%9F%E7%9A%84%E5%A4%9A%E4%BB%BB%E5%8A%A1%E7%BB%9F%E4%B8%80%E6%A8%A1%E5%9E%8B/</guid><description>&lt;blockquote>
&lt;p>改论文intro的时候突然想到，看到过有人问为什么CV领域没一个Scaling law，很明显的原因是CV领域不同的任务太多了，先不说图片的信息密度问题，单是把所有任务统一到一个模型里，都很费时间。但是又想到，大部分cv任务本质上可以通过完美的理解图片来解决，比如：模型知道每一块每一个像素具体是哪个类别的（或者有一些任务是某种属性）。这样就有一个想法: 假设有一个模型，在给定一个框（可以是像素，也可以是规则/不规则的块）和完整图片，模型需要知道这个框是什么类别的，这样的话分类任务可以通过最高占比来决定（一张蜜蜂的图片，大部分是空白蓝天会分类错误，但是这并不能证明这个方法的缺陷，只能说明预先定义了空白蓝天是无意义的类别（从平常摄影的角度来说，也可能是对焦问题））；分割和定位任务可以通过对每一个像素点（或者说大patch，像素太小了）循环问是什么类别来得到，不过这个时候就会有一个问题，效率问题，很自然就想到一个办法，采样。 想到这里突然就联系起来了 ，SAM用的就是用的采样，但是依然很慢其实（）。想法就到这里了，虽然没什么结果，但是让我知道了这个领域，这篇就用来记一下试图去统一CV任务的论文阅读了（可能论文本身没写，但是确是有这种趋势或者可能的也会在这里放） 2026/6/5&lt;/p>&lt;/blockquote>
&lt;hr>
&lt;blockquote>
&lt;p>写完上边那些突然想到，超分、去雾、生成这些任务怎么统一啊，诶，看来还是论文看少了。最后感慨一下，如果放在以前，脑子里有这么一个奇怪的idea，我需要花费数周的时间查询阅读相关论文，但是现在只需要一个小时就能大概了解这个方向大家在做什么。 2026/6/5&lt;/p>&lt;/blockquote>
&lt;h2 id="gpt4roieccv-workshops-2024">GPT4RoI[ECCV WORKSHOPS 2024]&lt;/h2>
&lt;p>GPT最推荐我读的论文。它用户 instruction 里的 RoI / box 替换成 RoI features，再送进 LLM，做 region-level image understanding。它还强调 region-text pairs 对细粒度理解的重要性。&lt;/p></description></item><item><title>胡思乱想</title><link>https://ganko.asia/posts/%E8%83%A1%E6%80%9D%E4%B9%B1%E6%83%B3/</link><pubDate>Fri, 27 Mar 2026 00:00:00 +0000</pubDate><guid>https://ganko.asia/posts/%E8%83%A1%E6%80%9D%E4%B9%B1%E6%83%B3/</guid><description>&lt;blockquote>
&lt;p>这里用来记录一些无论是产品角度的想法，还是算法角度的想法，或者是一些其他的想法。总之就是一些胡思乱想，这里不会引用任何论文，我也不会去查找任何资料，完全是凭空想象的。也就是说，这里记录的内容可能完全是错误的，甚至是荒谬的，但我觉得有趣，所以就记录下来.&lt;/p>&lt;/blockquote>
&lt;h2 id="神奇的特征空间-2026-4-1">神奇的特征空间 2026-4-1&lt;/h2>
&lt;p>在这个神奇的特征空间中，同一物体的特征不再是无规律的，而是可以通过运算得到的，例如：&lt;/p>
&lt;ul>
&lt;li>一个朝向我可乐瓶的特征可以通过旋转得到一个背向我的可乐瓶的特征。&lt;/li>
&lt;li>一半可乐瓶的特征应该是contact另一半可乐瓶的特征得到完整可乐瓶的特征。&lt;/li>
&lt;/ul>
&lt;p>具体来说，就是一个可旋转，拼接，以及不同角度拼接的特征空间，如果可以的话，这个特征空间应该是三维的（不过很明显这里的特征不包括-一瓶水甜还是苦这种单从图片无法推测的属性）&lt;/p>
&lt;h2 id="vit和cnn都有的惰性问题依赖背景对主体进行识别-2026-4-18">VIT和CNN都有的惰性问题：依赖背景对主体进行识别 2026-4-18&lt;/h2>
&lt;p>在一些数据集中，模型可能会过度依赖背景信息来识别主体。例如，在一个包含大量猫的图片数据集中，模型可能会学会通过识别草地或室内环境来判断图片中是否有猫，而不是通过识别猫的特征。这种依赖背景的现象可能会导致模型在面对新的环境或背景时表现不佳，因为它没有真正学会识别主体的特征。&lt;/p>
&lt;p>找到哪些受上下文影响较大的特征，让模型仅通过这些特征识别，让总体的识别减去这些敏感特征的识别，效果会不会变好。因为从最近研究的因果角度来说，背景信息某种程度上也会影响主体的识别，所以完全去除背景信息可能也不是最好的选择，而是找到一个平衡点，让模型减去完全使用背景信息盲猜的结果，在因果图上相当于切断了背景信息对主体识别的直接影响，但保留了背景信息通过主体再影响识别的间接影响。&lt;/p>
&lt;blockquote>
&lt;p>补充:四月刷到了一篇关于解决VIT这个问题的论文，不过没看，不知道他用的什么方法（还是抽空看一下吧）;现在是5月26，这篇论文看了，笔记在&lt;a href="https://ganko.asia/posts/read_vit_lazy_aggregation/">vit_lazy_aggregation&lt;/a>但是还是有点不一样，和我想的有一点不一样，他还是在针对前景和背景这两个具体的块做，本质还是针对不同信息密度的区域做不同处理，有点像是任务导致的区别，分类任务本质就是要找到主体，而类分割任务要的是主要根据自身区域并一定程度上参考其他区域能给予的辅助信息来预测。（讲的好像不是很好，不过我暂时没心思做这么大的任务，说笼统一点就是，不分主体背景，模型就是根据那片区域本身和上下文区域的辅助信息来做预测，无论是分类任务还是类分割任务，这是一个完全符合人类逻辑的因果链条）&lt;/p>&lt;/blockquote>
&lt;h2 id="vlm对一个图像中不同区域的识别问题">VLM对一个图像中不同区域的识别问题&lt;/h2>
&lt;p>论文的方案想用VLM做标注，因为用原有数据集的位姿轨迹自监督效果并不好，主要是想让VLM去评估一个off-road场景下不同区域的Risk，方案开始是超像素分割-&amp;gt;合并并区域标号-&amp;gt;VLM评估每个区域的Risk。在用的时候发现，区域数目20-30（测的22）的时候，VLM会有自己编造的区域，会自己编造到30个区域。
原因可能感觉有很多：&lt;/p>
&lt;ul>
&lt;li>一个是图像的分辨率低，为了省钱，图像分辨率我用的是960*640，可能VLM觉得这个分辨率太低了，无法识别出足够的细节。&lt;/li>
&lt;li>第二个是超像素分割的问题，没有仔细调超像素的参，分割出很多长条状，形状极不规则的区域，增大了VLM的识别难度。&lt;/li>
&lt;li>第三个就是老生常谈的VLM根本没办法真正理解图片。
最终没采用VLM标注的方案，因为试了每个区域一个一个送，发现标完所有近两万张图的花费太高了，不知道老师会不会报销。&lt;/li>
&lt;/ul>
&lt;h2 id="相对数据会比绝对数据更有用吗-2026-5-7">相对数据会比绝对数据更有用吗 2026-5-7&lt;/h2>
&lt;blockquote>
&lt;p>这个idea已经总结成了一个确切的方案了，对比了一些现有的工作感觉值得做，打算做完现在这个和老师提一下，现在先自己做一些小范围的验证，反正有了ai之后做的快了很多。&lt;/p>&lt;/blockquote>
&lt;p>突然想起来毕设的任务里有一个小的深度估计器，还有当时对输入输出的分析，当时对比好的结果和坏的结果，发现好的定位结果的文本描述中相对位置的描述特别多，例如“在左边”、“在右边”、“在上面”、“在下面”等等，而坏的定位结果的文本描述中相对位置的描述特别少，更多的是绝对位置的描述，例如“在某个车右边0.5米处”，好像答辩的时候也提过这个问题，觉得相对位置的描述可能更有用。这辈子还有机会做这个问题吗？感觉这个问题挺有意思的，可能也挺有用的，如果能证明相对位置的描述更有用的话，可能会对定位任务优化有用，或许已经有人做了呢？一个本科毕设能分析出啥好东西来。&lt;/p>
&lt;h2 id="嘴型特征作为分布中心猜测文本和真实文本以他为中心-2026-5-15">嘴型特征作为分布中心，猜测文本和真实文本以他为中心 2026-5-15&lt;/h2>
&lt;p>这只是个猜测，这个点从一些up主一个人说话不出声，另一个人猜什么并和第三个人打电话沟通来的，我感觉，猜的文本很明显不是瞎猜的，是根据嘴型（主要），对方的性格，当时的情景等（不过要是一个人纯瞎说肯定没法猜了）。这个肯定可以用在从嘴型猜文本这个任务上，但是这个任务不知道有啥用（偷拍别人视频然后恢复人家说话来偷听？），我想的是之前做过语音驱动数字人（嘴型），在刚刚的猜测链条上加一个语音并且反过来，文本增强（如果能搞到这个分布的话增强更好）语音驱动数字人。还有一个，直接从嘴型猜文本很难，加上语音（语音本身直接就可以）相当于把之前以嘴型为中心的分布进行约束得到最终的文本，那如果用不同的语音约束呢。&lt;/p>
&lt;p>这个想法真怪，但是这个以嘴型特征分布为中心，我确信应该是对的，只是不知道怎么用。&lt;/p>
&lt;h2 id="llm生成模型来增强数据集来达到提升很多不同任务模型的因果推断能力-2026-5-24">LLM+生成模型来增强数据集来达到提升很多不同任务模型的因果推断能力 2026-5-24&lt;/h2>
&lt;p>以图像分类任务为例，假设我们现在有一个模型，想提升它的因果推断能力.首先我们需要知道，原本的错误的因果链是什么，例如在图像分类任务中，模型可能过度依赖背景信息来识别主体，那么这个错误的因果链就是背景信息→主体识别。我们想要提升模型的因果推断能力，就需要打破这个错误的因果链，让模型学会真正识别主体的特征，而不是依赖背景信息。我们不通过理论的方法来打破这个因果链，依然通过数据的方式。动机是，对于人类来说，其实我们也有很多错误的因果认知，不过人类可以在经由他人指出错误的因果认知之后，直接修改这个因果链，直接把错误的因果链改成正确的因果链，而不需要通过大量的数据来重新学习这个因果链。 但是对于模型来说，没有直接修改因果链这个说法，除非模型本身显示构建了，所以我们只能通过数据来间接修改这个因果链。&lt;/p>
&lt;p>大概的方案可能是，首先对输入数据进行全方位的结构化描述，然后根据预测结果进行分类，分为正确的预测结果和错误的预测结果两类，因为之前的描述很结构化，可以使用自动化工具来构建出模型的认知因果链，例如如果观测到，模型对一个猫的预测正确的描述中，大量的背景描述相似，并且错误预测中背景描述和正确预测的背景描述差异较大，那么我们就可以推断出模型可能过度依赖背景信息来识别主体。&lt;/p>
&lt;p>接下来我们就可以针对这个错误的因果链，构建一个新的数据集，这个数据集中的图像会有更多的背景变化，例如同一只猫在不同的背景下出现，这样模型就需要学会真正识别猫的特征，而不是依赖背景信息来识别猫了。通过这样的方式，我们就可以提升模型的因果推断能力，让模型学会真正识别主体的特征，而不是依赖背景信息来识别主体了。&lt;/p>
&lt;p>这个方案不会提出任何具体的模型结构和针对任何任务，而是一个通用的方案，可以应用于很多不同的任务，例如图像分类、目标检测、语义分割等等。通过这个方案，我们可以提升很多不同任务模型的因果推断能力。但是有个前提是，我们需要能够生成新的输入数据和确切的标签数据，对于分类任务来说很简单，例如我们可以生成同一只猫在不同背景下的图像，并且标签仍然是猫。对于其他任务来说可能会更复杂一些，例如目标检测，我们需要生成同一只猫在不同背景下的图像，并且标签需要包含猫的位置和大小等信息，这可能需要一些更复杂的生成策略实现。&lt;/p>
&lt;h2 id="人类直觉和ai的联系-2026-6-5">人类直觉和AI的联系 2026-6-5&lt;/h2>
&lt;p>很明显，上面idea很多都很直觉，我发现很多现有的领域/任务/方法都和人类有一些联系。这也让我重新审视一些之前习以为常的做法，例如特征金字塔实际上做的是，人看整体、看局部（他是同时看的，那如果是看了整体之后再看局部会更好还是更差）&lt;/p>
&lt;h3 id="放大图片但不增加分辨率">放大图片但不增加分辨率&lt;/h3>
&lt;p>在我看不清一个图片的时候，我会放大，但是实际上图片的分辨率并没有提高，这实际上是人类视觉系统与计算机视觉在处理有限信息时的区别。已经有很多工作有这种思想了，主要在于怎么“放大”，“放大”的本质是：用固定的感知资源去“扫描”一个更小的空间范围，从而提高该区域的信息采样密度。&lt;/p>
&lt;ul>
&lt;li>
&lt;p>空间注意力机制：模型学出一个“关注度热图”（如Transformer中的注意力权重），然后让后续层只对高权重区域进行精细计算，其他区域粗略处理，模拟人类聚焦的思想。&lt;/p>
&lt;/li>
&lt;li>
&lt;p>多尺度推理 + 空间插值: 模拟放大并重新看的思想，将图像（或特征图）的一个局部区域通过双线性插值等操作“物理放大”到原来尺寸，再送入模型进行二次判断。虽然插值不增加信息，但它让后续的卷积核能够在该区域上用更多的参数去扫描，相当于人类眼球在局部区域做更多扫视。&lt;/p>
&lt;/li>
&lt;li>
&lt;p>递归/循环放大 (Recursive Zoom)：模型反复对自己生成的“放大预测”进行再分析，逐轮修正。例如，先用低分辨率图像得到一个粗糙的语义图，然后将其作为先验，引导对原始低分辨率图像的第二次“注意力扫描”。&lt;/p>
&lt;/li>
&lt;li>
&lt;p>特征金字塔 (Feature Pyramid Networks)：模型从原始图像中提取多尺度的特征图（例如原图的 1/4, 1/8, 1/16 大小）。高层特征感受野大，负责看整体；低层特征分辨率高，负责看细节。在进行推理时，融合高低层信息，相当于同时对全图（宏观）和局部（微观）进行“放大观察”。&lt;/p>
&lt;/li>
&lt;/ul></description></item></channel></rss>