所有之前
这篇文章是我在阅读因果理论在视觉方面应用相关论文时的笔记总结,通过这篇文章,我希望能够系统地梳理相关论文的核心方法和我的理解和思考。 后边到了写作的时候,增加了一些写作的参考。写作思路部分会按照普遍论文的结构进行-摘要、引言、相关工作、方法、实验、结论来总结写作思路,当然也会根据不同论文的特点进行调整。
[TPAMI] A Causal Adjustment Module for Debiasing Scene Graph Generation
这篇论文想解决什么问题?
这篇论文想解决场景图生成中对于长尾关系对的偏见问题,通过基于全局的统计量设计的一个后处理模块来调整模型的预测结果,从而提升模型在长尾关系对上的性能。
传统的去偏方法(重采样、重加权、调整方法)只关注关系分布 R 的长尾问题,但它们忽略了一个更深层的因果链条:
物体分布 O → 物体对分布 P → 关系分布 R :
- 物体分布 O :不同物体类别的频率(如"人"很常见,“大象"很罕见)
- 物体对分布 P :两个物体共同出现的频率(如<人, 椅子>很常见,<人, 大象>很罕见)
- 关系分布 R :具体关系的频率
仅仅建模 O→P 是不够的,直观上,如果"人"和"树"都是高频物体,按 O→P 的逻辑,<人, 树>应该是最常见的物体对。但现实中,<人, 衬衫>比<人, 树>更常见,因为人和衬衫的共现(Co-occurrence)概率更高。
论文提出了 Mediator-based Causal Chain Model (MCCM),将因果链修正为:
$$ O→中介:共现分布 C→P→R $$核心方法

原理:从因果推断中引入 Average Treatment Effect (ATE) 概念,用于指导调整因子的学习。
反事实问题:如果能把物体对分布 P 从"高频状态”(p )改为"低频状态"(p0 ),模型的预测会如何变化?
公式 20 展示了 CAModule 如何估计这种反事实效应:
$$\begin{aligned}&Y_{ijk}^{do(x)}=\int[E(Y_{ijk}|X_{ij},do(O=o,C=c,P=p,R=r))-E(Y_{ijk}|X_{ij},do(O=o,C=\\&c,P=p_0,R=r))]P(o)P(c)P(p)P(r)\cdots\end{aligned}$$并且传统的去偏方法,是针对关系类别别进行调整的,而 CAModule 是针对每个关系实例进行调整的,这样可以更细粒度地去偏,如下图。

我的理解与思考
这篇论文的关键在于引入了中介变量C来修正因果链条,从而更准确地建模物体对的共现关系。
并且在后边没有显式计算反事实效应,而是通过一个可学习的调整因子来隐式地捕捉这种效应。
在cv方面,反事实数据大部分时间没有对应的标签,因此通过可学习的调整因子来捕捉反事实效应是一种非常实用的策略,例如在图像分类中,想知道过根据光照等因素类别修正图像分类的结果,直接计算反事实效应是不可行的,这个方法不仅可以用于去偏,去混杂也是可以的。
因为现在cv中很多因果推断方法都是在试图学一个纯净的因果特征,这种方法不是要学一个纯净的因果特征,而是要学在不同的混杂情况下,如何去调整预测结果能让模型更准确。
写作思路
Abstract: 这篇方法的主要贡献是MCCM因果链和一个模型无关的即插即用的后处理模块,摘要前边部分没什么东西,公式化讲为什么要做这篇工作(这点大部分都有,通过现有工作的问题引入),然后说我们通过什么引用什么理论进行什么分析,提出了一个模块,这个模块能做什么。主要是实验效果阐述部分,分析工具的论文可能会更强调发现了什么有趣的现象或者得到了什么新的理解,而方法论文更强调性能提升。
这篇论文的introduction部分感觉和我的论文很适合,准备基于这个的结构写一个,因为都是一个因果SCM和一个网络,不过他的是一个后处理模块,而我是整个网络都是基于这个SCM设计的,我的不仅是一个方法论文还是一个范式更新的论文,所以在范式这个问题上需要参考一下其他有关范式更新的论文,看看他们是怎么写的,怎么强调范式更新的重要性的。
Introduction:第一段介绍这个任务是干什么的和重要性。第二段讲了问题,并详细描述原因,放点图表示问题等,如果已经有一些研究想要解决,就大概说一下这些是怎么做的,哪里不好,主要在论文方法和他们的区别。第三段在基于这些观测现象等,
[TIP] Progressive Invariant Causal Feature Learning for Single Domain Generalization
这篇论文想解决什么问题?
这篇论文要解决的是单域泛化(Single Domain Generalization, SDG) 中的核心难题:
如何仅用一个源域(source domain)的数据训练模型,使其能够泛化到多个未见过的目标域(unseen target domains),同时应对未知的域偏移(domain shift)问题。
这种情况的核心在于学习域不变的因果特征(invariant causal features),这些特征在不同域之间保持稳定,不受域偏移的影响。
作者提出的核心问题是:如何从因果机制出发,准确提取出与对象真实标签相关的、跨域不变的因果特征,从而提升单域泛化的能力。
核心方法

这篇论文的方法主要分为两部分,一部分是学习主体特征,一部分是学习域不变的因果特征。

学习完整的主体特征:通过FFFilter前景过滤器,FFFilter 不是传统 VAE,而是一个循环迭代结构的变分自编码器。每轮中分别用两个卷积网络估计当前特征的均值和方差对数,然后引入一个高斯噪声进行重参数化采样,再用解码器将采样的特征解码成新的特征图,最后将新旧特征图进行融合得到下一轮的输入特征图,循环t次之后就得到了一个主体特征。
问题的关键是如何确保学到的是主体特征,这部分是通过对比损失和分类监督实现的.
假设在迭代过程中
- $h_t$是当前轮抽取的隐变量(应包含对象信息)。
- 原始特征 $F_b$ 包含了对象+背景。
- 定义一个背景特征:$F_g = F_b - h_t$,剩余部分主要代表背景/风格等非因果信息。
对比损失拉近 $h_t$ 与下一轮的 $h_{t+1}$ 之间的距离(它们应该都富含对象信息),拉远 $h_t$ 与背景特征 $F_g$ 之间的距离。
学习域不变的特征通过风格变换实现,对 FFFilter 输出的特征进行快速傅里叶变换(FFT),分解为振幅(风格信息) 和相位(对象信息),对振幅部分进行条件高斯分布建模,并从分布边界采样新的风格特征(而非中心区域)。将采样的振幅与原始相位融合,通过逆 FFT 生成新的特征图$F_c$,最后将原始特征与增强特征一起输入分类器,计算交叉熵损失。
我的理解与思考
这篇论文就是在CAM中提到的试图学一个纯净的因果特征的思路上,提出了一个具体的方法来实现这个目标,有意思的地方在于通过对比损失和监督损失来确保学到的特征是主体特征,而不是背景特征;风格变换部分倒是比较好想的做法,不过边缘采样的思路还是挺有启发的。
FFFilter的设计有一个前提,想要学习的这个纯净的因果特征,有一个确定的’果’,也就是对象标签,这样就可以通过分类监督来引导学习过程,在无监督的情况下,如何确保学到的特征是因果特征而不是其他无关特征,这个问题就比较棘手了。
即便是有’果’的任务中,例如分割任务,和图像分类任务相比,分割任务中每个像素点的标签都是一个’果’,而且这些’果’之间还存在空间关系,并且计算量也更大,这些都会给学习纯净的因果特征带来更多的挑战,不过超像素一些方法应该能一定程度上缓解,前向高斯好像也是这么过来的:从每个点一个高斯->每个固定patch一个高斯->每个超像素一个高斯(师兄好像在做)。
[TPAMI] Interpreting Low-level Vision Models with Causal Effect Maps
这篇论文想解决什么问题?
深度神经网络在低级视觉任务(如图像去噪、超分辨率、图像修复等)中取得了显著的性能提升,但其内部机制仍然缺乏透明度和可解释性。现有的可视化方法(如特征图可视化、梯度加权类激活映射等)主要关注于高层语义任务,对于低级视觉任务的解释能力有限。
这篇论文主要是提出了一个模型无关的诊断分析工具因果效应图(CEM),用于解释低级视觉模型的行为。通过 CEM,可以可视化和量化积极或消极影响的投入产出关系。
使用CEM分析,论文在摘要中提到了一些有趣的发现(对于低级视觉任务):
(1)使用更多的输入图像信息(例如更大的感受野)并不总是能产生积极的结果 –> 这可能是因为在低级视觉任务中,过多的全局信息可能会引入噪声或不相关的特征,从而干扰模型的性能。
(2)尝试将具有全局感受野(例如通道注意力)的机制纳入图像去噪可能会被证明是徒劳的 –> 这可能是因为全局机制在去噪任务中可能会过度平滑图像,导致细节丢失,从而降低去噪效果。
(3) 整合多个任务来训练通用模型可以鼓励网络优先考虑本地信息而不是全局信息 –> 这可能是因为在多任务训练中,模型需要在不同任务之间找到一个平衡点,而本地信息通常对于多个任务都是有用的,因此模型可能会倾向于优先利用本地特征,这里的本地信息指的是局部纹理、边缘等细节特征,这些对于低级视觉任务来说通常是更关键的。(这个在一定程度上能限制很多上下文的干扰 可以用到我off-road trav es那篇论文里的点)
方法
因为已经到了写作阶段,所以自这篇论文往后的部分都会增加一些写作思路的总结到各个部分,但是也会分一块专门来总结写作思路,主要是为了少读几遍就写完一个篇论文的总结,而不是读一遍写方法,读一遍写理解,读一遍写写作思路,这样效率会比较低。
在方法之前,这篇论文和其他论文不同的是,他专门写了一张motivation:from corralation to causation,从相关性到因果关系,这个动机部分清晰地展示了为什么需要从相关性转向因果关系,以及CEM在这个转变中的作用。但是在<方法>这部分先不看这个motivation,这章主要讲method和method部分的写作思路。
回到论文要解决的问题,要提出一个模型无关的工具来满足不同网络结构和方法的分析需求,这要求把网络和方法的细节抽象掉,看作一个黑盒,输入是图像,输出是结果,通过对输入图像的不同干预来分析模型的行为,这个工具就是CEM。
因果关系干预概念和这个想法非常契合,干预是评估变量之间是否存在直接因果关系的直接有效方法。当通过函数 F(·) 检查输入集 I 中的变量 pi 与其对应的输出 F(I) 之间的因果关系时,我们可以通过干预来破坏观察到的原始输入和输出的相关性,表示为 do(pi = x)
坦白来讲,我觉得这篇论文的创新实际上一般(),诶,闹麻了,随便放点图吧,如果原作者看到了别骂我

这个图展示了CEM的干预框架,输入图像被划分为多个区域,每个区域都可以被单独干预,然后观察模型输出的变化,从而评估每个区域对模型预测的因果影响。但是因为path很多,如果每个区域都严格按照平均ATE的思想进行多次干预并计算,计算量会非常大,所以论文在工程层面进行了优化,具体来说分了粗细两阶段,第一阶段是粗粒度的干预,用极少干预次数,将 patch 划分为无关集 U 和敏感集 S 。第二阶段中,对敏感集 S 中的 patch,执行充分干预以获得稳定 ATE;对无关集 U 直接复用粗筛结果。

写作思路
Abstract:
从内容上来说,CEM摘要部分首先阐述了为什么要做这篇工作(这点大部分都有,通过现有工作的问题引入)。重点是在后边阐述,CEM首先说明引入什么理论来做什么,并提出了一个什么方法,这个方法能做什么.从这篇论文出发来说的话,因为CEM本身是一个分析工具,所以在摘要中写了CEM能发现得到什么有趣的现象,但是如果是一个方法论文的话,就要写这个方法能得到什么样的性能提升了。因为摘要部分的内容少,呈现思路可以很简单的从内容上看出,总的目的是要让审稿人知道这篇论文是做什么的,为什么要做,怎么做的,以及做了之后有什么有趣的发现或者性能提升。
学术化的表述:
To take up this challenge, we introduce ··· theory to ··· and propose ···;
Introduction:
首先上来公式化介绍这个任务/领域/问题,接着介绍现有方法的不足/或者问题,然后说明这些不足/问题是值得解决的,不是鸡汤式的说这个问题很重要,而是要说这个问题的解决能带来什么样的好处,最后大概说了一下这个问题已经受到关注,但是·····(可以是在这任务没有人做,或者前人做的在理论层面和你的不一样,总之进一步证明这个东西值得做);然后,就是对先前工作的一个大的总结,不需要像Related Work那样细致的总结每一篇论文,而是要总结一下这个领域的研究不足,其实还是进一步证明这个问题值得做,只不过一直在从不同的方面证明。
接着就是介绍一下的方法的核心思想是你这篇论文是怎么解决这个问题的。首先,我们把首次引入了什么理论提出了什么方法。这个方法是为了什么目的设计。
最后写一下总结,基于什么提出了什么,范式的更新(很重要),成功的把理论引入了这个领域。
以上是CEM的写作思路,因为这实际上是一个分析工具的论文,和一个预测模型的论文在引入问题和总结上会有一些不同,预测模型的论文可能会更强调性能提升,而分析工具的论文可能会更强调发现了什么有趣的现象或者得到了什么新的理解,但是在“范式”这个问题上,很值得参考,范式的更新是一个非常重要的点,尤其是在因果推断这种理论引入的论文中,范式的更新可以说是这个领域的一次飞跃,所以在写作的时候一定要强调这一点。
学术化的表述:
To fill the gap,we propose ···· ( a general interpretability method–the Causal Effect Map (CEM)),serving as the first incorporation of ···· theory into the ··· domain. ··· aims to ···. Rather than ····,we prefer to ···。
[CVPR26] Image Quality Assessment: Investigating Causal Perceptual Effects with Abductive Counterfactual Inference
这篇论文最初看的时候感觉很抽象,因为他的方法是实在太简单了,想象不出这么简单的方法是怎么撑起来一篇论文的,并且我觉得FULL-REFERENCE IMAGE QUALITY ASSESSMENT这个任务本身也不是特别好理解. 毕竟美学这块的评价标准太主观了。
这篇论文想解决什么问题?
现有的全参考评价准则( FR-IQA )方法往往无法捕捉人类对图像失真的感知反应背后的复杂因果机制,限制了它们在不同场景中的泛化能力。