Hexo

凡事预则立,不预则废


  • Home

  • Tags

  • Archives

  • Navigation

  • Search

Math——因果推断

本文介绍因果推断(Causal Inference)相关概念


参考资料

  • 讲的比较好的入门材料:
    • 参考链接:闲聊因果效应(1):当我们聊因果时,我们在聊什么
    • 参考链接:闲聊因果效应(2): 理解因果效应的计算以及PSM、IPW
  • 阿里发的一篇论文,用神经网络实现的二分类Uplift模型:
    • 参考链接:KDD‘22 阿里|DESCN: Deep Entire Space Cross Networks | 多任务、端到端、IPW的共舞

什么时候需要因果推断?

  • 是否需要因果推断主要取决于是否存在混淆因素/混淆因子(Confounders) ,即 treatment 是否是足够随机的(不受其他因素影响)
    • 如果 treatment 是完全随机分配的(即在每个状态下,treatment 是随机决定的),那么观察到的影响差异可以直接归因于 treatment 的变化,此时相关性即因果性 ,理论上不需要复杂的因果推断方法

有“足够多随机数据”时是否需要因果推断?

  • 若“随机”指完全随机实验 :不需要因果推断,直接建模即可
  • 若“随机”仅指数据量大 :仍需因果推断,因为数据量不能解决混淆偏差问题

出价中是否需要因果推断?

  • 如果出价是随机分配的 ,则可以直接用统计模型直接拟合 收益 = f(状态,出价),无需因果推断,因为随机化已消除混淆偏差
  • 如果出价是策略性选择的(如历史数据中出价高低与状态相关),则存在混淆偏差(confounding),必须用因果推断方法(如双重机器学习、倾向得分匹配)来估计条件平均处理效应(CATE)
    • 例如:高收益场景下系统更倾向出高价,此时出价与收益的关联可能混入了状态的影响

因果推断中的一致性假设

  • 一致性假设指的是:对于某一研究对象,其接受的处理(Treatment)与潜在结果(Potential Outcome)之间存在唯一且明确的对应关系
    • 具体来说,若个体 \(i\) 接受了处理 \(Z_i = z\),那么该个体的观测结果 \(Y_i\) 必然等于其在处理 \(z\) 下的潜在结果 \(Y_i(z)\),即:
      $$Y_i = Y_i(Z_i)$$

一致性假设的作用

  • 在因果推断中,我们通常需要比较同一主体在不同处理下的潜在结果差异(如因果效应 \(Y_i(1) - Y_i(0)\)),但现实中个体只能接受一种处理,无法同时观测到两种结果。一致性假设确保了:
    • 当个体接受处理 \(Z=1\) 时,观测结果 \(Y_i\) 等于其潜在结果 \(Y_i(1)\);
    • 当个体接受处理 \(Z=0\) 时,观测结果 \(Y_i\) 等于其潜在结果 \(Y_i(0)\)
  • 如此一来,我们才能通过分组(如处理组和对照组)的观测结果差异,来推断处理的因果效应(如平均因果效应 \(E[Y(1) - Y(0)]\))

目前因果推断的SOTA模型

  • CFR:Estimating individual treatment effect: generalization bounds and algorithms

Math——最优化问题和KKT条件

凸优化&拉个朗日对偶性的直观理解


凸优化相关书籍

  • 参考链接:优化方法-资料集合

问题定义

  • 一般优化问题的定义:

$$
\begin{align}
\min_{x}\quad &f(x) \\
s.t. \quad &g_{i}(x) \leq 0, i = 1,2,\dots,k \\
&h_{j}(x) = 0, j = 1,2,\dots,l
\end{align}
$$

凸优化问题

  • 如果原始优化问题满足:
    • \(f(x)\) 和 \(g_{i}(x)\) 都是 \(\mathbb{R}^{n}\) 上连续可微的凸函数
    • \(h_{j}(x)\) 为 \(\mathbb{R}^{n}\) 上的仿射函数 (仿射函数是满足 \(h_{j}(x) = a\cdot x + b\) 的函数)
  • 那么,原始优化问题是凸优化问题

凸二次优化问题

  • 若上述凸优化问题还满足:
    • \(f(x)\) 是二次函数
    • \(g_{i}(x)\) 是 \(\mathbb{R}^{n}\) 上的仿射函数
  • 那么,原始优化问题是凸二次优化问题

朗格朗日对偶性

拉格朗日对偶性的推导
  • 原始问题定义为

$$
\begin{align}
\min_{x}\quad &f(x) \\
s.t. \quad &g_{i}(x) \leq 0, i = 1,2,\dots,k \\
&h_{j}(x) = 0, j = 1,2,\dots,l
\end{align}
$$

  • 引进拉格朗日函数有
    $$
    \begin{align}
    L(x,\alpha, \beta) = f(x) + \sum_{i=1}^{k}\alpha_{i}g_{i}(x) + \sum_{j=1}^{l}\beta_{j}h_{j}(x)
    \end{align}
    $$

  • 考虑到
    $$
    \begin{align}
    \max_{\alpha,\beta:\alpha_{i}\geq 0}L(x,\alpha, \beta)
    \end{align}
    $$

    • 当 \(x\) 满足原始问题的解时,上面的式子等价与 \(f(x)\)
    • 否则上面的式子等于无穷大 \(+\infty\)
  • 所以假设原始问题的最优值为 \(p^{\star}\),那么
    $$
    \begin{align}
    p^{\star} = \min_{x}\max_{\alpha,\beta:\alpha_{i}\geq 0}L(x,\alpha, \beta)
    \end{align}
    $$

    • (\(p^{\star}\) 不是最优参数,是最优参数对应的函数值,参数应该用 \(\mathop{\arg\max}_{x}\) 而不是 \(\max_{x}\))
  • 定义对偶问题为:
    $$
    \begin{align}
    &\max_{\alpha,\beta:\alpha_{i}\geq 0}\min_{x}L(x,\alpha, \beta) \\
    &s.t.\quad \alpha_{i} \geq 0,\quad i=1,2,\dots,k
    \end{align}
    $$

  • 假设原始问题的最优解为 \(d^{\star}\),则原始问题与对偶问题的关系为:
    $$
    \begin{align}
    d^{\star} = \max_{\alpha,\beta:\alpha_{i}\geq 0}\min_{x}L(x,\alpha, \beta) = \min_{x}\max_{\alpha,\beta:\alpha_{i}\geq 0}L(x,\alpha, \beta) = p^{\star}
    \end{align}
    $$

KKT条件
  1. 原始可行性 : \(g_{i}(x) \leq 0\), \(h_{j}(x) = 0\)
  • 所有原始约束必须满足
  1. 对偶可行性 : \(\alpha_i \geq 0\)
  • 所有的不等式约束对应的拉格朗日乘子大于等于0
  1. 互补松弛性 : \(\alpha_i g_i(x) = 0\)
  • 对于每个不等式约束 \(g_i(x)\),都有 \(\alpha_i g_i(x) = 0\),这意味着如果一个约束是紧约束(即 \(g_i(x) = 0\) ),那么对应的 \(\alpha_i\) 可以是非零的;如果一个约束是松的(即 \(g_i(x) < 0\) ),那么对应的 \(\alpha_i\) 必须为零
  1. 梯度条件 : \(\nabla_x L(x^*, \alpha^*, \beta^*) = 0\)
  • 在最优解处,拉格朗日函数关于 \(x\) 的梯度必须为零
  • 其他理解:
  • 对KKT条件其他角度的理解可参考周志华<<机器学习>>P404
1…145146147…352
San Ye

San Ye

Stay Hungry. Stay Foolish.

704 posts
53 tags
© 2026 San Ye
Powered by Hexo
|
Theme — NexT.Gemini v5.1.4