do-演算

Parent: ai_keywords

核心定义

do-演算(do-calculus)是因果推断领域由 Judea Pearl 提出的一套形式化规则系统,用于在结构因果模型(SCM)中,从观察性数据推导出干预分布 ( P(Y \mid do(X)) )。它通过图结构(有向无环图)和三条基本规则,将有混杂因素(未观测变量)干扰的因果效应表达式转换为仅含观测数据的条件概率,从而判断因果效应的可识别性并给出无偏估计公式。

关键技术点

  1. 三条规则
    • 规则 I(干预/插入规则):若在干预 ( do(X) ) 下,变量 ( Y ) 与 ( Z ) 条件独立,则可删除或增加观察项。
    • 规则 II(行动/观察交换规则):若后门路径被阻断,可将 ( do(X) ) 替换为条件 ( X )。
    • 规则 III(干预/观察混合规则):若存在工具变量结构,可引入或删除干预。
  2. 后门准则与前门准则:后门准则是规则 II 的特例,用于通过调整所有后门路径上的混杂变量识别因果效应;前门准则利用中间变量(效应可分解)在部分混杂不可测量时仍可识别。
  3. 可识别性判定:通过反复应用三条规则,若最终可将 ( P(Y \mid do(X)) ) 表达为仅含观察概率的式子,则该因果效应可识别;否则为不可识别(需依赖辅助变量或实验)。
  4. 与潜在结果框架的等价性:do-演算的图论方法与 Rubin 因果模型(潜在结果)在满足单调性等条件下等价,但更直观展示混杂结构。

医学/神经科学应用场景

背景:首都医科大学神经病学团队在脑卒中后肢体功能康复研究中,常面临非随机治疗分配带来的混杂偏倚(如病情轻重、年龄、合并症)。某研究欲评估“早期康复训练(X=1)”对“3个月后 Barthel 指数(Y)”的因果效应,但数据来自医院电子病历,存在未记录的“基线神经功能缺损程度(U)”同时影响治疗分配和预后。

应用 do-演算:根据脑卒中诊疗路径构建因果图(DAG:U→X, U→Y, X→Y)。利用后门准则(规则 II),调整可观测的“入院 NIHSS 评分(Z)”即可阻断 U 的后门路径,得到
[ P(Y \mid do(X)) = \sum_Z P(Y \mid X, Z) P(Z) ]
若 Z 记录不全,可进一步通过前门准则(规则 III 组合)引入“康复依从性(M)”作为中间变量,利用 do-演算规则从观察数据中识别因果效应,从而为脑卒中康复决策提供无偏证据。