本文根据 Whitney K. Newey 教授的 Debiased Machine Learning 系列讲座整理,并补充了代数推导、统计解释与实施细节。
Newey 教授是麻省理工学院经济学系 Ford Professor of Economics, Emeritus,主要研究领域为计量经济学。
DML 的核心问题是:如何利用机器学习灵活估计高维或非参数的辅助函数,同时避免正则化、模型选择和过拟合破坏目标经济参数的估计与统计推断。
一、为什么需要去偏机器学习
许多经济学和因果推断问题只关心一个低维目标参数,例如某个回归系数、平均处理效应或政策效应,但识别这个目标参数往往需要先估计高维或非参数的辅助对象。例如:
- 在回归模型中,需要控制大量协变量以减少遗漏变量偏误;
- 在处理效应问题中,需要估计结果回归函数和倾向得分;
- 在需求分析、政策评估和结构模型中,需要估计复杂的条件期望、选择概率或价值函数。
这些辅助对象统称为干扰参数或干扰函数(nuisance parameters/functions)。Lasso、神经网络、随机森林和 Boosting 等方法能够处理大量变量和复杂函数关系,因此非常适合第一阶段预测。
问题在于,机器学习的设计目标通常是预测,而经济计量推断还要求:
并希望:
机器学习常通过正则化、提前停止、剪枝或变量选择主动引入偏误,以降低方差和改善样本外预测。这种偏误可能对预测损失影响很小,却可能经由目标参数公式被放大。
因此:
一个简单的数量级比较能够说明问题。假设某个第一阶段估计量只有:
这对复杂机器学习而言可能已经是不错的收敛速度。但如果目标参数对第一阶段误差具有一阶敏感性,则目标参数偏误也可能是 。乘以 后:
该项不会消失,反而可能随样本量增大而发散,常规正态近似因而失效。
双重/去偏机器学习(Double/Debiased Machine Learning,DML)的目标,是在保留机器学习处理高维和复杂关系能力的同时,让第一阶段误差只以更高阶形式进入目标参数估计,从而恢复低维参数的常规推断。
DML 主要依赖两个工具:
- Neyman 正交性:消除第一阶段误差对目标矩条件的一阶影响;
- 交叉拟合:使用样本外预测,使正交性产生的均值为零关系更容易在样本中成立,并降低过拟合偏误。
二、DML 的去偏机制
2.1 从一般矩条件出发
设观测数据为 ,目标参数为 ,干扰参数为 。假设 由总体矩条件识别:
实际中 未知,需要先用机器学习得到 ,再求解样本矩条件:
其中:
若在 附近对总体矩函数作一阶展开,则:
因为 ,整理后得到:
其中:
右侧第一项是均值为零的样本波动,通常具有 数量级;第二项是第一阶段估计误差产生的 plug-in bias。DML 的核心就是设计得分 ,使第二项的一阶部分消失。
2.2 Neyman 正交性
Neyman 正交性要求:
这里的导数可以是有限维梯度,也可以是函数空间中的 Gateaux 导数。若 是函数,沿任意允许方向 定义:
则正交性要求:
于是总体矩函数关于第一阶段误差的展开变为:
而不是:
如果:
那么:
因此,目标参数仍有机会满足 渐近正态性。
必须区分两个方向:
但为了识别 ,通常需要:
也就是说:
2.3 交叉拟合
仅有总体正交性还不够。若同一批样本同时用于训练复杂机器学习模型和计算目标矩条件,估计误差可能与样本得分产生复杂相关,导致过拟合项难以控制。
交叉拟合将样本划分为若干折。对每个留出折:
- 用其他折训练第一阶段模型;
- 在留出折上生成样本外预测;
- 使用这些预测构造正交得分;
- 合并所有折的得分并估计 。
对于留出折中的观测,第一阶段模型不使用该观测训练。条件于训练样本,第一阶段预测误差可被视为固定函数,许多均值为零的关系因而可以直接用于控制余项。
标准 DML 可以概括为:
交叉验证与交叉拟合不是同一概念:
- 交叉验证用于选择惩罚参数、网络结构等超参数;
- 交叉拟合用于生成目标参数估计所需的样本外干扰函数预测。
同一研究中可以同时使用两者:在每个训练折内部做交叉验证,再对外层留出折做预测。
三、含高维控制变量的线性回归
3.1 模型设定
考虑如下含有高维控制变量的线性回归模型:
其中:
- 是结果变量;
- 是研究者关注的核心解释变量或处理变量;
- 是需要估计和推断的低维目标参数;
- 是包含 个控制变量的向量;
- 是控制变量对应的高维系数;
- 是结构误差项。
假设:
以及:
这两个条件表示,核心解释变量 和控制变量 均与结构误差项 正交。
更强但也更容易理解的充分条件是:
该条件可以推出:
为了避免额外处理截距项,可以假设所有变量已经中心化;也可以在 中加入常数项,但实际使用 Lasso 时通常不对截距项施加惩罚。
当控制变量维度 相对于样本量 较大时,模型属于高维控制变量模型。特别是当:
时,样本设计矩阵通常不满秩,传统 OLS 无法唯一估计完整的高维参数向量 。
即使 ,当 接近 或控制变量之间高度相关时,传统 OLS 也可能出现:
- 估计方差过大;
- 对样本扰动非常敏感;
- 样本内拟合良好但样本外表现较差;
- 目标参数 的标准误不稳定。
不过,研究者通常并不需要准确估计整个高维向量 ,而只关心低维目标参数 。这使得我们可以通过 partialling out 将高维控制变量视为干扰参数,并集中估计 。
3.2 对 进行总体线性投影
首先,将核心解释变量 对控制变量 做总体最小二乘投影。
定义投影系数:
为了推导其一阶条件,定义目标函数:
对 求导:
在最优解 处,一阶条件为:
定义 的总体投影残差:
因此,总体投影的正交条件可以写为:
该条件表示, 中无法被 线性解释的部分,与所有控制变量 正交。
如果矩阵:
可逆,那么投影系数具有解析表达式:
因此:
是基于 对 的最佳线性预测,而:
是剔除控制变量线性影响后, 剩余的变化。
在因果推断语境下, 可以理解为:在控制了 后,处理变量 中剩余的、不能由可观测协变量线性预测的部分。
3.3 对 进行总体线性投影
类似地,将结果变量 对控制变量 做总体最小二乘投影。
定义:
其一阶条件为:
定义 的总体投影残差:
因此:
如果 可逆,则:
其中:
是基于控制变量 对结果变量 的最佳线性预测,而:
是从 中剔除 的线性解释部分后得到的残差。
3.4 两个总体投影系数之间的关系
下面推导 、 和原始模型参数之间的关系。
原始模型为:
两边左乘 并取期望:
根据外生性条件:
所以:
另一方面,根据总体线性投影的定义:
以及:
代入后得到:
如果 可逆,则:
这个等式非常重要。它说明, 关于 的总体投影系数,可以分解为两部分:
3.5 推导残差化后的模型
由定义:
将原始模型和刚刚得到的关系:
代入:
因为:
所以:
这就是 partialling out 后的残差模型。
它表明,从 和 中分别剔除控制变量 能够线性解释的部分以后,原来的高维多元回归问题转化成了一个只有单个解释变量的残差回归问题。
3.6 残差化解释变量与结构误差项正交
为了利用残差回归识别 ,还需要证明:
由:
有:
根据假设:
所以:
因此,残差化后的解释变量 与结构误差项 正交。
四、通过残差回归识别目标参数
4.1 总体矩条件
残差化后的模型为:
对于任意候选参数 ,考虑矩函数:
将:
代入:
由于:
所以:
如果满足识别条件:
那么:
当且仅当:
因此,目标参数 是总体矩条件:
的唯一解。
条件:
意味着,在剔除控制变量 的影响以后, 仍然保留一定的剩余变异。
如果:
则 可以被 完全线性解释,残差化后的 没有任何变化,此时无法将 与控制变量效应区分开来。
4.2 从总体最小二乘问题推导
目标参数也可以定义为残差回归的总体最小二乘系数:
定义:
对 求导:
一阶条件为:
展开:
因此:
于是:
也可以直接利用残差模型验证这一结论:
所以:
这一结果就是 Frisch–Waugh–Lovell 定理的总体形式:原始多元回归中 的系数,等于先从 和 中剔除 的线性影响,再进行残差回归得到的系数。
4.3 正交得分函数
为了分析第一阶段投影系数估计误差的影响,定义得分函数:
其中:
令干扰参数为:
真实干扰参数为:
在真实参数处:
以及:
因此:
总体矩条件为:
4.4 对 的正交性
首先计算矩条件对 的导数。
因为:
所以:
在真实参数处:
取期望:
根据 关于 的总体投影条件:
所以:
这表示, 在真实值附近出现小幅估计误差时,不会对总体矩条件产生一阶影响。
4.5 对 的正交性
令:
以及:
于是:
注意:
并且:
根据乘积求导法则:
在真实参数处:
因此:
取期望:
其中使用了:
以及:
所以:
综合两个方向:
这就是 Neyman 正交性。
4.6 通过局部扰动理解正交性
Neyman 正交性也可以通过直接展开来理解。
假设第一阶段投影系数受到小幅扰动:
以及:
定义:
扰动后的 残差为:
扰动后的 残差为:
在 处:
因此,扰动后的得分函数为:
将其展开:
与真实得分:
相比,差异为:
前三项分别是关于 或 的一阶项。
由于:
有:
以及:
因此,一阶项的总体期望全部消失。
剩下的项为:
这些项都包含两个第一阶段误差的乘积,属于二阶项。
所以:
这说明,第一阶段估计误差对正交矩条件的影响不是与误差大小成正比,而主要与误差的平方或误差乘积成正比。
可以概括为:
而:
这正是 DML 能够使用具有正则化偏误的机器学习方法估计第一阶段关系,同时仍然对低维目标参数进行有效推断的核心原因。
五、DML Partialling-Out:Lasso 与交叉拟合
前面的推导假设总体投影系数:
已经知道。但在实际研究中,只能观察随机样本:
因此,需要在样本中估计 和 关于高维控制变量 的投影关系。
当 较小时,可以使用 OLS 估计两个第一阶段模型;当 很大,甚至满足 时,可以利用 Lasso 的正则化和变量选择能力估计这些高维关系。
为便于展示代数,§5.1—§5.6 先写出完整样本上的两次 Lasso 和残差回归;§5.7 再把第一阶段改为样本外预测。全文后续的渐近推断默认采用 §5.7 的交叉拟合版本。
5.1 第一步:估计 关于 的关系
使用 Lasso 估计 关于 的线性预测关系:
其中:
第一部分:
衡量样本拟合误差;第二部分:
是 惩罚项。
惩罚参数 越大,系数收缩越强,更多系数会被压缩到 0;惩罚参数越小,模型越接近未惩罚的最小二乘估计。
实际使用时,通常需要先对控制变量进行标准化。截距项一般不施加惩罚。
关于 的说明。
除以 是取平均,除以 只是让平方损失求导时抵消系数 。真正的样本分割会把求和指标明确写成 ,见 §5.7。
5.2 第二步:估计 关于 的关系
类似地,使用 Lasso 估计 关于 的线性预测关系:
这里, 不必与 相同,因为 方程和 方程可能具有不同的噪声水平、稀疏程度和预测难度。
惩罚参数可以通过交叉验证、理论惩罚水平或其他数据驱动方法选择。
需要区分:
- 交叉验证用于选择 Lasso 的惩罚参数;
- DML 中的交叉拟合用于构造样本外第一阶段预测。
二者都使用样本分割,但目的并不相同。
5.3 第三步:构造 Lasso 残差
使用两个第一阶段 Lasso 估计量构造残差。
定义 的估计残差:
定义 的估计残差:
总体残差为:
以及:
因此,估计残差和总体残差之间的关系为:
以及:
这说明, 和 并不等于真实总体残差,它们还包含第一阶段 Lasso 的预测误差。
DML 理论要解决的核心问题,就是这些第一阶段预测误差是否会严重影响目标参数 的估计。前面在 §4.4—§4.6 证明的 Neyman 正交性表明,这些误差的一阶影响可以被消除。
5.4 第四步:进行残差回归
利用估计残差进行第二阶段最小二乘回归:
定义样本目标函数:
对 求导:
令一阶导数等于 0:
因此, 满足样本矩条件:
展开:
只要:
就可以得到:
因此,估计步骤可以概括为:
然后:
5.5 样本正交得分表示
定义估计得分:
DML partialling-out 估计量满足:
该样本矩条件模仿总体正交矩条件:
如果第一阶段估计足够准确,并且第一阶段误差满足适当的乘积收敛条件,则:
与不可行的总体残差得分:
在一阶渐近意义下具有相同的行为。
这为后续的 渐近正态性提供了基础。
5.6 第一阶段误差在样本矩条件中的展开
定义第一阶段系数估计误差:
以及:
再定义第一阶段预测误差:
于是:
在真实目标参数 处:
因此:
其中:
是决定目标参数渐近分布的主要项;
是第一阶段误差的一阶项;
是第一阶段误差的二阶项。
由于总体正交条件:
一阶项在总体上的期望为 0。
因此,第一阶段 Lasso 的正则化偏误主要通过二阶乘积项影响目标参数。这正是使用正交得分而不是直接将 Lasso 系数解释为因果效应的重要原因。
5.7 加入交叉拟合的 DML 实现
如果在完整样本上训练两个 Lasso 模型,并在同一批样本上构造残差,那么 和 是样本内残差。
为了进一步降低过拟合造成的偏误,标准 DML 通常使用交叉拟合。
首先,将样本指标集合:
随机划分为 个互不重叠的子样本:
满足:
以及:
对每个折 ,使用训练样本:
估计第一阶段模型。
具体地:
以及:
对于验证折中的每个观测值 ,构造样本外残差:
以及:
依次对所有折执行上述步骤,使每个观测值都获得一个由不包含其自身的训练样本生成的第一阶段预测。
最后,将所有折的残差合并,并计算:
交叉拟合使得对于每个 ,第一阶段估计量:
不使用第 个观测值进行训练。
条件于训练样本,验证折中的第一阶段预测函数可以近似视为固定函数,这使得正交性对应的一阶误差项更容易利用条件均值为零和中心极限定理进行控制。
因此,标准 DML 可以概括为:
5.8 DML Partialling-Out、完整样本残差化与 Post-Double-Selection
“Double Lasso”在不同文献中可能指代不同但相关的方法,因此需要区分本文的交叉拟合 DML partialling-out、完整样本 Lasso residualization 与 Post-Double-Selection。
本文使用的算法是:
- 用 Lasso 回归 对 ;
- 用 Lasso 回归 对 ;
- 分别构造 和 ;
- 回归 对 。
这种方法更准确地称为:
或带有 Lasso 第一阶段的残差化估计。
如果进一步使用交叉拟合,则属于 DML partialling-out 的标准实现。
Post-Double-Selection 的算法则不同。它通常包括:
- 在 关于 的 Lasso 回归中选择控制变量;
- 在 关于 的 Lasso 回归中选择控制变量;
- 对两个模型选择出的变量取并集;
- 使用 OLS 回归 对 和并集中的控制变量。
因此:
两者都利用了 方程和 方程的信息,也都旨在降低高维变量选择对目标参数推断的影响,但其具体估计步骤并不完全相同。
在后文中,如果继续使用残差回归公式:
建议将方法统一称为:
Lasso Partialling-Out 估计量,或采用 Lasso 第一阶段的 DML 估计量。
如果没有使用交叉拟合,则应明确说明这是完整样本上的 Lasso residualization;如果加入了交叉拟合,则可以称为标准的 DML partialling-out 实现。
六、渐近正态性与统计推断
前面的分析说明,DML partialling-out 通过两次高维第一阶段回归,分别从结果变量 和核心解释变量 中剔除控制变量 可以解释的部分,然后利用两个残差之间的关系估计目标参数 。
本节进一步说明:在什么条件下,DML partialling-out 估计量具有 收敛速度和渐近正态分布,以及如何构造异方差稳健标准误、置信区间和假设检验。
6.1 总体残差模型
回顾总体线性模型:
并假设:
令 表示 关于 的总体线性投影系数:
并定义总体残差:
类似地,令 表示 关于 的总体线性投影系数:
并定义:
根据总体线性投影的正交条件:
结合原始模型,可以得到残差化后的总体模型:
因此:
同时,由于:
有:
所以,目标参数满足总体矩条件:
6.2 Oracle 估计量的渐近分布
首先考虑一个不可行的基准情形:假设总体投影系数 和 已知,因此可以直接观测总体残差 和 。
在这种情况下,Oracle 估计量为:
将总体残差模型
代入,得到:
因此:
两边乘以 :
定义:
如果:
则根据大数定律:
另一方面,由于:
在适当的矩条件下,中心极限定理给出:
其中:
由 Slutsky 定理:
其中:
因此,Oracle 估计量的影响函数为:
实际的 DML partialling-out 估计量不能直接使用总体残差,而是需要使用 Lasso 估计得到的残差。接下来的问题是:第一阶段 Lasso 的正则化偏误是否会改变上述渐近分布。
6.3 第一阶段 Lasso 估计误差的影响
定义第一阶段投影系数的估计误差:
以及:
由定义:
因此:
类似地:
为了简化记号,定义第一阶段预测误差:
以及:
于是:
由于:
所以在真实目标参数 处:
进一步定义:
则:
因此,使用估计残差构造的矩函数可以展开为:
对样本求平均:
第一项:
是决定目标参数渐近分布的主要随机项。
第二项和第三项是第一阶段估计误差可能产生的一阶影响,第四项则是两个第一阶段误差的乘积,即二阶项。
6.4 Neyman 正交性如何控制一阶误差
§6.3 给出的展开为:
这里不能仅凭总体等式就断言样本中的两个一阶项精确等于 0,因为第一阶段估计误差本身是随机的。交叉拟合的作用正是在这里体现出来。
设观测 位于留出折 ,而 由训练样本 上的第一阶段估计量产生。记 为训练样本生成的信息集。条件于 :
可以视为固定,因此 都是 的固定线性函数。利用总体投影条件:
可得:
以及:
因此,这两个一阶项是条件均值为零的样本波动。它们的条件方差可以用第一阶段预测误差控制。例如:
只要:
就有:
同理,若:
则:
最后的二阶项由 Cauchy–Schwarz 不等式控制:
为了使它在 尺度下消失,需要:
将定义代回,可写为:
一个便于记忆的充分条件是两个第一阶段预测误差都满足:
于是:
如果不使用交叉拟合,第一阶段估计量和样本得分使用同一批观测,上述条件均值为零论证不能直接应用,需要额外的经验过程、稀疏性和复杂度控制。正因如此,本文后续默认使用交叉拟合版本。
6.5 DML partialling-out 估计量的渐近线性表示
DML partialling-out 估计量满足样本矩条件:
在括号中加减 :
因此:
两边乘以 :
在正交性、第一阶段预测一致性以及适当的稀疏性条件下:
同时:
因此:
这就是 DML partialling-out 估计量的渐近线性表示。
它说明,在一阶渐近意义下,使用 Lasso 估计第一阶段关系所得到的可行估计量,与知道真实投影系数的 Oracle 估计量具有相同的渐近表示。
DML partialling-out 估计量的影响函数为:
6.6 渐近正态性
假设观测值独立同分布,并且满足:
以及:
更一般地,可以要求存在某个 ,使得:
根据中心极限定理:
其中:
结合渐近线性表示和 Slutsky 定理,可以得到:
其中:
也可以写成:
其中:
这里的 是:
的渐近方差,而不是 本身的方差。因此:
该结果表明,尽管第一阶段使用了带有正则化偏误的 Lasso,但由于残差化矩条件具有 Neyman 正交性,第一阶段估计误差的一阶影响被消除。在第一阶段误差满足适当收敛速度时,DML partialling-out 估计量仍然具有 收敛速度和渐近正态分布。
需要注意:
正交性只是将第一阶段误差的影响由一阶项降低为二阶项。为了保证二阶余项为 ,第一阶段估计仍然需要满足一定的预测误差和稀疏性条件。
6.7 Lasso 第一阶段的典型收敛条件
假设两个第一阶段线性关系具有稀疏性或近似稀疏性。
令 表示 关于 的有效非零系数数量, 表示 关于 的有效非零系数数量。
在适当的限制特征值条件、矩条件和惩罚参数条件下,Lasso 的预测误差通常满足:
以及:
两个预测误差的乘积为:
为了使该乘积为 ,通常需要:
如果两个第一阶段具有相近的稀疏度:
则条件可以简化为:
这一条件体现了高维推断中的基本限制:虽然控制变量的总维度 可以大于样本量 ,但真正对结果变量和处理变量具有重要预测作用的变量数量不能增长得过快。
6.8 异方差稳健的渐近方差估计
定义第二阶段残差:
总体渐近方差中的两个部分分别为:
以及:
对应的样本估计量为:
以及:
因此,渐近方差 的异方差稳健估计量为:
代入 和 :
等价地:
由于 是标量参数,上式还可以简写为:
该估计量是 Eicker–Huber–White 异方差稳健方差估计量,允许条件误差方差:
随 和 变化,因此不要求误差项满足同方差假设。
6.9 标准误
由于:
可以近似写为:
因此, 的渐近标准误为:
将 的表达式代入,可以得到:
需要区分以下两个量:
估计的是:
的渐近方差;而:
估计的是 本身的方差。
因此,如果某个统计软件直接给出的是 的方差或标准误,就不应再额外除以 。
6.10 置信区间
由渐近正态性:
因此, 的近似 置信区间为:
其中, 是标准正态分布的 分位数。
当:
时:
所以,近似的 95% 置信区间为:
如果置信区间不包含 0,则在 5% 的显著性水平下,可以拒绝:
但“统计显著”并不必然意味着经济意义上的影响足够大,因此还需要结合点估计的大小、置信区间宽度和具体研究背景进行解释。
6.11 Wald 假设检验
考虑一般的原假设:
可以构造 Wald 统计量:
在原假设成立时:
对于双侧检验,对应的渐近 值为:
其中, 是标准正态分布的累积分布函数。
在显著性水平 下,如果:
则拒绝原假设。
当 时,拒绝规则为:
6.12 有无交叉拟合时,理论论证有何不同
本文在 §5.7 中给出了标准 折交叉拟合版本。使用交叉拟合时,每个观测的第一阶段预测由不包含该观测的训练样本产生。条件于训练样本,第一阶段误差可视为固定的 函数,因此 §6.4 中的一阶项可以利用投影正交条件和条件中心极限定理控制。
若使用完整样本上的 Lasso residualization,则估计量形式仍可写为:
但 与同一观测的噪声共同参与训练,一阶项不再具有简单的条件均值为零结构。此时通常需要更强的假设,例如:
- 第一阶段模型足够稀疏;
- 设计矩阵满足更强的限制特征值条件;
- Lasso 估计误差的经验过程项可被统一控制;
- 机器学习函数类的复杂度不能增长过快。
因此,二者的区别不是最终残差回归公式,而是第一阶段预测的生成方式和余项控制所需的理论条件:
6.13 渐近结论成立的典型条件
综合而言,DML partialling-out 估计量的渐近正态性通常需要以下类型的条件。
第一,观测值独立同分布,或者至少满足适当的弱相关条件。
第二,目标参数具有充分的识别强度:
该条件意味着,在剔除控制变量 的影响后,核心解释变量 仍然具有足够的剩余变化。如果:
非常接近 0,则说明 几乎完全可以被 预测,目标参数将难以精确识别,标准误也会很大。
第三,影响函数具有有限方差,例如:
第四,第一阶段模型具有稀疏性或近似稀疏性,使 Lasso 能够以足够快的速度估计两个投影关系。
第五,第一阶段预测误差满足适当的乘积速率条件,使二阶余项满足:
第六,Lasso 惩罚参数、变量标准化和设计矩阵需要满足相应的高维正则条件,例如限制特征值条件或兼容性条件。
第七,如果采用灵活程度更高的机器学习方法,通常需要使用样本分割或交叉拟合,以控制过拟合及其引起的经验过程误差。
在这些条件下,有:
进而:
因此,即使控制变量的维度 很高,甚至超过样本量 ,只要第一阶段关系具有足够的稀疏性,正交矩条件和第一阶段收敛条件得到满足,DML partialling-out 仍然可以对低维目标参数 进行有效的点估计、标准误计算、置信区间构造和假设检验。
需要注意,以上 Eicker–Huber–White 方差公式适用于独立观测下的一般异方差。如果数据存在组内相关、时间序列相关或空间相关,则应根据数据结构改用聚类稳健标准误、HAC 标准误或其他相应的稳健方差估计方法。
七、经验应用:经济增长的收敛假说
本节用经济增长收敛回归说明 DML partialling-out 的实证解释。这里的数值沿用讲义示例,重点是展示如何从估计量、标准误和置信区间形成推断,而不是重新验证该数据集。
7.1 回归模型与经济含义
考虑:
其中:
- 是国家在某一时期的人均 GDP 增长率;
- 是初始人均 GDP,实践中常取对数;
- 包括教育、制度质量、贸易开放度、政治稳定性等初始特征;
- 衡量在控制这些特征后,初始收入与后续增长之间的条件关系。
若 是初始收入的对数、 是年均增长率,则:
表示初始收入较低的国家具有更高的条件增长率,支持条件收敛。这里的“条件”非常重要,因为比较的是具有相同或相近 特征的国家。
若:
则控制 后没有显著的初始收入—增长关系;若:
则表现为条件发散。
系数的具体经济单位取决于 与 的缩放方式,因此不能仅凭 就机械地解释为“每年收敛 5%”。若要把回归系数转换成结构增长模型中的收敛速度,还需要使用该模型对应的非线性换算公式。
7.2 为什么高维控制会造成困难
讲义示例中:
虽然 ,但 已经较大。完整 OLS 同时估计约 60 个控制变量时:
- 剩余自由度较少;
- 多重共线性可能放大方差;
- 许多弱控制变量会增加噪声;
- 样本量不足以稳定估计整个高维系数向量。
DML 的目标不是“证明所有控制变量系数都为零”,而是利用正则化提高两个第一阶段预测的稳定性,再通过正交残差回归估计 。
7.3 DML 的实际估计步骤
对每个交叉拟合折 :
-
在训练样本 上回归 对 ,得到 ;
-
在训练样本 上回归 对 ,得到 ;
-
对 构造:
-
合并所有折后计算:
这相当于利用“不能被国家初始特征预测的初始收入变化”解释“不能被这些特征预测的增长率变化”。
7.4 点估计、标准误与置信区间
讲义示例结果为:
| 方法 | 系数估计 | 标准误 | 95% 置信区间 |
|---|---|---|---|
| OLS | |||
| DML partialling-out |
DML 的 Wald 统计量约为:
因为:
在常规双侧 5% 显著性水平下拒绝:
使用正态临界值直接计算的区间为:
即近似:
与表中四舍五入后的区间一致。
OLS 的统计量约为:
因此无法拒绝零效应。两种估计差异可能来自高维 OLS 的噪声,也可能来自 Lasso 第一阶段对高维关系的正则化。不能仅凭结果更显著就认定 DML 一定“更正确”;还需要检查识别假设、第一阶段表现和对分折方式的敏感性。
7.5 因果解释需要额外条件
上述回归首先识别的是条件线性关系。若要解释为“提高初始收入会因果地改变后续增长”,至少需要:
并要求控制变量足以阻断所有相关混杂路径。若存在无法观测的制度、历史冲击或测量误差,DML 不能自动消除这些识别问题。
DML 解决的是:
而不是自动解决:
八、没有 Neyman 正交性会发生什么
8.1 非正交矩条件的一阶偏误
考虑直接使用原始回归矩条件:
真实参数满足:
但矩条件对干扰参数 的导数为:
一般而言:
所以该矩条件不正交。
设先用 Lasso 得到 ,再求解:
在真实参数附近作一阶展开:
因此:
第一项是常规的 样本波动;第二项是第一阶段误差的一阶传导。乘以 :
若 Lasso 的误差只有:
则第二项的数量级可能达到:
通常不会趋于 0。这就是非正交 plug-in 推断失败的根本原因。
8.2 单次变量选择与遗漏变量偏误
一种常见做法是:
- 用 Lasso 回归 对 ;
- 保留被选择的控制变量;
- 对 回归 和这些控制变量;
- 把最后一步当成固定模型 OLS 做推断。
问题是,Lasso 的选择目标偏向预测 。某个变量 对 的边际预测作用可能较弱,却可能强烈预测 。删除它后, 的剩余变化仍混入 的变化。
用单个遗漏变量说明。真实模型为:
若忽略 ,则简单回归系数满足:
因此遗漏变量偏误为:
即使 较小,只要 与 高度相关,偏误仍可能很大。
Partialling-out 同时估计:
和:
因此能够利用处理方程暴露“对 很重要但对 边际预测较弱”的变量。
8.3 为什么 Post-Lasso 仍不自动有效
Post-Lasso 在选择变量后重新做 OLS,能够消除已选变量上的直接收缩偏误,但不能消除:
- 被遗漏变量造成的选择偏误;
- 模型选择集合随机带来的额外不确定性;
- 第一阶段选择误差对目标参数的一阶传导。
因此:
若使用 Post-Double-Selection,则通过对结果方程和处理方程的选择集合取并集来缓解遗漏问题;若使用 DML partialling-out,则通过正交得分和交叉拟合控制第一阶段误差。两种思路相关,但算法不同。
8.4 模拟分布的直觉
设真实参数 。在重复抽样中:
- 正交估计量的偏误是二阶的,其抽样分布通常以 1 为中心,并逐渐接近正态;
- 非正交估计量保留一阶正则化偏误,其分布可能整体向一侧平移;
- 即使非正交估计量的方差看起来不大,置信区间覆盖率仍可能严重不足,因为中心位置错误。
所以推断质量不能只看均方误差或预测 ,还要看:
九、Cross-fitting 的进一步推导
§5.7 已给出算法。本节解释为什么交叉拟合能够简化理论,并给出 DML1、DML2 和重复分折的区别。
9.1 折、训练集与折映射
将样本索引划分为 个互不重叠的折:
记:
为包含观测 的折编号,训练集为:
在训练集上估计:
对 定义:
折上得分为:
9.2 DML2:合并所有得分后统一求解
DML2 先合并所有留出折的得分,再解一个总体样本矩条件:
在线性 partialling-out 模型中有解析解:
本文前面使用的 均指这一 pooled estimator。
9.3 DML1:先在每折估计,再取平均
也可以在每个留出折单独求解:
再取平均:
当各折大小相近且识别强度稳定时,DML1 和 DML2 一阶渐近等价。但在有限样本中,DML2 直接按 的信息量加权,通常更稳定,因此本文以 DML2 为主。
9.4 条件于训练样本的一阶项
以:
为例。对 , 的系数由 估计。记训练样本信息集为 ;条件于 ,该系数固定,因此:
相应的条件方差约由:
控制。只要第一阶段预测一致,该项就是 。交叉拟合把“随机函数与自身训练噪声的相关性”转化为“固定预测误差函数在新样本上的平均”,从而避免 Donsker 类条件或复杂的统一经验过程控制。
9.5 折数 的权衡
若 较小:
- 每个训练集更小;
- 第一阶段预测可能较差;
- 但计算量较低。
若 较大:
- 每个训练集更接近完整样本;
- 第一阶段预测可能改善;
- 但需要重复训练更多次;
- 留出折较小,单折估计可能更不稳定。
实践中常使用 或 。不存在适用于所有问题的唯一最优折数,应结合样本规模、学习器计算成本和第一阶段稳定性选择。
9.6 重复交叉拟合
随机分折会引入额外的有限样本波动。可以重复 次随机分折,得到:
常见汇总方式包括均值或中位数:
重复交叉拟合主要用于降低对某一次随机分折的敏感性。报告时应说明:
- 折数 ;
- 重复次数 ;
- 随机种子;
- 每次分折的点估计范围;
- 最终方差的合并方法。
9.7 时间、组别和面板数据的分折
随机逐行分折只适用于观测近似独立的情形。若数据具有组内相关、时间依赖或面板结构,应避免把高度相关的观测同时放入训练折和验证折。例如:
- 学校数据按学校分折;
- 企业面板按企业分折;
- 时间序列按时间块分折;
- 地理数据按地区簇分折。
否则,所谓“样本外预测”可能仍泄露同组信息,导致第一阶段性能过于乐观,推断方差也可能被低估。
十、第一阶段机器学习方法
DML 不要求第一阶段必须使用 Lasso。学习器的任务是估计干扰函数,而目标参数的可解释性来自识别条件和正交得分,不来自第一阶段模型中某个机器学习系数。
前文为了清楚推导 FWL 定理,使用的是线性投影:
当第一阶段改用神经网络、随机森林等非线性学习器时,更自然的模型是部分线性条件均值模型:
定义:
则:
相应得分为:
这与前文线性投影得分形式相同,只是把 替换为一般函数 。若使用 Lasso 字典逼近,这两个框架可以自然衔接。
10.1 Lasso:高维线性与字典展开
设:
即使原始变量关系非线性,也可以构造字典:
其中包括:
- 原始变量;
- 多项式项;
- 样条基函数;
- 变量交互项;
- 固定效应和分类变量编码。
Lasso 假设这些函数可以由一个相对稀疏的线性组合近似:
10.1.1 标准化
对每个连续特征计算:
并定义:
因为 惩罚直接作用于系数大小,不标准化会使大尺度变量受到较弱的有效惩罚,小尺度变量受到较强惩罚。标准化参数也必须只在训练折上计算,再应用于验证折,避免信息泄露。
10.1.2 Lasso 目标函数与
以结果方程为例:
这里:
只是平均平方损失的标准化,不表示把样本“除成两半”。真正的样本分割由 和 的指标集合体现。
10.1.3 KKT 条件与收缩偏误
令残差:
对非零系数 ,KKT 条件为:
OLS 的对应右侧为 0。Lasso 残差与已选特征仍保留由惩罚项引起的系统性相关,这正是直接把 Lasso 系数当作无偏结构参数会出问题的原因。
对于 ,KKT 条件为:
10.2 近似稀疏性与预测速率
近似稀疏性不要求真实函数精确线性,而是要求存在一个至多含 个非零元素的向量 ,使:
其中 是近似误差。
在适当的限制特征值、尾部矩和惩罚参数条件下,Lasso 预测误差通常具有形式:
总误差还要加上近似误差 。
DML 要求的不是第一阶段达到 参数速度,而主要是乘积条件。例如:
若二者同阶,分别为 ,乘积条件即可成立。
10.3 Post-Lasso
Post-Lasso 先用 Lasso 选择变量集合:
然后在训练样本上用 重新做 OLS。它可以减少已选变量的收缩偏误,但:
- 不能恢复被错误删除的变量;
- 不能忽略选择集合的随机性;
- 不能自动使目标矩条件正交。
Post-Lasso 可以作为第一阶段预测器,但最终目标参数仍应通过正交得分估计。
10.4 神经网络
神经网络适合估计复杂平滑的非线性条件均值。单隐藏层 ReLU 网络可写为:
其中:
更深网络通过复合多个隐藏层表示复杂函数。第一阶段使用神经网络时,需要特别关注:
- 网络宽度与深度;
- 权重衰减;
- dropout;
- 提前停止;
- 训练折内部的验证集;
- 不得使用外层留出折选择超参数。
在 DML 中,神经网络的作用是预测 和 ,不需要对单个网络权重作结构解释。
10.5 随机森林
随机森林把多个随机化决策树的预测平均:
每棵树通过递归划分特征空间,在叶节点内使用局部样本均值预测。随机森林擅长处理:
- 阈值效应;
- 非线性;
- 高阶交互;
- 局部异质性。
需要调节的超参数包括树数、最大深度、最小叶节点样本量和每次分裂考察的特征数。与神经网络一样,超参数选择应在训练折内部完成。
10.6 Boosting 与集成学习
Boosting 逐步拟合前一步的残差,适合构造灵活的非线性预测。也可以使用 stacking 或 super learner,在训练折内部通过交叉验证学习多个候选模型的组合权重:
集成学习可以降低对单一函数形式的依赖,但必须保证整个模型选择和权重学习过程都仅使用训练折。
10.7 如何选择第一阶段学习器
应以样本外预测和目标问题结构为依据,而不是以最终 是否显著为依据。可以报告:
- 留出折 RMSE 或 MAE;
- 对连续 的样本外 ;
- 不同学习器下 的敏感性;
- 残差 的方差;
- 极端预测和外推情况。
不能为了得到更显著的目标参数,在查看最终结果后反复选择学习器。那会引入新的研究者自由度和选择偏误。
十一、Plug-in Bias 的一般展开
11.1 一般 plug-in 估计量
设目标参数可以写成干扰函数的泛函:
最直接的估计量是:
对 在 附近作展开:
若:
则第一阶段误差以一阶进入:
复杂机器学习通常达不到 的函数估计速度,因此这种直接 plug-in 往往不能进行常规 推断。
11.2 正交得分相当于加入一阶修正
DML 不直接使用 ,而是构造一个修正项,使目标估计量的等价展开为:
修正项被设计为抵消:
在矩条件语言中,这等价于:
所以“debiased”并不是说第一阶段机器学习本身变成无偏,而是说目标参数的得分对第一阶段偏误局部不敏感。
11.3 Lasso 正则化偏误的数量级
Lasso 常用惩罚参数具有量级:
若 随 增长,则:
通常慢于 。因此,直接使用 Lasso 系数或非正交 plug-in 公式时,正则化偏误可能大于目标参数的常规抽样误差。
例如,如果:
则:
中心会随 增长而偏离 0。
11.4 模型选择偏误与随机目标
变量选择后重新做 OLS,估计的是随机选择模型中的条件参数。若被选集合为 ,则后续 OLS 的设计矩阵取决于同一批数据。固定模型 OLS 的标准误忽略了:
这一随机性。
选择偏误不仅发生在 Lasso,也发生在:
- 逐步回归;
- 根据显著性筛变量;
- 反复尝试不同特征工程;
- 根据最终目标参数结果选择机器学习算法。
DML 能控制预先规定的第一阶段学习流程带来的估计误差,但不能自动纠正研究者在看到最终结果后进行的选择。
11.5 正交性不是万能的
正交性只对局部第一阶段误差提供保护。以下情况仍可能导致失败:
- 第一阶段完全不一致;
- 处理残差 几乎没有变异;
- 数据存在严重外推或重叠不足;
- 得分函数构造错误;
- 目标参数本身没有被数据识别;
- 方差估计忽略聚类或时间相关;
- 训练和验证之间发生数据泄露。
因此:
十二、平均处理效应与条件均值线性泛函
前面的高维线性模型属于 DML 的一个重要特例。本节转向更一般的因果参数:目标参数不再一定是线性回归系数,而可以是条件均值函数的线性泛函。平均处理效应(Average Treatment Effect,ATE)是最典型的例子。
为避免与第三节的高维系数向量 混淆,本节用:
表示真实条件均值函数,用 表示后面出现的 Riesz representer 或去偏函数。
12.1 潜在结果与平均处理效应
设处理变量:
协变量为 。每个个体具有两个潜在结果:
其中 表示接受处理时的结果, 表示不接受处理时的结果。实际观测结果满足一致性关系:
研究者关心的平均处理效应为:
由于同一个个体不可能同时观测 和 ,需要利用可观测数据识别这一参数。
12.2 条件独立与重叠条件
常用识别条件是条件独立:
其含义是:给定协变量 后,处理分配与潜在结果独立。换言之,在控制了足够多的混杂变量以后,处理可以被视为条件随机分配。
定义倾向得分:
还需要重叠条件:
更强的版本要求存在常数 ,使:
重叠条件保证对于相同的协变量取值,处理组和对照组都具有正概率。若倾向得分接近 0 或 1,ATE 虽可能在理论上被识别,但逆概率权重会非常不稳定,方差也会变大。
12.3 通过结果回归识别 ATE
定义条件结果回归:
由一致性关系,当 时:
因此:
根据条件独立性:
所以:
对 取期望:
同理:
因此:
这一表示说明,ATE 是条件均值函数 的一个线性泛函。
12.4 一般条件均值线性泛函
令:
考虑目标参数:
其中 对函数 是线性的,即对任意常数 和函数 :
对于 ATE,令:
并定义:
于是:
这一框架还包含许多其他参数,例如平均导数、加权平均处理效应、政策分布变化效应和某些结构模型中的平均反事实效应。
12.5 政策分布变化效应
设 在基准政策下的分布为 ,在新政策下的分布为 ,而结构关系 保持不变。一个政策效应可以写为:
令符号测度:
则:
这同样是 的线性泛函。它度量在结果生成机制不变时,仅改变 的分布所产生的平均结果变化。
12.6 为什么直接 Plug-in 仍可能失败
对于 ATE,最直接的 plug-in 估计量是:
它将机器学习结果回归直接代入识别公式。其误差可分解为:
其中第二、第三项通常是第一阶段误差的一阶泛函。如果 只以慢于 的速度收敛,这些项会破坏常规推断。因此,需要构造一个修正项,把结果回归误差的一阶影响抵消掉。
十三、Riesz 表示、正交得分与双重稳健性
13.1 Riesz 表示条件
对于线性泛函:
假设存在平方可积函数 ,使得对所有满足 的函数 :
这个等式称为 Riesz 表示, 称为 Riesz representer。
直观地说,虽然目标参数看起来是一个抽象的函数泛函,但 Riesz 表示把它改写成 的加权平均。由此:
因此,目标参数可以表示为结果变量 的一个加权平均。
Riesz representer 的平方可积性:
与目标参数能否进行常规 估计密切相关。若 不平方可积,目标参数可能不是规则参数,常规渐近正态推断也可能不存在。
13.2 ATE 的 Riesz representer
对于 ATE:
定义:
下面验证它满足 Riesz 表示。条件于 :
由于:
第一项为:
类似地:
第二项为:
所以:
再对 取期望:
这正是 ATE 泛函的 Riesz 表示。
13.3 政策效应的 Riesz representer
若 的实际分布具有密度 ,政策分布 分别具有密度 ,并且 相对于 绝对连续,则:
将 乘入再除出:
其中:
这说明密度比在政策效应中承担与逆倾向得分相似的去偏权重作用。
13.4 一般正交得分
给定 Riesz representer,定义:
其中:
是原始 plug-in 识别矩,而:
是偏误修正项。
在真实值处:
最后一项为零,是因为:
13.5 精确偏误恒等式
该得分最重要的性质可以通过一个精确恒等式看出。对任意候选函数 :
利用 的线性性:
由 Riesz 表示:
另一方面:
两部分相加:
右侧不是单个第一阶段误差,而是两个误差的乘积。这是去偏机制的核心。
13.6 通过方向导数验证 Neyman 正交性
令:
先沿 方向求导:
其中最后一步使用 Riesz 表示。
再沿 方向求导:
所以:
13.7 双重稳健性
由精确偏误恒等式可得:
若:
则无论 是否正确:
若:
则无论 是否正确:
因此:
这一性质称为双重稳健性。
需要区分:
- Neyman 正交性是局部性质,要求真实值附近的一阶导数为零;
- 双重稳健性是更强的全局性质,允许一个干扰函数在较大范围内设定错误;
- 不是所有正交得分都具有双重稳健性,但上面的线性泛函得分具有。
13.8 Rate Double Robustness
由 Cauchy–Schwarz 不等式:
为了使总体偏误在 尺度下消失,只需:
这称为 rate double robustness。两个第一阶段不必都达到 ;只要它们的速度乘积足够快即可。
例如:
同时:
则乘积为:
13.9 ATE 的增广逆概率加权得分
将 ATE 的 和 代入一般得分:
这就是 ATE 的增广逆概率加权(Augmented Inverse Probability Weighting,AIPW)得分,也是 ATE 的标准 DML 正交得分。
十四、Automatic DML 与 Riesz 回归
14.1 一般交叉拟合估计量
将样本划分为:
对每个折 ,使用训练样本 估计:
对于 ,定义样本外得分:
令 pooled moment 为:
由于 以系数 进入得分,方程:
具有解析解:
14.2 ATE 的交叉拟合估计量
对 ,记:
以及:
则:
这就是交叉拟合 AIPW/DML 估计量。
实际中常对估计倾向得分进行裁剪,例如:
但裁剪会改变目标和有限样本偏误,需要报告裁剪阈值并进行敏感性分析。
14.3 得分方差与标准误
定义估计影响得分:
渐近方差估计为:
因为:
所以:
置信区间为:
这里不需要额外对 和 的参数估计方差进行传统 delta-method 修正;正交性和交叉拟合已经使第一阶段影响进入高阶余项。
14.4 Riesz 回归目标函数的推导
直接通过倾向得分、密度比等解析公式估计 可能不稳定。Automatic DML 的思路是直接从 Riesz 条件构造 的学习目标。
考虑任意候选函数 :
根据 Riesz 表示,将候选函数 当作线性泛函的输入:
因此:
最后一项与候选函数 无关,所以:
这一最小化问题称为 Riesz regression。
14.5 样本 Riesz 回归
在训练折 上,可以估计:
其中:
- 是候选函数类,例如线性字典、神经网络或森林;
- 是正则化项;
- 全部调参和模型选择必须限制在训练折内部。
这种方法直接针对目标泛函学习 ,不要求研究者先手工推导倾向得分或密度比公式,因此称为 automatic DML。
14.6 ATE 的自动 Riesz 回归
对于 ATE:
因此训练目标为:
若函数类足够丰富并且优化、正则化条件合适, 会逼近:
但估计过程不需要显式计算 。
14.7 解析权重与 Automatic Riesz 的比较
直接倾向得分法:
具有明确的因果解释,但当 接近 0 或 1 时可能产生极端权重。
Automatic Riesz 直接最小化与目标泛函相关的损失,不必反演倾向得分,可能具有以下优势:
- 避免显式除以很小的概率;
- 可以使用神经网络、随机森林或稀疏字典直接学习权重;
- 同一算法可以用于 ATE、政策效应和其他线性泛函;
- 学习目标直接服务于目标参数,而不只是预测处理变量。
不过,它仍需要函数类、正则化和交叉拟合设计合理,并不自动消除弱重叠问题。
14.8 IHDP 半合成 Monte Carlo 的含义
相关研究使用 Infant Health and Development Program(IHDP)数据构造半合成 Monte Carlo。该设计包含结果变量、二元处理和多维混杂变量,通过重复生成潜在结果评估估计量的偏误和误差。
比较的核心思路是:
- 使用神经网络估计结果回归;
- 一种方法反演神经网络倾向得分;
- 另一种方法通过 Riesz regression 直接学习去偏权重。
模拟结果用于说明,在复杂非线性和有限样本下,直接学习 Riesz representer 可以避免部分逆倾向得分不稳定问题。但这类 Monte Carlo 结论依赖具体设计,不能替代实际应用中的重叠诊断和敏感性分析。
14.9 Automatic DML 的实施步骤
Automatic DML 可以概括为:
- 明确目标泛函 ;
- 在每个训练折上估计条件均值 ;
- 通过 Riesz regression 估计 ;
- 在留出折构造正交得分;
- 合并所有折得分并计算 ;
- 使用样本得分平方估计方差;
- 检查结果回归误差、权重分布和分折敏感性。
十五、Neyman 正交矩的一般构造
Lecture 1 的 partialling-out 和 Lecture 3 的 Riesz 修正是两个具体例子。更一般地,构造正交矩主要有两条路线:
- 从目标函数中 partial out 干扰函数,再对 profile objective 求导;
- 从原始识别矩出发,加入第一阶段影响函数作为偏误修正。
15.1 路线一:从 Profile Objective 构造
设总体目标函数为:
并假设:
对每个固定 ,定义 profile nuisance:
profile objective 为:
对 求导:
由于 是固定 下的最优解:
因此由包络定理:
相应的 profile score 可以构造为:
其中 用于表达 或 profile 过程产生的附加函数。由于干扰函数在每个 下都经过优化,这类得分通常具有正交性。
15.2 部分线性模型的 Profile 推导
考虑一般部分线性模型:
并假设:
定义平方损失目标:
对固定 ,最优函数为:
定义:
则:
profile residual 为:
对 求导:
所以 profile objective 的观测级导数为:
于是得到正交得分:
这就是第三至第六节线性投影得分的非参数推广。在线性模型中:
15.3 部分线性得分的正交性
在真实值处:
以及:
沿 方向 :
因为:
沿 方向 :
第一项利用 为零,第二项利用:
为零。因此得分对两个干扰函数都正交。
15.4 半参数似然与有效得分
考虑半参数伪似然:
其中 是有限维参数, 是无限维干扰函数。对固定 ,定义:
profile score 为:
在适当正则条件下,该 profile score 对干扰方向正交。即使伪似然未完全正确设定,profile 过程仍可产生正交矩;在模型正确设定时,profile score 与半参数有效得分密切相关。
15.5 路线二:加入第一阶段影响函数
设原始识别矩为:
直接使用:
可能保留一阶 plug-in bias。一般修正方法是加入偏误修正项:
其中 是第一阶段影响函数(first-step influence function,FSIF), 是构造修正项所需的附加干扰函数。
Lecture 3 中:
以及:
15.6 分布路径与第一阶段影响函数
令 是真实数据分布, 是任意允许的替代分布。定义污染路径:
设 表示当数据分布为 时,第一阶段学习器的概率极限。考虑泛函:
第一阶段影响函数 被构造为满足:
并且:
第一个条件表示 捕捉第一阶段对象随分布扰动而变化时,对原始识别矩产生的一阶影响;第二个条件是影响函数的零均值规范化。
15.7 影响函数修正为何产生正交性
沿路径 ,影响函数零均值性质给出:
对 在 0 处求导:
由 FSIF 定义,第一项等于原始矩随第一阶段变化的一阶导数。因此:
这说明修正项的一阶变化恰好抵消原始矩受到第一阶段误差的影响,从而产生 Neyman 正交性。
15.8 修正项不提供新的识别信息
在真实值处:
因此:
在识别层面具有相同的零点。修正项不会凭空增加识别信息;它的作用是改变估计方程对第一阶段误差的局部敏感性,使 plug-in bias 从一阶降为高阶。
15.9 正交性、稳健性与二阶界
一般正交矩常具有以下性质:
第一,对主要第一阶段对象 的局部正交性:
第二,在 时,对某些附加去偏函数误差具有稳健性:
第三,若矩函数对 呈仿射结构,可能进一步具有双重稳健性:
渐近理论中常使用更强的二阶界:
该不等式比“导数为零”更适合直接控制余项。
十六、一般 DML 的正则条件与渐近理论
16.1 一般设定
设:
目标参数由:
识别。交叉拟合样本矩为:
估计量满足:
渐近理论的核心目标是证明:
一旦这一等式成立,第一阶段估计就不会改变得分的一阶极限分布。
16.2 基本分解
记:
则:
需要证明第二项为 。对每个折,进一步分解为:
第一项是中心化样本波动;第二项是总体偏误。
16.3 为什么交叉拟合能控制经验过程项
条件于训练样本 , 是固定函数,而留出折观测仍是独立样本。于是:
其条件方差约为:
因此,只要:
就有:
这只需要均方一致性,而不必对复杂机器学习函数类施加强 Donsker 条件。
16.4 第一阶段均方一致性条件
对于一般修正得分:
可以要求:
以及:
其中 是可能用于构造修正函数的初步一致估计量。
这些条件的含义是:分别改变每一个第一阶段对象时,得分在均方意义下连续。
16.5 二阶交互余项
定义 inclusion-exclusion 型二阶余项:
它刻画 和 同时估计时产生的交互误差。
对于:
直接展开:
这明确展示了余项的二阶乘积结构。
16.6 乘积速率条件
由 Cauchy–Schwarz:
因此,一个关键条件是:
这比要求每个第一阶段都达到 快得多,也是 DML 可以使用慢速非参数或高维学习器的原因。
16.7 从矩条件到参数的渐近线性表示
对样本矩在 附近展开:
其中:
而 位于 与 之间。整理:
若:
且 ,则:
因此影响函数为:
16.8 中心极限定理与渐近方差
若:
并且:
则:
其中:
所以:
对于 Lecture 3 的线性泛函得分:
因此:
16.9 一般方差估计
定义交叉拟合得分:
估计:
以及:
则:
标准误为:
对于向量参数,标量逆数应改为矩阵 sandwich:
16.10 与线性 Partialling-Out 的对应关系
在线性 partialling-out 中:
Jacobian 为:
因此:
以及:
这与第六节的结果完全一致。由此可见,第六节不是独立的特殊技巧,而是一般 DML 渐近理论在高维线性模型中的具体化。
16.11 条件失败时会发生什么
若第一阶段不一致:
则交叉拟合经验过程项可能不消失。
若乘积速率不成立:
则二阶偏误仍可能与抽样波动同阶甚至更大。
若识别 Jacobian 接近 0:
则即使得分估计准确,参数也会弱识别,方差被放大。
若影响得分没有有限二阶矩,常规中心极限定理和标准误也可能失效。
因此:
十七、统一的 DML 实施框架
17.1 第一步:明确目标参数和数据结构
首先写清楚:
- 目标参数 的经济含义;
- 观测单位是否独立;
- 是否存在聚类、面板或时间依赖;
- 哪些变量是结果 、处理 和控制 ;
- 因果解释所需的识别假设。
对于本文模型:
目标参数是 的条件线性效应。
17.2 第二步:写出识别矩条件
总体残差为:
识别矩条件为:
并要求:
17.3 第三步:验证或推导正交性
定义:
检查:
以及:
详细推导见 §4.4—§4.6。
17.4 第四步:设计交叉拟合方案
确定:
- 折数 ;
- 是否重复分折;
- 是否按组、个体或时间块分折;
- 每个训练折内部如何选择超参数;
- 所有预处理是否限制在训练折内部。
对每个折 :
17.5 第五步:估计第一阶段
在每个训练折分别拟合:
以及:
可使用 Lasso、随机森林、神经网络或集成学习。第一阶段所有操作都应封装进训练管道,包括:
- 缺失值填补;
- 标准化;
- 哑变量编码;
- 特征筛选;
- 超参数选择;
- 模型拟合。
若先在完整样本上标准化或选择变量,再做交叉拟合,会产生数据泄露。
17.6 第六步:构造样本外残差并求解
对每个 :
在线性 Lasso 情形,这两个预测分别为:
合并所有折后:
17.7 第七步:构造得分、方差和置信区间
定义:
异方差稳健渐近方差为:
标准误为:
置信区间为:
若存在聚类,应先在簇内聚合得分。设簇为 ,定义:
聚类稳健的“肉”项应使用:
并根据软件和有限样本设置采用适当自由度修正。
17.8 第八步:实施诊断
至少检查以下内容。
17.8.1 识别强度
计算:
若 很小,说明 几乎被 完全预测,目标参数弱识别,标准误会变大。
17.8.2 第一阶段样本外表现
报告留出折上的:
- RMSE;
- MAE;
- ;
- 预测值分布;
- 极端误差。
第一阶段预测不需要完美,但若完全没有预测能力或高度不稳定,应重新检查模型设定。
17.8.3 分折敏感性
比较不同随机种子和折数下的:
若结果高度依赖单次分折,应考虑重复交叉拟合、增加样本量或简化第一阶段。
17.8.4 学习器敏感性
在预先规定的候选学习器之间比较,例如 Lasso、随机森林和神经网络。稳定的目标参数结果更有说服力,但不能以“显著性最大”为选择标准。
17.8.5 得分异常值
检查:
极端得分可能主导点估计和方差,应检查数据错误、重尾和高杠杆观测。
十八、总结与关键公式索引
18.1 核心逻辑
DML 的关键不是某一种特定机器学习算法,而是一套将预测工具转化为有效推断工具的结构:
机器学习负责估计高维或复杂的辅助关系;正交性降低第一阶段误差的一阶影响;交叉拟合降低训练噪声与目标得分之间的依赖。
18.2 贯穿全文的关键公式
总体投影残差:
残差模型:
正交得分:
Neyman 正交性:
交叉拟合残差:
DML partialling-out 估计量:
渐近线性表示:
渐近方差:
稳健标准误:
一般条件均值线性泛函:
Riesz 表示:
一般正交得分:
精确偏误恒等式:
Automatic Riesz 回归:
18.3 最重要的三个结论
第一:
第二:
正交性把一阶误差压低为二阶误差,但仍需要第一阶段一致性和乘积速率条件。
第三:
若外生性、重叠性或数据结构假设不成立,再精细的机器学习和正交化也无法恢复正确的因果参数。
十九、参考文献
涉及的重要文献包括:
- Robinson, P. M. (1988), “Root-N-Consistent Semiparametric Regression,” Econometrica;
- Newey, W. K. (1994), “The Asymptotic Variance of Semiparametric Estimators,” Econometrica;
- Bickel, P. J., Ritov, Y. and Tsybakov, A. B. (2009), “Simultaneous Analysis of Lasso and Dantzig Selector,” Annals of Statistics;
- Chernozhukov, V. et al. (2018), “Double/Debiased Machine Learning for Treatment and Structural Parameters,” The Econometrics Journal;
- Schmidt-Hieber, J. (2020), “Nonparametric Regression Using Deep Neural Networks with ReLU Activation Function,” Annals of Statistics;
- Farrell, M. H., Liang, T. and Misra, S. (2021), “Deep Neural Networks for Estimation and Inference,” Econometrica;
- Chernozhukov, V., Escanciano, J. C., Ichimura, H., Newey, W. K. and Robins, J. M. (2022), “Locally Robust Semiparametric Estimation,” Econometrica;
- Ichimura, H. and Newey, W. K. (2022), “The Influence Function of Semiparametric Estimators,” Quantitative Economics;
- Chernozhukov, V., Newey, W. K., Quintas-Martinez, V. and Syrgkanis, V. (2022), “RieszNet and ForestRiesz: Automatic Debiased Machine Learning with Neural Nets and Random Forests,” ICML。