简单直接,但有两个致命局限: (1) 复合误差 (Compounding Error)——若每步独立犯错概率为
ϵ,偏差沿轨迹累积:第
t 步期望偏移约
O(tϵ),总回报损失
∑t=1TO(tϵ)=O(T2ϵ) 随时间平方放大;更糟的是训练只见到专家分布内的状态 (i.i.d. 假设),部署时却要处理自己犯错导致的偏移状态分布 (协变量偏移); (2) 因果混淆 (Causal Confusion)——模型学到的可能是『结果』而非『原因』,如自动驾驶 BC 学会用自车横向偏移量 (自身转向动作的后果) 来修正方向,训练分布里专家总能纠正,部署时反馈环路失效、表现断崖下跌。