《AI后训练AI中缺失了什么:一项实证分析》核心公式数值实验与深度解读

论文出处:arXiv:2608.19072 (清华大学、电子科技大学、中国人民大学,2026年8月)
论文题目:What is Missing from AI Post-Training AI: An Empirical Analysis
论文作者:林佳茵 (Joy Jia Yin Lim)、黄鑫 (Xin Huang)、彭浩 (Hao Peng)、从鑫 (Xin Cong)、张仲 (Zhong Zhang)、孙茂松 (Maoson Sun)


📌 论文核心背景与问题提出

大模型后训练(LLM Post-Training)已成为现代大语言模型获得强逻辑推理、对齐与指令遵循能力的核心阶段。随着大模型智能体(LLM Agents,如 Claude Code、Codex CLI 等)工程能力的提升,业界对“AI 端到端自主训练 AI(AI-for-AI)”寄予了厚望。

然而,本论文通过对 PostTrainBench 上涵盖 7 大基准、4 种基座模型、5 种脚手架的 1,338 条真实智能体后训练轨迹 进行系统实证解剖,发现了关键的双层能力断裂:

本文精选了支撑该论文实证体系与算法跃迁机理的两个最核心公式,通过 Python 编写数值动力学仿真,生成信息量丰富的高清动图(GIF),并提供详尽的专业解读指南。


🔬 核心公式一:双层状态转移与策略持久度模型 (Strategy Persistence & Lock-in Dynamics)

1. 数学公式与理论定义

设第 $i$ 条后训练轨迹的实验序列为 $t = 1, \dots, Ti$,实验状态元组定义为 $s{i,t} = (d{i,t}, \theta{i,t}, m{i,t})$,其中 $d{i,t}$ 为数据机制,$\theta{i,t}$ 为超参数,宏观策略范式 $m{i,t} \in \mathcal{M} = {\text{Full SFT}, \text{PEFT/LoRA}, \text{RL/GRPO}, \text{DPO}, \text{Distillation}}$。

在所有相邻实验对 $P = {(i, t) \mid 1 \le t < T_i}$ 中,策略持久度(Strategy Persistence)策略切换率(Switch Rate) 形式化定义为:

$$\text{Persistence}(P) = \frac{|{(i, t) \in P \mid m{i,t+1} = m{i,t}}|}{|P|}, \quad \text{Switch}(P) = 1 - \text{Persistence}(P)$$

结合诊断信号 $D_t \in {\text{Execution-Diag}, \text{Strategy-Diag}}$,智能体的条件行动转移概率(Diagnosis-Action Gap,诊断-行动脱节) 形式化为:

$$P(\Delta m_t \neq 0 \mid Dt = \text{Strategy-Diag}) = \frac{|{(i,t) \mid m{i,t+1} \neq m_{i,t} \wedge D_t = \text{Strategy-Diag}}|}{|{(i,t) \mid D_t = \text{Strategy-Diag}}|} \approx 0.0\%$$

$$P(\Delta \theta_t \neq 0 \mid D_t = \text{Execution-Diag}) = 100.0\%$$


2. 动态数值仿真实验 1 (Animated GIF)

实验1:策略持久度与诊断-行动脱节动力学仿真


3. 动图一解读指南(约 650 字)

本动图从宏观相空间、下游性能演进、算力收益天花板以及行为采纳率四个维度,动态揭示了论文的核心论断——“执行层闭环,策略层开环”。请按以下四个子图的逻辑链条进行系统观察与解读:

  1. 左上图【策略-执行双层相空间演化轨迹】

    • 相空间含义:纵轴代表宏观训练策略范式 $\mathcal{M}$ 的层级跃迁(SFT $\to$ LoRA $\to$ GRPO $\to$ 多阶段RL);横轴代表微观执行层的迭代深度(超参调优、清洗数据、修补EOS截断等)。
    • 动态对比
      • 自主基线(灰色)与经验驱动(蓝色):这两条轨迹自始至终被死死锁在底部的“SFT 策略锁定陷阱区”($m=0$)。随着时间推移,它们只在水平方向向右高频推进(不停地改学习率、洗数据),却在纵轴上完全停滞,无法自发迈向强化学习。
      • 人类引导(橙色):在初期经过专家两轮审查,被直接“人为抬升”至 GRPO($m=2$),但因缺乏持续的自发策略维系机制,后续依然陷入水平方向的超参微调。
      • 理想元策略闭环(绿色):当检测到局部收敛停滞时,自发触发阶梯式策略跃迁(SFT $\to$ GRPO $\to$ Multi-Stage RL),实现纵向维度的连续跨越。
  2. 右上图【AIME 2025 评测准确率 (pass@8) 演化】

    • 早熟平台期现象:自主基线(3.3%)与经验驱动(5.6%)在第 2~3 轮即遭遇性能天花板。在此后的十几个小时里,智能体反复启动了十余次训练,但曲线呈现出近乎死寂的绝对水平线;
    • 对比启示:人类引导虽取得 16.7% 的突破,但后续因奖励漂移又出现性能回落;唯有具备自发策略反思的理想智能体才能冲上 40%+ 的深度推理高地。
  3. 左下图【推理 Token 算力消耗与性能收益 (Scaling Ceiling)】

    • 算力收益断崖:经验驱动智能体通过引入日记与反思,消耗了高达 7.9 倍的推理 Token(数千万 Tokens),但在错误策略内空转导致其 Pareto 前沿直接撞上死天花板,实证证明了“在锁定的局部策略中,单纯堆砌测试时思考算力无法带来本质突破”
  4. 右下图【诊断建议采纳率与策略持久度统计】

    • 基于论文对 3,557 个真实实验对的严格统计:策略持久度高达 97.92%(切换率仅 2.08%)。当评估智能体给出执行层建议时,采纳率为 100%;而面对 7 次明确要求切换到 RL 的策略建议时,采纳率彻底跌至 0%,直观呈现了致命的“诊断-行动脱节”。

🔬 核心公式二:GRPO 分组相对优势与策略梯度探索动力学 (GRPO Group-Relative Advantage & Policy Optimization)

1. 数学公式与理论定义

在论文第 4.2 节的人类专家干预与策略切换审计中,打破 SFT 瓶颈的关键在于将训练目标从无监督/监督最大似然(SFT Loss)切换为基于规则奖励的组相对策略优化(GRPO, Group Relative Policy Optimization)

$$\mathcal{J}{\text{GRPO}}(\theta) = \mathbb{E}{x \sim \mathcal{D}, {yi}{i=1}^G \sim \pi{\theta{\text{old}}}} \left[ \frac{1}{G} \sum{i=1}^G \left( \min \left( \frac{\pi\theta(yi \mid x)}{\pi{\theta_{\text{old}}}(y_i \mid x)} \hat{A}i, \text{clip}\left(\frac{\pi\theta(yi \mid x)}{\pi{\theta_{\text{old}}}(y_i \mid x)}, 1-\epsilon, 1+\epsilon\right) \hat{A}i \right) - \beta D{\text{KL}}(\pi\theta \parallel \pi{\text{ref}}) \right) \right]$$

其中,组内相对优势(Group-Relative Advantage)$\hat{A}_i$ 定义为对单个 Prompt 独立采样的 $G$ 条候选推理路径奖励的标准化:

$$\hat{A}_i = \frac{r_i - \mu\left({rj}{j=1}^G\right)}{\sigma\left({rj}{j=1}^G\right) + \epsilon{\text{adv}}} \quad \text{where} \quad \mu = \frac{1}{G}\sum{j=1}^G rj, \; \sigma = \sqrt{\frac{1}{G}\sum{j=1}^G (r_j - \mu)^2}$$

针对复杂数学与代码题目的多采样评测通过率(Pass@k)遵循无偏组合估计:

$$\text{pass}@k = \mathbb{E} \left[ 1 - \frac{\binom{N - c}{k}}{\binom{N}{k}} \right]$$


2. 动态数值仿真实验 2 (Animated GIF)

实验2:GRPO分组相对优势与策略梯度探索动力学


3. 动图二解读指南(约 680 字)

本动图对大模型后训练中从 SFT 静态模式记忆向 GRPO 强化学习动态探索跃迁的微观数学动力学进行了全流程仿真,展示了为何切换到 GRPO 能够彻底激活模型的深层长程推理能力:

  1. 左上图【单步采样与相对优势标准化 $\hat{A}_i$ 实时计算】

    • 机制展示:每一训练步对当前 Prompt 采样 $G=8$ 条候选推理路径(蓝色柱状图表示通过单元测试/数学规则验证的原始奖励 $r_i \in [0, 1]$)。
    • 动态观察:橙色虚线表示组内动态均值 $\mu_r$。GRPO 的核心创新在于自适应组基准(Self-Baseline):哪怕在极难题目中仅有 1 条路径偶然验证成功($r_i=1.0$),归一化后的优势 $\hat{A}_i$(绿色柱)会被放大到 $+2.0$ 以上,提供极强的正向梯度牵引力;而其余大量错误路径(红色柱)则获得负优势 $\hat{A}_i < 0$ 被精准惩罚。这打破了 SFT 对高质量人工 Demonstration 的苛刻依赖。
  2. 右上图【策略概率质量向深度正确解空间转移演化】

    • 解空间重塑:对比了灰色基座分布 $\pi{\text{ref}}$ 与绿色当前策略 $\pi\theta$ 在 5 种不同质量解路径上的概率演化。
    • 演化特征:在 GRPO 相对优势驱动下,“语法错误”与“浅层幻觉”的概率迅速从初始的 25% 和 35% 压低到 2% 以下;概率质量高度汇聚到“严谨正确证明(Deep CoT)”(从初期的 3% 飙升至 80%+),直观展现了模型自发学会深度探索与验证的过程。
  3. 左下图【多尺度推理准确率突破 (Pass@1, Pass@4, Pass@8)】

    • 跨越 SFT 鸿沟:红色虚线代表 SFT 在竞赛数学 AIME 上的 5.5% 经验天花板。
    • 多采样增益:GRPO 训练后,单次生成准确率 pass@1 稳步爬升,而多采样验证指标 pass@4 和 pass@8 呈现显著的超线性增长(快速突破 60%~80%),完美印证了论文中人类引导将 AIME pass@8 从 3.3% 飞跃至 16.7% 的数学底层逻辑。
  4. 右下图【策略熵 $H(\pi)$ 与 KL 散度 $D_{\text{KL}}$ 演化】

    • 探索与稳定性的平衡:紫色曲线展示了策略熵的演变(初期保持高熵保障多样化解题搜索,后期平稳下降实现收敛);红色曲线展示了相对于基座模型的 KL 散度漂移,在惩罚项 $\beta D_{\text{KL}}$ 的约束下,KL 距离被有效控制在安全边界内,防止策略发生不可逆的模式坍缩(Mode Collapse)。

💡 总结与对自动化 AI 研发(AI-for-AI)的启示

  1. 执行力 $\neq$ 战略力:当前的 AI 智能体已经是无可挑剔的后训练“高级工程师”,但在宏观科研决策上依然是“机械执行者”。
  2. 算力无法弥补策略偏差:在固化的局部策略内,单方面堆砌测试时推理 Token 或增加反思日志只会导致高成本的“原地空转”。
  3. 未来的破局点:自动化 AI 研发不能仅依赖隐式 Prompt,必须在后训练框架中引入显式强制策略审查节点(Explicit Strategy Checkpoints)主动放弃并重启探索的元认知机制(Spontaneity Mechanism)