2B 训练监控 — Qwen3.5-2B(E1–E5)

2×A100-80GB · non-thinking · 16K response · E1–E4 已完成 150/150,E5 训练中。算法定义见 算法介绍

Sources: archive/e1_grpo_2b, archive/e2_dapo_2b, archive/e3_drgrpo_2b, archive/e4_rloo_2b(各自 logs/train_*.log)。训练动态曲线(pass rate / length / entropy / grad_norm)四组统一截取 step 1–129 对齐比较——E1 归档 canvas 快照止于该范围(实际四组训练均已跑满 150 步)。AIME24 验证曲线不受此限制,覆盖全部 step 25–150。静态网页版,E1–E3 数据与 Cursor Canvas 版本(archive/canvases/e1-e3-algorithm-comparison.canvas.tsx)一致;E4 为本次新增,直接取自 archive/e4_rloo_2b/logs/train_20260717_180634.log,尚未回填进该 canvas 源文件。pass rate = (reward_mean+1)/2 over 32×8 samples/step。

四组最终 AIME24 acc@1 都落在噪声带内,训练动态上的差异更清晰
30 题验证集、单 seed,step150 四组 acc@1(33.3% / 30.0% / 40.0% / 40.0%)互相之间的差距都在这个样本量的噪声范围内,不能当定量结论——math_500(500 题)才是主判据,目前四组都还未补测。训练侧信号更一致:Dr.GRPO(E3) 起步最慢(step25 附近仅 ~39%)但末10步均值 pass rate 最高(67.9% vs E1 的 62.8%、E2 的 58.8%)——去掉组内 std 归一化似乎换来了更陡的后段爬升;RLOO(E4) 起步最快(step1 附近已 ~37–41%,四组最高),末段稳定在 63–67% 区间,介于 E1 和 E3 之间;DAPO(E2) 靠 Overlong Reward Shaping 把响应长度压得最短(末10步均值远低于 E1/E3/E4),换来最快的墙钟时间(21h12m,比其余三组快 ~20%),但这份数据下没有换来更高的 pass rate 或 AIME 分数。

Pass rate 学习曲线对比(%,5-step 移动平均,step 1–129)

X: training step · Y: batch pass rate(5-step 移动平均,降噪)。E4 起步最快(KL loss 保留+留一法 baseline,早期信号最稳);E2 起步最低最慢(KL loss 关闭+更激进的长度压制,早期更不稳)。E1/E3/E4 都在 step40–50 附近先后突破 55–60%(E2 明显更晚,step59 才达到);E3 在 step100–125 一度领先全场达 6–11 个百分点,E4 全程稳定在中上区间,最后几步小幅收窄,全程领先 E2。

平均响应长度对比(tokens,step 1–129)

X: step · Y: mean generated tokens/response. E2 因 Overlong Reward Shaping 下降最快最深;E3 去掉 std 归一化后不降反升;E1/E4 都介于两者之间、大致持平(E4 略低、波动更小)。(虚线 = 16K 生成上限)

策略熵对比(entropy,step 1–129)

X: step · Y: mean token entropy. E3 收得最紧(0.27→0.10);E2 全程最高最松(无 KL loss 拉住参考分布);E1/E4(都有 KL loss)收敛节奏几乎一致,居中。

梯度范数对比(grad_norm,step 1–129)

X: step · Y: 全局梯度范数。E3 基线最低(0.13–0.20),E1/E2/E4 在 0.23–0.41 区间、幅值接近。E3 在 step133–140(此图范围外)另有一次瞬时尖峰,见 archive/e3_drgrpo_2b 的独立 canvas。

150 步总训练耗时(小时)

X: 实验 · Y: 150 步全程墙钟耗时。E2(DAPO) 因响应更短耗时最少;E1/E3 耗时接近(差 <1h);E4(RLOO) 最慢,因保留 KL loss 多一次 ref 前向。

本页由 archive/canvases/e1-e3-algorithm-comparison.canvas.tsx 的数据静态渲染而成(纯 HTML/CSS/JS,零外部依赖,可离线打开)。用 bash serve.sh 起一个本地静态服务器后在浏览器访问,或直接双击/拖拽本文件到浏览器打开。

Source: archive/e1_grpo_2b/logs/train_20260712_185929.log(本归档快照覆盖 step 1–129,实际训练已跑满 150 步,后续 resume 的日志未回填进此 canvas 快照)。完整交互版(含 MFU / 吞吐 / 耗时构成等更多指标):archive/canvases/e1-grpo-training.canvas.tsx(Cursor Canvas 格式,只能在 Cursor IDE 内打开)。

E1 · GRPO baseline —— 唯一保留 low_var_kl 形式 KL loss 的 grpo 组
组内均值 baseline + 除以组内 std(未去偏,带 Dr.GRPO 要修的两个隐藏偏置);KL loss 系数 1e-3,把策略持续拉向参考模型。pass rate 由首步 ~43% 升到末段 60%+;entropy 0.45→0.22 平稳收敛;kl_loss 随训练单调爬升(参考模型漂移,符合预期,无失控)。

Pass rate(%,逐 step 原始值)

响应长度(tokens)

策略熵 entropy

梯度范数 grad_norm

actor/loss

PPO KL(×1e5,带符号)

PPO 裁剪比例 pg_clipfrac(%)

rollout↔训练概率偏离度((1−corr)×1e4)

Source: archive/e2_dapo_2b/logs/train_20260714_110612.log(150/150 步一次性跑完)。完整交互版(含 MFU / 吞吐 / 耗时构成等更多指标):archive/canvases/e2-dapo-training.canvas.tsx(Cursor Canvas 格式,只能在 Cursor IDE 内打开)。

E2 · DAPO —— Clip-Higher + Dynamic Sampling + Overlong 惩罚,关闭 KL loss
非对称裁剪 0.2/0.28(下方裁剪比例图的高端裁剪明显更活跃,低端 pg_clipfrac_lower 几乎恒为 0);Overlong Reward Shaping 把响应长度压得四组最短;关闭 KL loss,省一次 ref 前向,墙钟最快(21h12m)。pass rate 起步最低最慢(无 KL 拉住 + 更激进的长度压制)。

Pass rate(%,逐 step 原始值)

响应长度(tokens)

策略熵 entropy

梯度范数 grad_norm

actor/loss

PPO KL(×1e5,带符号)

PPO 裁剪比例 pg_clipfrac(%)

rollout↔训练概率偏离度((1−corr)×1e4)

Source: archive/e3_drgrpo_2b/logs/train_20260715_114131.log(150/150 步一次性跑完;step133–140 附近有一次瞬时不稳定 episode(PPO KL/裁剪比例短暂尖峰,entropy 骤降),下方 PPO KL 与裁剪比例图上能看到该尖峰)。完整交互版(含 MFU / 吞吐 / 耗时构成等更多指标):archive/canvases/e3-drgrpo-training.canvas.tsx(Cursor Canvas 格式,只能在 Cursor IDE 内打开)。

E3 · Dr.GRPO —— 去掉组内 std 归一化 + 固定 horizon 归一,关闭 KL loss
不除以组内 std(修长度/难度偏置)+ loss_agg_mode=seq-mean-token-sum-norm(固定分母而非逐序列 token 数);关闭 KL loss。梯度范数全组最低最稳(0.13–0.20,除尖峰外);起步最慢但后段 pass rate 全场最高;响应长度不降反升(~10.3k→12.6k)。

Pass rate(%,逐 step 原始值)

响应长度(tokens)

策略熵 entropy

梯度范数 grad_norm

actor/loss

PPO KL(×1e5,带符号)

PPO 裁剪比例 pg_clipfrac(%)

rollout↔训练概率偏离度((1−corr)×1e4)

Source: archive/e4_rloo_2b/logs/train_20260717_180634.log(150/150 步一次性跑完)。完整交互版(含 MFU / 吞吐 / 耗时构成等更多指标):archive/canvases/e4-rloo-training.canvas.tsx(Cursor Canvas 格式,只能在 Cursor IDE 内打开)。

E4 · RLOO —— 留一法(leave-one-out) baseline,重新开 KL loss
每条样本的 baseline 用同组其余 G−1 条的均值(去掉自己),估计更无偏;重新开 KL loss(low_var_kl,1e-3),带回一次 ref 前向,墙钟最长(26h48m)。pass rate 起步最快(四组最高),末段稳定在中上区间,step150 与 E1/E3 并列全场最高 aime24 acc@1。

Pass rate(%,逐 step 原始值)

响应长度(tokens)

策略熵 entropy

梯度范数 grad_norm

actor/loss

PPO KL(×1e5,带符号)

PPO 裁剪比例 pg_clipfrac(%)

rollout↔训练概率偏离度((1−corr)×1e4)