4B 训练监控 — Qwen3.5-4B(E1–E5)

4×A100-80GB · TP=4 · 关闭 offload · non-thinking · 16K response · E1–E4 已完成 150/150,E5 训练中。算法定义见 算法介绍

Sources: logs/exp2card/e1_grpo_4b, e2_dapo_4b, e3_drgrpo_4b, e4_rloo_4b 各自的 train_*.log,逐 step 直接解析(脚本:scripts/parse_4b_logs.py),四组均为 150/150 步全量数据,无截断。pass rate = (reward_mean+1)/2 over 32×8 samples/step。

4B 上四组末段 pass rate 都在 88–91% 高位收敛,aime24 上 E2/E3/E4 并列领先
四组首 5 步 pass rate 均值都在 79–81% 起步(4B 底座数学能力本身就强,起点远高于 2B 的 35–43%),末 10 步均值收敛到 88.8–91.1% 的窄区间,训练侧差异比 2B 更不明显。aime24 上 E3(Dr.GRPO)/E4(RLOO) 的 step125 分别摸到全场最高 0.800/0.833,E2(DAPO) 与 E4 在 step150 并列 0.767 最高;E1(GRPO) 是唯一 step150 明显回落到 0.633 的一组E2(DAPO) 在 step43/59 附近出现两次瞬时 grad_norm 尖峰(0.96、1.13,其余步 0.1–0.3),同期 entropy 也在持续走高(四组唯一没有收敛趋势的),是本赛道最值得留意的稳定性信号。

Pass rate 学习曲线对比(%,5-step 移动平均,全 150 步)

X: training step · Y: batch pass rate(5-step 移动平均,降噪)。四组起步几乎重合,末段收敛到 88–91% 窄带,比 2B 赛道的算法间差异明显更小。

平均响应长度对比(tokens,全 150 步)

X: step · Y: mean generated tokens/response. E1(GRPO) 涨幅最大(5.1k→9.7k),E3(Dr.GRPO) 涨幅最小(5.3k→7.3k)——与 2B 赛道的排序相反,见上方"规模变化"分析。(虚线 = 16K 生成上限)

策略熵对比(entropy,全 150 步)

X: step · Y: mean token entropy. E3 全场最低最紧(0.081→0.048);E2(DAPO) 全程走高(0.256→0.417),是四组中唯一没有收敛的;E1/E4 都有 KL loss 拉住,走势接近且温和下降。

梯度范数对比(grad_norm,全 150 步)

X: step · Y: 全局梯度范数。E3 基线最低最稳(0.03–0.23);E2 在 step43/59 附近有两次瞬时尖峰(0.96/1.13,图中可见两个明显突起),其余步与 E1/E4 同处 0.1–0.3 区间。

150 步总训练耗时(小时)

X: 实验 · Y: 150 步全程墙钟耗时。E2(DAPO) 仍最快(32.6h),但四组差距(31.7h–37.2h)比 2B 赛道(21.2h–26.8h)更接近,4 卡 + 关闭 offload 后算法本身对墙钟的影响被摊薄。

AIME24 验证 acc@1 对比(%,step 25/50/75/100/125/150)

X: training step(val at test_freq=25) · Y: aime24 acc/mean@1(30 题贪婪解码)。四组在 56.7–83.3% 区间震荡,E1 是唯一 step150 明显回落的一组。

本页由 scripts/parse_4b_logs.py + scripts/gen_4b_js.py 从 logs/exp2card/e*_4b/train_*.log 直接解析生成(纯 HTML/CSS/JS,零外部依赖,可离线打开)。用 bash serve.sh 起一个本地静态服务器后在浏览器访问,或直接双击/拖拽本文件到浏览器打开。

Source: logs/exp2card/e1_grpo_4b/train_20260714_125151.log(150/150 步一次性跑完,单个日志文件无 resume)。

E1 · GRPO baseline —— 4B 上唯二保留 KL loss 的组之一
组内均值 baseline + 除以组内 std;KL loss 系数 1e-3。pass rate 由首步 ~80% 稳步升到末段 90% 左右;entropy 0.25→0.22 平稳收敛;响应长度四组涨幅最大(5.1k→9.7k);aime24 在 step150 回落到 0.633,是四组中唯一末段走低的。

Pass rate(%,逐 step 原始值)

响应长度(tokens)

策略熵 entropy

梯度范数 grad_norm

actor/loss

PPO KL(×1e5,带符号)

PPO 裁剪比例 pg_clipfrac(%)

rollout↔训练概率偏离度((1−corr)×1e4)

Source: logs/exp2card/e2_dapo_4b/train_20260716_02*.log(2 个日志文件,第一个仅含启动日志,实际 150 步数据都在第二个文件里)。

E2 · DAPO —— 4B 上全场最快,但出现两次瞬时梯度尖峰
Clip-Higher + Dynamic Sampling + Overlong Reward Shaping,关闭 KL loss,墙钟最快(32h33m)。step43 grad_norm 冲到 0.96、step59 冲到 1.13(其余步 0.1–0.3),下方梯度范数图上有两个明显尖峰;entropy 全程走高(0.256→0.417),四组中唯一没有收敛趋势,训练后期是否需要关注熵失控值得跟进。

Pass rate(%,逐 step 原始值)

响应长度(tokens)

策略熵 entropy

梯度范数 grad_norm

actor/loss

PPO KL(×1e5,带符号)

PPO 裁剪比例 pg_clipfrac / pg_clipfrac_lower(%)

rollout↔训练概率偏离度((1−corr)×1e4)

Source: logs/exp2card/e3_drgrpo_4b/train_20260717_105706.log(150/150 步一次性跑完)。

E3 · Dr.GRPO —— 熵收得最紧、梯度最稳,但长度涨幅反而全场最小
不除以组内 std + loss_agg_mode=seq-mean-token-sum-norm,关闭 KL loss。entropy 0.081→0.048 全场最低最紧;grad_norm 基线全场最低(0.03–0.23);响应长度只从 5.3k 涨到 7.3k,涨幅四组最小——这与 2B 赛道"Dr.GRPO 长度涨得最多"的结论正好相反,是本轮最值得关注的规模效应。aime24 在 step125 摸到全场最高 0.800。

Pass rate(%,逐 step 原始值)

响应长度(tokens)

策略熵 entropy

梯度范数 grad_norm

actor/loss

PPO KL(×1e5,带符号)

PPO 裁剪比例 pg_clipfrac(%)

rollout↔训练概率偏离度((1−corr)×1e4)

Source: logs/exp2card/e4_rloo_4b/train_20260718_184125.log(150/150 步一次性跑完)。

E4 · RLOO —— step125 单点 aime24 全场最高(0.833)
留一法(leave-one-out) baseline,保留 KL loss(low_var_kl,1e-3),墙钟次高(35h47m)。entropy/grad_norm 走势与 E1 接近(都有 KL 拉住);响应长度涨幅居中(5.0k→8.1k);aime24 在 step125 摸到全场最高 0.833,step150 回落到 0.767,与 E2/E3 并列该步最高。

Pass rate(%,逐 step 原始值)

响应长度(tokens)

策略熵 entropy

梯度范数 grad_norm

actor/loss

PPO KL(×1e5,带符号)

PPO 裁剪比例 pg_clipfrac(%)

rollout↔训练概率偏离度((1−corr)×1e4)

Source: logs/exp2card/e5_reinforce_pp_4b/train_20260720_063429.log(训练中,截至本页数据更新时完成 21/150 步,约 4h23m)。以下图表随训练推进只会展示已完成的 step,刷新数据需重跑 scripts/parse_4b_logs.py + gen_4b_js.py。

E5 · REINFORCE++ —— 刚起步,暂无异常信号
不做组内 baseline,改为全 batch 白化折扣 return + mse 形式 KL loss。前 21 步 pass rate 在 73–94% 区间波动(与其它四组同规模起点一致),entropy 稳定在 0.22–0.28,未见梯度或 KL 异常。距首次 aime24 验证(test_freq=25)还差 4 步。

Pass rate(%,逐 step 原始值)

响应长度(tokens)

策略熵 entropy

梯度范数 grad_norm

actor/loss

PPO KL(×1e5,带符号)

PPO 裁剪比例 pg_clipfrac(%)

rollout↔训练概率偏离度((1−corr)×1e4)