2×A100-80GB · non-thinking · 16K response · E1–E4 已完成 150/150,E5 训练中。算法定义见 算法介绍。
Sources: archive/e1_grpo_2b, archive/e2_dapo_2b, archive/e3_drgrpo_2b, archive/e4_rloo_2b(各自 logs/train_*.log)。训练动态曲线(pass rate / length / entropy / grad_norm)四组统一截取 step 1–129 对齐比较——E1 归档 canvas 快照止于该范围(实际四组训练均已跑满 150 步)。AIME24 验证曲线不受此限制,覆盖全部 step 25–150。静态网页版,E1–E3 数据与 Cursor Canvas 版本(archive/canvases/e1-e3-algorithm-comparison.canvas.tsx)一致;E4 为本次新增,直接取自 archive/e4_rloo_2b/logs/train_20260717_180634.log,尚未回填进该 canvas 源文件。pass rate = (reward_mean+1)/2 over 32×8 samples/step。
X: training step · Y: batch pass rate(5-step 移动平均,降噪)。E4 起步最快(KL loss 保留+留一法 baseline,早期信号最稳);E2 起步最低最慢(KL loss 关闭+更激进的长度压制,早期更不稳)。E1/E3/E4 都在 step40–50 附近先后突破 55–60%(E2 明显更晚,step59 才达到);E3 在 step100–125 一度领先全场达 6–11 个百分点,E4 全程稳定在中上区间,最后几步小幅收窄,全程领先 E2。
X: step · Y: mean generated tokens/response. E2 因 Overlong Reward Shaping 下降最快最深;E3 去掉 std 归一化后不降反升;E1/E4 都介于两者之间、大致持平(E4 略低、波动更小)。(虚线 = 16K 生成上限)
X: step · Y: mean token entropy. E3 收得最紧(0.27→0.10);E2 全程最高最松(无 KL loss 拉住参考分布);E1/E4(都有 KL loss)收敛节奏几乎一致,居中。
X: step · Y: 全局梯度范数。E3 基线最低(0.13–0.20),E1/E2/E4 在 0.23–0.41 区间、幅值接近。E3 在 step133–140(此图范围外)另有一次瞬时尖峰,见 archive/e3_drgrpo_2b 的独立 canvas。
X: 实验 · Y: 150 步全程墙钟耗时。E2(DAPO) 因响应更短耗时最少;E1/E3 耗时接近(差 <1h);E4(RLOO) 最慢,因保留 KL loss 多一次 ref 前向。
本页由 archive/canvases/e1-e3-algorithm-comparison.canvas.tsx 的数据静态渲染而成(纯 HTML/CSS/JS,零外部依赖,可离线打开)。用 bash serve.sh 起一个本地静态服务器后在浏览器访问,或直接双击/拖拽本文件到浏览器打开。
Source: archive/e1_grpo_2b/logs/train_20260712_185929.log(本归档快照覆盖 step 1–129,实际训练已跑满 150 步,后续 resume 的日志未回填进此 canvas 快照)。完整交互版(含 MFU / 吞吐 / 耗时构成等更多指标):archive/canvases/e1-grpo-training.canvas.tsx(Cursor Canvas 格式,只能在 Cursor IDE 内打开)。
Source: archive/e2_dapo_2b/logs/train_20260714_110612.log(150/150 步一次性跑完)。完整交互版(含 MFU / 吞吐 / 耗时构成等更多指标):archive/canvases/e2-dapo-training.canvas.tsx(Cursor Canvas 格式,只能在 Cursor IDE 内打开)。
Source: archive/e3_drgrpo_2b/logs/train_20260715_114131.log(150/150 步一次性跑完;step133–140 附近有一次瞬时不稳定 episode(PPO KL/裁剪比例短暂尖峰,entropy 骤降),下方 PPO KL 与裁剪比例图上能看到该尖峰)。完整交互版(含 MFU / 吞吐 / 耗时构成等更多指标):archive/canvases/e3-drgrpo-training.canvas.tsx(Cursor Canvas 格式,只能在 Cursor IDE 内打开)。
Source: archive/e4_rloo_2b/logs/train_20260717_180634.log(150/150 步一次性跑完)。完整交互版(含 MFU / 吞吐 / 耗时构成等更多指标):archive/canvases/e4-rloo-training.canvas.tsx(Cursor Canvas 格式,只能在 Cursor IDE 内打开)。