一套受控对比实验与静态看板:在统一训练设定下只换 RL 算法,观察训练动态与数学能力差异;并延伸到更大模型规模与多模态图文配比。
本项目基于 verl,在 Qwen3.5 上做 LLM post-training 的 RL 算法横向对比。 核心问题不是「哪个算法绝对最好」,而是:在数据、序列长度、采样预算、学习率、总步数、种子尽量锁死时, GRPO / DAPO / Dr.GRPO / RLOO / REINFORCE++(对照概念上还有 PPO)各自如何影响 pass rate、响应长度、熵、梯度稳定性与验证集表现。
实验分三条线推进:2B 语言模型是主赛道(2×A100,先跑完、日志与归档最全); 4B 语言模型用同一套算法定义放大复验(4×A100,TP=4、关闭 offload); 多模态固定 GRPO,只改图文样本占比(0/20/50/100%),检验视觉推理收益与文本能力是否被稀释。 PPO 因需另训 critic、显存与时间成本高,本轮未纳入训练对比。
非思考模式 · 16K response · train_batch_size=32 · rollout.n=8 · 150 step · 训练数据 polaris_easy_boxed · 验证 aime24(test_freq=25)。各赛道只改模型规模或数据模态,不改算法超参定义。
Actor-Critic:PPO。Group-Relative:GRPO / DAPO / Dr.GRPO。其它 critic-free:RLOO / REINFORCE++。差异集中在 baseline、std 归一化、KL、以及 DAPO 的工程机制。详见「算法介绍」。
「算法介绍」讲定义与权衡(含多模态配比说明);「2B / 4B 训练」只放训练曲线与对比图;「多模态训练」是开跑后的监控占位。下方卡片按入口进入。
2B 归档在 archive/e*_2b/;4B 日志在 logs/exp2card/e*_4b/;方案见 exp_plan.md / 4b_exp_plan.md / 多模态 exp_plan_mm.md。本站为零依赖静态页,bash serve.sh 即可本地打开。
按族分类:PPO(actor-critic)与五种 critic-free(GRPO 族 / RLOO / REINFORCE++)。含差异点、优缺点与配置表;训练曲线见各赛道页。
Qwen3.5-2B · 2×A100-80GB · 16K 非思考模式 · E1–E5 五组算法对比,是本轮最先跑完、数据最完整的赛道。
Qwen3.5-4B · 4×A100-80GB · 同一套算法对比在更大模型规模上复验;仅训练过程曲线(算法说明见「算法介绍」)。
在「算法介绍」下的「多模态」页签:固定 GRPO,只改图文占比(0/20/50/100%)。训练监控见「多模态训练」。