Qwen3.5 RL 算法对比实验

一套受控对比实验与静态看板:在统一训练设定下只换 RL 算法,观察训练动态与数学能力差异;并延伸到更大模型规模与多模态图文配比。

项目介绍

本项目基于 verl,在 Qwen3.5 上做 LLM post-training 的 RL 算法横向对比。 核心问题不是「哪个算法绝对最好」,而是:在数据、序列长度、采样预算、学习率、总步数、种子尽量锁死时, GRPO / DAPO / Dr.GRPO / RLOO / REINFORCE++(对照概念上还有 PPO)各自如何影响 pass rate、响应长度、熵、梯度稳定性与验证集表现。

实验分三条线推进:2B 语言模型是主赛道(2×A100,先跑完、日志与归档最全); 4B 语言模型用同一套算法定义放大复验(4×A100,TP=4、关闭 offload); 多模态固定 GRPO,只改图文样本占比(0/20/50/100%),检验视觉推理收益与文本能力是否被稀释。 PPO 因需另训 critic、显存与时间成本高,本轮未纳入训练对比。

统一不变量

非思考模式 · 16K response · train_batch_size=32 · rollout.n=8 · 150 step · 训练数据 polaris_easy_boxed · 验证 aime24test_freq=25)。各赛道只改模型规模或数据模态,不改算法超参定义。

算法谱系

Actor-Critic:PPO。Group-Relative:GRPO / DAPO / Dr.GRPO。其它 critic-free:RLOO / REINFORCE++。差异集中在 baseline、std 归一化、KL、以及 DAPO 的工程机制。详见「算法介绍」。

看板怎么读

「算法介绍」讲定义与权衡(含多模态配比说明);「2B / 4B 训练」只放训练曲线与对比图;「多模态训练」是开跑后的监控占位。下方卡片按入口进入。

数据与复现

2B 归档在 archive/e*_2b/;4B 日志在 logs/exp2card/e*_4b/;方案见 exp_plan.md / 4b_exp_plan.md / 多模态 exp_plan_mm.md。本站为零依赖静态页,bash serve.sh 即可本地打开。

入口