算法 多模态

Text RL · Algorithm Primer

从 PPO 到五种 critic-free 变体

先按「要不要 value 网络」分成两大家族,再在 critic-free 里按 baseline 怎么估继续细分。 本轮 2B/4B 训练只跑了右侧五族;PPO 因需另训 critic、显存与时间翻倍,未纳入对比。 曲线见 2B 训练 / 4B 训练

PPO GRPO DAPO Dr.GRPO RLOO REINFORCE++

算法怎么分

三条谱系:actor-critic → 组相对 → 其它无 critic 基线

Family A · Actor-Critic

有 Value 网络

用 learned critic(常配 GAE)估 advantage;策略更新仍可套 PPO clip。多一份前向与显存。

PPO

本轮未跑(2 卡预算下 critic 成本过高)

Family B · Group-Relative

同题 G 条相对打分

同一 prompt 采样多条,用组内统计当 baseline,省掉 critic。GRPO 是基座;DAPO / Dr.GRPO 是其上工程与偏置修正。

GRPO DAPO Dr.GRPO

共享 adv_estimator=grpo,差在归一化 / KL / 采样与 reward 机制

Family C · Other Critic-Free

换一套 baseline

同样不训 value,但不走「组内均值 ± std」这条路:留一法,或全 batch 白化。

RLOO REINFORCE++

RLOO 仍用组内采样;REINFORCE++ 不依赖同题分组

逐算法简介

每个算法在做什么 · 核心机制一句话

主要区别点

五条轴线:从 PPO 对照到 DAPO 工程

  1. 1

    有没有 Critic —— PPO vs 其余全部

    PPO:另训 value 网络,用 GAE(或类似)估 advantage,策略侧再做 ratio clip。其余五种:不训 critic,用采样统计当 baseline,显存与实现都更轻,也是本轮对比的主线。

  2. 2

    Advantage 的 baseline 怎么估

    PPO:value 预测的 V(s)。GRPO / DAPO / Dr.GRPO:同题 G 条的组内平均 rewardRLOO:留一法——每条 baseline 是同组其余 G−1 条均值,相对组均值减小偏差、增大方差REINFORCE++:不做组内 baseline,对全 batch 折扣 return 做白化。

  3. 3

    GRPO 的两个隐藏偏置 —— Dr.GRPO 修这两处

    难度偏置:除以组内 std,越「确定」的题梯度被放大。Dr.GRPO 去掉(norm_adv_by_std=False)。长度偏置token-mean 分母随长度漂移;Dr.GRPO 用 seq-mean-token-sum-norm(固定分母)。DAPO 沿用 GRPO 这两项未改。PPO / RLOO / REINFORCE++ 不在这条偏置轴上。

  4. 4

    要不要 KL 约束

    开 KL(PPO 常有、以及 GRPO / RLOO / REINFORCE++):更稳,但多一次 ref 前向。GRPO / RLOO 常用 low_var_kl,REINFORCE++ 常用 mse关 KL(DAPO / Dr.GRPO):更自由、更快。

  5. 5

    DAPO 的工程四件套(仅 DAPO)

    Clip-Higher 非对称裁剪 · Dynamic Sampling 丢掉全对/全错组 · Overlong Reward Shaping 软惩罚超长回答 · 关 KL

优缺点一览

按族分组 · 算法层面的一般权衡,非单次实验结论

Actor-Critic

PPO

优点

经典稳;GAE + clip 理论与工程成熟;单条样本也能估 advantage,不强制同题多样本。

缺点

要训 critic,显存与时间明显更高;value 估偏会拖策略;LLM 长序列下 critic 更难训稳。

Group-Relative

GRPO

优点

实现简单、无需 value;组内均值 baseline 稳;社区验证最充分,其余变体的共同基座。

缺点

长度/难度两个隐藏偏置;开 KL 更慢;无超长与全对/全错组的专门处理。

DAPO

优点

Clip-Higher 保探索;Dynamic Sampling 保证有效梯度;Overlong 抑长度;关 KL 更自由。

缺点

机制与超参多;重复采样成本高;仍带 GRPO 两偏置;压长度或伤长推理题。

Dr.GRPO

优点

最小改动修掉长度+难度偏置;理论更干净;梯度方差通常更小。

缺点

早期信号可能偏弱;无长度抑制时回答可能变长;固定分母实现若取 padding 可能漂移。

Other Critic-Free

RLOO

优点

LOO baseline 与当前样本解耦,偏差更小。若更关心难度偏置(简单/困难 prompt 的梯度权重失衡)或多步 off-policy 稳定性,RLOO(或带 shrinkage 的变体)通常比除以组内 std 的 GRPO 更干净。

缺点

每条只用 G−1 估基线,方差更大;依赖 G>1;开 KL 仍有 ref 开销;对 reward 异常值更敏感。

REINFORCE++

优点

不依赖组内分组;全 batch 白化尺度稳;实现最直接。

缺点

不同难度题被耦合归一;无组内 baseline 方差可能更高;开 KL 仍有 ref 开销。

核心配置差异

对照表 · PPO 列为概念对照;本轮脚本只覆盖右侧五列

PPOGRPODAPODr.GRPORLOOREINFORCE++
Actor-CriticGroup-RelativeOther Critic-Free
adv_estimatorgaegrpogrpogrporlooreinforce_plus_plus
Critic / Value要训
baselineV(s) + GAE组内均值组内均值组内均值LOO(减偏差、增方差)全 batch 白化
除以组内 std
loss_agg_modetoken-meantoken-meantoken-meanseq-mean-token-sum-normtoken-meantoken-mean
KL loss常开开 low_var_kl开 low_var_kl开 mse
clip对称对称非对称对称对称对称
Dynamic Sampling
Overlong 惩罚
reward managernaivenaivedaponaivenaivenaive
本轮是否训练

一句话记忆

按族带走六句