算法 多模态

Multimodal · Data Mix

只改图文配比的消融

算法固定为 GRPO,唯一自变量是训练数据里图文样本占比。 看两件事:视觉推理上限(Geo3K),以及文本数学是否被稀释。训练曲线见 多模态训练

配比怎么设

四档占比,其余超参不动

0%

纯文本对照端点;与文本侧 GRPO 对齐,可复用已有结果。

20%

Geo3K + 更大量文本;更贴近真实 post-training 配比。

50%

Geo3K + 等量文本子集;等量混合。

100%

纯 Geo3K 图文;检验纯视觉信号下的 GRPO。

统一不变量:序列长度、采样预算、学习率、总步数等保持不变,只改 data.train_files 混合比例。

模型与任务

同底座加视觉,任务选 Geo3K

  1. 1

    模型:同底座加视觉,不换一套 VL

    Qwen3.5-2B 原生 vision(与文本实验同一份权重),而不是独立 Qwen3-VL-2B。唯一多出来的是图像模态,语言侧起点与文本 GRPO 对齐。

  2. 2

    任务:Geo3K(几何 + 数学推理)

    社区有现成 GRPO 与 reward;视觉主判据用 Geo3K test acc,文本保持用 math_500 / aime 等同探针。

Reward 分发

同一 batch 混有文本行与图文行

  1. 1

    按 data_source 分流

    geometry3k → geo3k 判分;否则走文本 math(boxed + Math-Verify)。

  2. 2

    文本分支

    复用文本实验口径,保证 0% 图文端点与文本 GRPO 可比。

  3. 3

    图文分支

    复用 Geo3K 官方判分(答案等价 + 少量格式奖励),与社区基线一致。

为什么只锁一个自变量

避免维度交叉导致不可归因

还可消融:冻视觉编码器、分辨率 / 视觉 token、底座对比等。与配比交叉会指数膨胀、难归因。 本轮算法固定 GRPO、分辨率与底座固定,只改图文占比;若出现明显负/正迁移,再立项下一轮。

一句话记忆