Multimodal · Data Mix
算法固定为 GRPO,唯一自变量是训练数据里图文样本占比。 看两件事:视觉推理上限(Geo3K),以及文本数学是否被稀释。训练曲线见 多模态训练。
四档占比,其余超参不动
纯文本对照端点;与文本侧 GRPO 对齐,可复用已有结果。
Geo3K + 更大量文本;更贴近真实 post-training 配比。
Geo3K + 等量文本子集;等量混合。
纯 Geo3K 图文;检验纯视觉信号下的 GRPO。
统一不变量:序列长度、采样预算、学习率、总步数等保持不变,只改 data.train_files 混合比例。
同底座加视觉,任务选 Geo3K
用 Qwen3.5-2B 原生 vision(与文本实验同一份权重),而不是独立 Qwen3-VL-2B。唯一多出来的是图像模态,语言侧起点与文本 GRPO 对齐。
社区有现成 GRPO 与 reward;视觉主判据用 Geo3K test acc,文本保持用 math_500 / aime 等同探针。
同一 batch 混有文本行与图文行
geometry3k → geo3k 判分;否则走文本 math(boxed + Math-Verify)。
复用文本实验口径,保证 0% 图文端点与文本 GRPO 可比。
复用 Geo3K 官方判分(答案等价 + 少量格式奖励),与社区基线一致。
避免维度交叉导致不可归因
还可消融:冻视觉编码器、分辨率 / 视觉 token、底座对比等。与配比交叉会指数膨胀、难归因。 本轮算法固定 GRPO、分辨率与底座固定,只改图文占比;若出现明显负/正迁移,再立项下一轮。