基础模型的推理开关:开头两个词元与训练数据的联系
数据替换与重新训练给出因果证据;不能据此把强化学习的全部价值缩减为开头措辞
研究固定基础模型回答的开头词元,Olmo-3-7B在MATH-500的单次采样正确率从42.2%到77.9%,接近RL-Zero参考模型。更关键的是,替换中期训练数据的词语再训练,可以让原本无关的Chicken触发类似推理,也能把原触发词重定向为提问。有效前缀依赖模型、提示模板和位置,较强后训练模型及部分任务未获益。
图解主要方法
基础模型没自然给出好解,是缺少能力,还是没有走入训练中已有的推理续写模式?

- 1
分离开头出现概率与条件续写能力
回答概率拆成开头概率和给定开头后的续写概率。预填固定一到两个词元,不改权重,让同一模型续写;标点和换行也属于开头的一部分,不能只按单词含义解释。
- 2
不用答案标签挑选前缀
论文用30道MATH训练题、宽20深2的束搜索提名,再为每个候选每题采16次。过滤缺答案率明显变差的候选,选择最终答案熵最低者。低熵可能只是稳定答错,不能当正确性保证;发布README的提名默认100题,与正文设置需区分。
- 3
与直接强化学习及开头交换对照
标准和强制前缀GRPO共用300步、每步32题各16次采样、4096词元上限和rank64 LoRA。预填部分不进入损失;另把RL产生的开头交给基础模型继续,反向也做,以测试收益落在哪个阶段。
- 4
编辑训练数据并重新训练
从相同Olmo检查点续训,先把okay替成chicken,再把短问答的Question标签改成Okay。10B词元配方固定顺序与种子,并补做100B替换;SmolLM3用2B词元和不同推理数据比例复查,区别创造新关联与仅删掉旧词。
- 5
用表示与预算控制限定解释
比较第24层状态与平衡抽样的训练来源近邻,并测前缀插入位置;同时用输出截断、重复投票和其他模型检验。近邻比例是相关指标,数据替换才提供直接干预;安全测试单独评分,不能由数学提升推断更安全。
实验与证据
全文152170字符及A–H附录已读;图1上部核验;作者项目、代码、MIT许可和发布范围已检查。没有执行大模型训练或生成评测。
来源证据MATH-500:Olmo-3-7B为42.2±2.2%→77.9±1.5%,RL参考75.0±1.5%;每题32次采样。 表6、7;B.1 ↗
我的解读这是单次响应正确率的估计,不是32次选优;误差为采样索引间标准差,非训练种子区间。
来源证据Qwen3-14B数学72.2%→86.6%,但同boxed模板HumanEval86.3%→82.6%。 表6 ↗
我的解读摘要的总体相近表述不能抹去代码任务退化,提示选择按数学优化并不保证跨域。
来源证据Olmo-3-7B MATH单次提升35.7个百分点,但16次至少一次正确仅94.0%→95.4%。 表6 ↗
我的解读更多是改变正确解被采样到的频率;该结果不能证明能力集合没有任何改变,也不能泛化到其他模型。
来源证据交换生成器:RL开头+基础续写77.7%,基础开头+RL续写43.7%;各题4次。 表14 ↗
我的解读支持该条件下开头作用大;切换点是首空行后再两词元,不能描述为所有实验都只换前两个位置。
来源证据10B训练数据替换使Chicken数学正确率2.4%→37.2%;重定向后Okay降到0.2%。 表16 ↗
我的解读同训练干预下其他前缀仍有效;仅删掉Okay并未抹掉其旧能力,说明已有预训练关联保留。
来源证据100B替换,Chicken由未编辑中期检查点18.2%到76.9%,采样上限7168。 表17 ↗
我的解读与正文31744上限的77.9%不同协议,不能拼成同一条训练增益。
来源证据Llama-3.1-8B四样本Minerva基线18.7%,所测Okay前缀15.3%;Qwen思考开启约96%且加前缀几乎不变。 表8、9 ↗
我的解读模型与后训练阶段限制显著;未找到不等于不存在所有可能有效前缀。
来源证据Olmo平均响应4.8k到6.7k词元;从1k截断预算起仍有收益,Qwen最小预算反而下降。 图4、20;E ↗
我的解读截断重评分不是重新按短预算生成,也不是完全匹配真实计算开销;搜索成本需额外计入。
来源证据安全测试450提示由WildGuard自动评分,包含预填文本;部分安全回答触及1024词元上限。 H.1–H.3 ↗
我的解读拒答与有害性分开,评审器可能受格式和截断影响;Olmo的选择性拒答收益在Qwen上不复现,不推广成安全保证。
来源证据发布搜索README提名100题、筛选30题;正文提名30题。 A.1;官方README ↗
我的解读复现需显式固定设置;仓库存在可运行代码仍不代表默认命令精确复现每个论文表。
开放情况与使用许可
仓库实际包含束搜索、答案一致性筛选、评测、GRPO训练、固定依赖及CPU测试。README覆盖搜索/评测/RL;未确认反事实中期训练、隐状态分析的完整实现或对应新权重发布,基础权重来自原模型方。
LICENSE研究代码MIT,论文CC BY 4.0。基础模型、训练语料和基准各循上游许可;代码许可不覆盖所有实验资产。
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
仅改变续写开头就能显著提高固定模型数学表现;交换基础/RL开头与后续生成器进一步支持开头分布的重要作用。
在同起点、数据顺序与种子下替换训练文字,能创造Chicken触发效应,再把Okay关联到问题文本以移除其效应,提供直接的数据干预证据。
相同输出截断预算和重复采样对照表明部分收益不只是生成更长,不过最短预算上仍可能退化。
反方 · 哪些结论还不够
提示模板本身已经要求逐步解题,所以两词元不含推理指令不等于整个输入从未要求推理。
Qwen3-14B的数学前缀在HumanEval由86.3%降到82.6%;Llama-3.1-8B未找到有效前缀,推理开启的后训练Qwen几乎不获益。
隐状态近邻是人为平衡来源参考库中的相似性,非训练数据因果贡献;高相似也可能只生成推理样式而不给答案。
综合判断
证据支持合成训练数据形成可被开头词元调用的行为关联,以及这些RL-Zero运行中的部分收益来自改变开头概率;不支持“所有RL只是学会说Okay”或“任何模型加两个词都能推理”。
我会先做的验证
建议实验(尚未执行):固定模型版本和完全独立题集,比较无前缀、搜索前缀与RL,在相同总生成预算下报告单样本、投票、失败提取和延迟;用多个训练种子、多语言模板及安全任务检验数据替换效应和跨域损失。