STI-OPD:学生先作答,老师按分歧概率接管一轮
重要性权重校正老师生成的token,不会把被干预的整条轨迹变回纯学生分布
STI-OPD针对多轮智能体蒸馏的错误累积:学生先提议完整回复,老师给其token评分,以非负KL估计构造接管概率;若介入则重生成整轮,执行后再交回学生。老师token用学生/老师概率比加权反向KL。Qwen3-1.7B在ScienceWorld由普通OPD的17.1%升至27.5%,但方法需要逐token概率,纯采样API无法直接使用。
图解主要方法
老师接管怎样减少多轮错误,又如何避免把混合轨迹误称为无偏学生策略训练?

- 1
先提议,再衡量局部分歧
学生在当前共同历史生成整轮,老师逐token打分。比率r=老师概率/采样学生概率,k3=r−1−log r逐点非负;共同支持集下是token反向KL估计,长度均值s只是整轮差异代理,不是完整响应KL。
- 2
将差异变成随机接管概率
以s/(1+s)作伯努利概率,抽中则老师从同一历史重新生成整轮推理和动作;被丢弃学生提议既不执行也不入训练。小分歧仍可能接管,大分歧仍可能保留,避免硬阈值但不保证每次纠错。
- 3
执行混合策略,下一轮交回学生
环境只看最终被选动作,返回新观测;新历史含学生和老师回合。逐轮重算分歧,不设固定课程;随学生接近老师,平均接管自然下降,但历史访问已偏离纯学生策略。
- 4
按生成来源加权蒸馏
老师token乘当前学生/老师概率比,使固定上下文且未裁剪时估计学生条件反向KL。图2还画出滞后采样学生比率;严格同策略该比率为1。该局部修正不补偿自适应选择与全部前缀分布。
- 5
以PPO式工程目标训练,部署移除老师
附录把负log概率比当奖励,采用PPO式loss并裁剪重要性权重;这与无偏恒等式有差别。评测只用学生,无在线老师接管。
实验与证据
已读全文、算法1及附录A–D,包括训练配置、全部提示模板、预算对照与三个案例;图2原图核验;未独立复训。
来源证据工具推理34501题:14116数学、10385代码、10000科学;一epoch批128。ALFWorld3553、ScienceWorld2294,均200步批32。 表4;B.1–B.3 ↗
我的解读只使用问题发起新轨迹,原数据回答不是固定蒸馏目标;应计入每题在线交互成本。
来源证据每题1轨迹,温度1、top-p1,单轮最多32768token、上下文40960;工具5轮、交互30轮,4 GB200。 表4 ↗
我的解读生成上限非常高,介入整轮的成本受长度影响;单轨迹不等于低总计算。
来源证据1.7B与4B老师:ScienceWorld27.5±0.5%,OPD17.1±0.5%、FutureBridge22.2±0.4%;Look73.7%对66.5%。 表2 ↗
我的解读增益为10.4或5.3个百分点,分别对应不同基线;不混成相对百分比。
来源证据1.7B工具结果AIME24/25/26为52.2/44.7/39.7,GPQA42.2,LiveCodeBench52.8。 表1;4.1 ↗
我的解读表1用Avg32与Avg8的多采样平均口径,不能报成单次pass@1;论文未具体写出独立运行数。
来源证据ScienceWorld去权重21.5、k1为23.8、前向KL23.1,对完整27.5。 表3 ↗
我的解读支持各组件有贡献,但k1可能为负,替代如何映射概率需实现核实。
来源证据32B老师时1.7B学生ScienceWorld56.3,FutureBridge46.2,老师47.8。 表5 ↗
我的解读学生在该基准可超过老师,不等于普遍超越老师能力;仅两种教师规模。
来源证据匹配接管次数后ScienceWorld24.2对FutureBridge18.7,Look69.9对62.9。 C.4;表8 ↗
我的解读正文把此称计算预算匹配,附录实际到相同最大介入数即停训;不控制所有前向评分、长度和更新数。
来源证据确定阈值0.5/1/2,ScienceWorld20.8/23.2/20.3,随机27.5。 C.3;表7 ↗
我的解读优于所试三个阈值,不能证明所有自适应确定规则均劣;概率映射仍是一项设计选择。
来源证据IFEval1.7B由71.3到74.3,前向KL65.7;Arena-Hard41.3到43.6,前向36.4。 C.2;表6 ↗
我的解读支持这两个指标的保留,未证明全面无遗忘;IFEval有可验证规则,不宜笼统称两者都是主观能力。
来源证据早晚案例使用相同训练实例;案例1后期较早位置仍有2次教师动作。 C.5 ↗
我的解读局部接管下降是机制示例,不是未见任务因果证据,也不能说该案例整条轨迹已独立。
来源证据式10在固定上下文成立;式11保留概率依赖完整学生提议;实际权重裁剪。 3.3;B.3 ↗
我的解读编辑解读:保留样本存在选择偏差的可能,不能仅以“最初由学生采样”推出条件保留后仍是原分布;需单独测量。
开放情况与使用许可
正文与附录未给官方实现、权重或模型卡链接,检索未确认作者发布;不将基础Qwen模型的开放状态当作本方法已开源。
LICENSE论文arXiv非独占托管许可;图2仅用于必要方法评论,保留作者、来源与原图;代码和蒸馏模型许可未核实。
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
两种学生规模在所有所报单元均超过对照,ScienceWorld与ALFWorld长依赖任务的增益较明显。
去重要性权重、换k1、换前向KL均退化;相同介入次数对照仍有增益,支持不只是多用老师。
反方 · 哪些结论还不够
固定上下文下的重要性恒等式不能校正干预改变的历史分布;保留提议也受依赖提议内容的选择规则影响。
实际PPO式优化对权重裁剪,会引入偏差,论文中的精确期望恒等式不能不加条件地用于工程实现。
所谓教师计算量匹配实际匹配接管次数,不是评分token、生成长度、前向调用或FLOPs。
综合判断
实验支持按分歧随机接管与加权学习对这些文本智能体有效;理论可支持的范围是固定上下文的未裁剪token期望,不能扩展为整轨迹无偏OPD。
我会先做的验证
建议实验(尚未执行):固定教师总评分与生成token/FLOPs,比较随机与充分调参阈值;在可枚举小环境测提议保留偏差与裁剪偏差,并公布种子、裁剪范围、状态访问分布及迁移任务表现。