aiwillknow.AI 前沿观察每日 08:00 开始整理
大模型全文深读与原图讲解

STI-OPD:学生先作答,老师按分歧概率接管一轮

重要性权重校正老师生成的token,不会把被干预的整条轨迹变回纯学生分布

IN A NUTSHELL

STI-OPD针对多轮智能体蒸馏的错误累积:学生先提议完整回复,老师给其token评分,以非负KL估计构造接管概率;若介入则重生成整轮,执行后再交回学生。老师token用学生/老师概率比加权反向KL。Qwen3-1.7B在ScienceWorld由普通OPD的17.1%升至27.5%,但方法需要逐token概率,纯采样API无法直接使用。

01

图解主要方法

老师接管怎样减少多轮错误,又如何避免把混合轨迹误称为无偏学生策略训练?

先对学生整轮评分决定是否老师重生成,再按生成来源处理蒸馏权重;环境只执行被选回复。
图2|提议评分、随机接管与来源加权查看大图 ↗
莫纳什大学、香港理工大学、中关村实验室,arXiv:2610.10878v1。原图未改动,仅用于方法评论。 · 原始来源与图注 ↗ · 版权归作者;arXiv非独占托管许可不等于图片再分发许可
  1. 1

    先提议,再衡量局部分歧

    学生在当前共同历史生成整轮,老师逐token打分。比率r=老师概率/采样学生概率,k3=r−1−log r逐点非负;共同支持集下是token反向KL估计,长度均值s只是整轮差异代理,不是完整响应KL。

  2. 2

    将差异变成随机接管概率

    以s/(1+s)作伯努利概率,抽中则老师从同一历史重新生成整轮推理和动作;被丢弃学生提议既不执行也不入训练。小分歧仍可能接管,大分歧仍可能保留,避免硬阈值但不保证每次纠错。

  3. 3

    执行混合策略,下一轮交回学生

    环境只看最终被选动作,返回新观测;新历史含学生和老师回合。逐轮重算分歧,不设固定课程;随学生接近老师,平均接管自然下降,但历史访问已偏离纯学生策略。

  4. 4

    按生成来源加权蒸馏

    老师token乘当前学生/老师概率比,使固定上下文且未裁剪时估计学生条件反向KL。图2还画出滞后采样学生比率;严格同策略该比率为1。该局部修正不补偿自适应选择与全部前缀分布。

  5. 5

    以PPO式工程目标训练,部署移除老师

    附录把负log概率比当奖励,采用PPO式loss并裁剪重要性权重;这与无偏恒等式有差别。评测只用学生,无在线老师接管。

02

实验与证据

已读全文、算法1及附录A–D,包括训练配置、全部提示模板、预算对照与三个案例;图2原图核验;未独立复训。

来源证据工具推理34501题:14116数学、10385代码、10000科学;一epoch批128。ALFWorld3553、ScienceWorld2294,均200步批32。 表4;B.1–B.3 ↗

我的解读只使用问题发起新轨迹,原数据回答不是固定蒸馏目标;应计入每题在线交互成本。

来源证据每题1轨迹,温度1、top-p1,单轮最多32768token、上下文40960;工具5轮、交互30轮,4 GB200。 表4 ↗

我的解读生成上限非常高,介入整轮的成本受长度影响;单轨迹不等于低总计算。

来源证据1.7B与4B老师:ScienceWorld27.5±0.5%,OPD17.1±0.5%、FutureBridge22.2±0.4%;Look73.7%对66.5%。 表2 ↗

我的解读增益为10.4或5.3个百分点,分别对应不同基线;不混成相对百分比。

来源证据1.7B工具结果AIME24/25/26为52.2/44.7/39.7,GPQA42.2,LiveCodeBench52.8。 表1;4.1 ↗

我的解读表1用Avg32与Avg8的多采样平均口径,不能报成单次pass@1;论文未具体写出独立运行数。

来源证据ScienceWorld去权重21.5、k1为23.8、前向KL23.1,对完整27.5。 表3 ↗

我的解读支持各组件有贡献,但k1可能为负,替代如何映射概率需实现核实。

来源证据32B老师时1.7B学生ScienceWorld56.3,FutureBridge46.2,老师47.8。 表5 ↗

我的解读学生在该基准可超过老师,不等于普遍超越老师能力;仅两种教师规模。

来源证据匹配接管次数后ScienceWorld24.2对FutureBridge18.7,Look69.9对62.9。 C.4;表8 ↗

我的解读正文把此称计算预算匹配,附录实际到相同最大介入数即停训;不控制所有前向评分、长度和更新数。

来源证据确定阈值0.5/1/2,ScienceWorld20.8/23.2/20.3,随机27.5。 C.3;表7 ↗

我的解读优于所试三个阈值,不能证明所有自适应确定规则均劣;概率映射仍是一项设计选择。

来源证据IFEval1.7B由71.3到74.3,前向KL65.7;Arena-Hard41.3到43.6,前向36.4。 C.2;表6 ↗

我的解读支持这两个指标的保留,未证明全面无遗忘;IFEval有可验证规则,不宜笼统称两者都是主观能力。

来源证据早晚案例使用相同训练实例;案例1后期较早位置仍有2次教师动作。 C.5 ↗

我的解读局部接管下降是机制示例,不是未见任务因果证据,也不能说该案例整条轨迹已独立。

来源证据式10在固定上下文成立;式11保留概率依赖完整学生提议;实际权重裁剪。 3.3;B.3 ↗

我的解读编辑解读:保留样本存在选择偏差的可能,不能仅以“最初由学生采样”推出条件保留后仍是原分布;需单独测量。

03

开放情况与使用许可

正文与附录未给官方实现、权重或模型卡链接,检索未确认作者发布;不将基础Qwen模型的开放状态当作本方法已开源。

LICENSE论文arXiv非独占托管许可;图2仅用于必要方法评论,保留作者、来源与原图;代码和蒸馏模型许可未核实。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

两种学生规模在所有所报单元均超过对照,ScienceWorld与ALFWorld长依赖任务的增益较明显。

去重要性权重、换k1、换前向KL均退化;相同介入次数对照仍有增益,支持不只是多用老师。

反方 · 哪些结论还不够

固定上下文下的重要性恒等式不能校正干预改变的历史分布;保留提议也受依赖提议内容的选择规则影响。

实际PPO式优化对权重裁剪,会引入偏差,论文中的精确期望恒等式不能不加条件地用于工程实现。

所谓教师计算量匹配实际匹配接管次数,不是评分token、生成长度、前向调用或FLOPs。

综合判断

实验支持按分歧随机接管与加权学习对这些文本智能体有效;理论可支持的范围是固定上下文的未裁剪token期望,不能扩展为整轨迹无偏OPD。

我会先做的验证

建议实验(尚未执行):固定教师总评分与生成token/FLOPs,比较随机与充分调参阈值;在可枚举小环境测提议保留偏差与裁剪偏差,并公布种子、裁剪范围、状态访问分布及迁移任务表现。

继续探索大模型