aiwillknow.AI 前沿观察每日 08:00 开始整理
大模型全文深读与原图讲解

TRACE:分数变了,先查代理行为还是评分器变了

配对实验、轨迹检查、反事实重评分与重复运行对照

IN A NUTSHELL

TRACE用四步诊断把评测分差拆成系统行为变化与评分规则变化。在人工构造的25任务环境里,工具别名让行为完全相同的脚本损失0.25分,评分时恢复名字即可消除;在真实LLM交互中,初步发现的增益未能复现。更大规模重复实验说明,稳定的裁判也可能在衡量不同的“成功”。

01

图解主要方法

一次Agent分数变化究竟来自行为、环境,还是评分器?

配对运行、比较分数、检查轨迹、固定记录重评分;下方标示每步所回答的问题。
图1|TRACE的四步诊断协议查看大图 ↗
Radhika Gaonkar,arXiv:2610.11678v1,图1。SVG转PNG并加白底,图文未改写;CC BY-NC-SA 4.0。 · 原始来源与图注 ↗ · CC BY-NC-SA 4.0;原图SVG转PNG、加白底,保留图文内容
  1. 1

    定义只改变一件事的配对探针

    固定任务、策略和seed标签,比较原界面与变更界面;工具重命名保留dispatch、参数和schema,JSON格式变换只改排版与键顺序。更改rubric、奖励激励或信息访问本来就可能合理改变分数,不能一律视作评分错误。

  2. 2

    同时看分差与绝对成功率

    VRG是原分减变更分;MSR为变更条件过线率,MTR只在原来通过的配对上统计,默认阈值0.65。零分差可能是两边都失败。代理奖励与模拟器质量差PTD仅在12个有proxy通道任务上计算,且两者最大值可能来自不同实验调用。

  3. 3

    用固定轨迹定位评分错误

    检查动作、观测和最终状态;若执行相同,保持轨迹不变,只修正怀疑的评分项再重算。careful缺失五个规范工具名导致覆盖项归零,别名映射可修复;overfit改了实际行为,重评分后仍保留0.130分差。

  4. 4

    加入重复对照、正对照和样本外复验

    相同界面重复运行估计自然波动;把真实工具名相互置换、但保留准确描述和schema,作为仍可解却更困难的正对照。按任务聚类、领域分层bootstrap:90%区间完全落在±0.10内才称等价,95%区间排除0才称不同。固定轨迹的裁判也需重复调用。

02

实验与证据

完整正文与附录A–E、图1、公开仓库README及文件树已核对;以下数字为论文报告,未独立重算。

来源证据Study 1有25任务×7条件×3脚本×3相同重复=1,575条记录;careful别名分差0.250→0,shortcut平均分差仅0.006、变更成功率却为0。 §3;表2;附录A–B ↗

我的解读验证了已知缺陷诊断,不是学习曲线;低分差不能单独代表稳健。

来源证据初始30任务中Laguna别名提升0.267,40新任务降为−0.050;原30任务每条件三次重跑后为−0.011。 §4–5;表3/7 ↗

我的解读初步八项未校正比较中的单个显著结果没有复制;不能只保留首轮正结果。

来源证据Study 3主实验5,652/5,688运行完成;主检验使用88个新任务。七/八条件在±0.10内等价;Qwen格式变更−0.059,95%区间[−0.123,0.008]。 表6;附录E ↗

我的解读Qwen该项未决而非无影响;其额外翻转率9.3个百分点区间[2.7,16.1]提示可能存在小效应。缺失非随机,论文另作极端插补敏感性分析。

来源证据相同任务重跑翻转率约14.7%–16.3%,Laguna为35.6%;误导工具名使四代理奖励降低0.196–0.437。 §5;表6 ↗

我的解读基线波动足以混淆单次测试,但正对照说明流程能够探测较大效应。误导控制用全部158任务,不能与88新任务当相同样本直接合并。

来源证据118条固定轨迹×四种视图×三次调用×两裁判,2,831/2,832调用可用;裁判之间约57%分歧。对原生奖励一致率Claude95%、GPT38%。 §5;表8;附录E ↗

我的解读这些是参照一致率,不是裁判准确率;GPT多数分歧来自程序规则,原生奖励偏结局。所有呈现变更的超额分歧区间均包含0。

03

开放情况与使用许可

仓库确有ResearchOps环境、奖励实现、脚本、测试及结果文件;默认分支README仍描述2026年7月的164条GPT-4.1-mini诊断,不能据此确认已提供本版四模型Study 3全部原始记录。未发现仓库许可证;无模型权重发布主张。

LICENSE论文与图1为CC BY-NC-SA 4.0,非商用、署名、相同方式共享;代码仓库未确认许可,不视为可自由再分发的开源软件。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

合成careful脚本保持观测和任务质量相同,仅恢复评分工具名就把0.250分差清零;因果归因比单看均值更明确。

88个从未评估的新任务、三次重复和误导工具名正对照,能区分较小表现变更与显著真实退化。

反方 · 哪些结论还不够

1,575条合成记录中的三种seed标签产生相同脚本轨迹,不能当1,575个独立实验;不确定性应按25个任务聚类。

七个等价结果经八项Bonferroni校正后剩六个,且“在±10个百分点内”等价并不等于完全无影响。

裁判与原生奖励的一致率不代表准确率;程序合规与任务结局是不同标准,关键词归因也不是人工逐例真值。

综合判断

推荐其诊断流程和重复对照设计;不要将其读成“工具改名一定损害模型”或“某裁判更准确”的排行榜结论。

我会先做的验证

建议实验(尚未执行):对本地固定任务集预注册等价范围,至少多次同条件复跑,保留配对轨迹与失败记录;由盲审人工分别标注任务结局和程序合规,再测试评分修正是否只消除测量误差。

继续探索大模型