TRACE:分数变了,先查代理行为还是评分器变了
配对实验、轨迹检查、反事实重评分与重复运行对照
TRACE用四步诊断把评测分差拆成系统行为变化与评分规则变化。在人工构造的25任务环境里,工具别名让行为完全相同的脚本损失0.25分,评分时恢复名字即可消除;在真实LLM交互中,初步发现的增益未能复现。更大规模重复实验说明,稳定的裁判也可能在衡量不同的“成功”。
图解主要方法
一次Agent分数变化究竟来自行为、环境,还是评分器?

- 1
定义只改变一件事的配对探针
固定任务、策略和seed标签,比较原界面与变更界面;工具重命名保留dispatch、参数和schema,JSON格式变换只改排版与键顺序。更改rubric、奖励激励或信息访问本来就可能合理改变分数,不能一律视作评分错误。
- 2
同时看分差与绝对成功率
VRG是原分减变更分;MSR为变更条件过线率,MTR只在原来通过的配对上统计,默认阈值0.65。零分差可能是两边都失败。代理奖励与模拟器质量差PTD仅在12个有proxy通道任务上计算,且两者最大值可能来自不同实验调用。
- 3
用固定轨迹定位评分错误
检查动作、观测和最终状态;若执行相同,保持轨迹不变,只修正怀疑的评分项再重算。careful缺失五个规范工具名导致覆盖项归零,别名映射可修复;overfit改了实际行为,重评分后仍保留0.130分差。
- 4
加入重复对照、正对照和样本外复验
相同界面重复运行估计自然波动;把真实工具名相互置换、但保留准确描述和schema,作为仍可解却更困难的正对照。按任务聚类、领域分层bootstrap:90%区间完全落在±0.10内才称等价,95%区间排除0才称不同。固定轨迹的裁判也需重复调用。
实验与证据
完整正文与附录A–E、图1、公开仓库README及文件树已核对;以下数字为论文报告,未独立重算。
来源证据Study 1有25任务×7条件×3脚本×3相同重复=1,575条记录;careful别名分差0.250→0,shortcut平均分差仅0.006、变更成功率却为0。 §3;表2;附录A–B ↗
我的解读验证了已知缺陷诊断,不是学习曲线;低分差不能单独代表稳健。
来源证据初始30任务中Laguna别名提升0.267,40新任务降为−0.050;原30任务每条件三次重跑后为−0.011。 §4–5;表3/7 ↗
我的解读初步八项未校正比较中的单个显著结果没有复制;不能只保留首轮正结果。
来源证据Study 3主实验5,652/5,688运行完成;主检验使用88个新任务。七/八条件在±0.10内等价;Qwen格式变更−0.059,95%区间[−0.123,0.008]。 表6;附录E ↗
我的解读Qwen该项未决而非无影响;其额外翻转率9.3个百分点区间[2.7,16.1]提示可能存在小效应。缺失非随机,论文另作极端插补敏感性分析。
来源证据相同任务重跑翻转率约14.7%–16.3%,Laguna为35.6%;误导工具名使四代理奖励降低0.196–0.437。 §5;表6 ↗
我的解读基线波动足以混淆单次测试,但正对照说明流程能够探测较大效应。误导控制用全部158任务,不能与88新任务当相同样本直接合并。
来源证据118条固定轨迹×四种视图×三次调用×两裁判,2,831/2,832调用可用;裁判之间约57%分歧。对原生奖励一致率Claude95%、GPT38%。 §5;表8;附录E ↗
我的解读这些是参照一致率,不是裁判准确率;GPT多数分歧来自程序规则,原生奖励偏结局。所有呈现变更的超额分歧区间均包含0。
开放情况与使用许可
仓库确有ResearchOps环境、奖励实现、脚本、测试及结果文件;默认分支README仍描述2026年7月的164条GPT-4.1-mini诊断,不能据此确认已提供本版四模型Study 3全部原始记录。未发现仓库许可证;无模型权重发布主张。
LICENSE论文与图1为CC BY-NC-SA 4.0,非商用、署名、相同方式共享;代码仓库未确认许可,不视为可自由再分发的开源软件。
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
合成careful脚本保持观测和任务质量相同,仅恢复评分工具名就把0.250分差清零;因果归因比单看均值更明确。
88个从未评估的新任务、三次重复和误导工具名正对照,能区分较小表现变更与显著真实退化。
反方 · 哪些结论还不够
1,575条合成记录中的三种seed标签产生相同脚本轨迹,不能当1,575个独立实验;不确定性应按25个任务聚类。
七个等价结果经八项Bonferroni校正后剩六个,且“在±10个百分点内”等价并不等于完全无影响。
裁判与原生奖励的一致率不代表准确率;程序合规与任务结局是不同标准,关键词归因也不是人工逐例真值。
综合判断
推荐其诊断流程和重复对照设计;不要将其读成“工具改名一定损害模型”或“某裁判更准确”的排行榜结论。
我会先做的验证
建议实验(尚未执行):对本地固定任务集预注册等价范围,至少多次同条件复跑,保留配对轨迹与失败记录;由盲审人工分别标注任务结局和程序合规,再测试评分修正是否只消除测量误差。