谁验证评分器:智能体分数上升,裁判也可能已经失效
Double Ratchet把评分器写成可检查的小规则组合,并用独立参考检验它
这项工作让评分器本身进化:从失败聚类生成小型缺陷检测器,再用十个带参考样例和无标签一致性选择逻辑组合。最重要的结果并非任务涨分,而是去掉锚点保护后评分器几乎全部放行,智能体仍能进步。评分器有效性必须独立测量,不能用它所训练系统的分数代替。
图解主要方法
一个自我改进系统表现更好,能否证明它自己的评分器值得信任?

- 1
把评分拆成单一缺陷检测器
每个检测器返回缺陷、未发现或弃权,包含静态解析、执行和窄模型查询;固定根检查结构,表达式用或、且、投票等组合,弃权不当作赞成票。
- 2
从漏检和分歧生成新规则
十个dev参考项上的漏检和无标签train上的分歧先聚类;新检测器至少命中半个簇且不误伤已知好例才入库。仅无标签支持的规则先旁观记录,提升锚点一致率后才可参与选择。
- 3
按锚点选择而非按智能体高分选择
目标是dev加权一致率乘train可靠性加权共识,再减复杂度;漏缺陷权重为误报两倍。拒绝全通过、全失败、全弃权及没有有效dev意见的候选,防止空洞评分获胜。
- 4
交替进化评分器和技能
评分器阶段15/8/5/2轮,穿插四段25轮技能学习,失败类别进入技能修复材料。技能端用固定测试参考回滚,评分器不能读取该集合;因此只对评分器是锁定测试。
- 5
让外部审查也知道任务要求
报告任务另外交换左右位置作两次比较,只把两次一致算明确胜负。发现标签替代数字后同时加值缺失检查和失败提示;外部裁判还需知道引用标签是合法必需格式。
实验与证据
全文68140字符及附录A–G完整阅读,图1SVG转PNG后视觉核验;核对统计检验、数据划分、修复耦合与代码公开情况。
来源证据MBPP+划分60/10/40,Spider59/10/40,报告73/10/48;dev十项五正五负。 4;附录A、B ↗
我的解读代码与SQL先按五次冻结求解器表现筛掉全会题,是困难子集;单次无工具求解,不能与完整智能体榜单比较。
来源证据循环内角色均Claude Opus4.7,报告外部裁判Opus4.8;三种子均值与样本标准差。 4;G ↗
我的解读同模型家族、少量种子的机制实验,不能外推所有开放模型与实际企业任务;本文未调用API复现。
来源证据MBPP+初始一致率0.417±0.058,进化峰值0.625±0.050,裸模型裁判0.55±0.04。 5.1 ↗
我的解读峰值从锁定集上选最大值有乐观偏差;按40个任务聚类符号翻转,峰值p=0.12、末十轮p=0.21,均未到0.05。
来源证据无锚点保护的报告评分器通过97%–100%训练尝试;下游峰值0.841,正规co为0.812。 表1、3 ↗
我的解读“任务涨分”无法排除裁判全部放行。无监督练习和失败材料也可能改进技能,不能把收益都归给准确评分。
来源证据co保留参考循环峰值提升的106%、110%、88%;MBPP峰值0.717,末十轮0.652;Spider峰值0.458,末十轮0.323。 表1、5 ↗
我的解读保留率使用各自初始分数,Spider绝对峰值仍低于参考0.483;峰值保留不是最终持续收益或统计优越。
来源证据技能回滚在2900轮触发23次,使用评分器不能读的测试参考。 3 ↗
我的解读虽然双方同规则可比较相对收益,绝对技能分数仍有测试适应风险,需要真正未触碰第三集合。
来源证据报告以标签替数的比例约30%→1%,同时加检测器和重写失败提示。 5.4;表2 ↗
我的解读修复的是一对措施,未分离单检测器效果;外部任务知情裁判胜率0.515→0.770为已决定对的条件比例。
来源证据知情裁判明确决定271/526与435/565对;通用裁判修复前后只0.122→0.126。 D;表2 ↗
我的解读平局及位置不一致被排除,77%不是所有输出胜率;知情裁判事后根据旧判词制定,属于审计诊断。
来源证据Spider补充带类型schema后求解基线0.211→0.329,裁判一致率从编译错误较多时0.85降到约0.50。 5.5 ↗
我的解读容易机械检查的错误减少后,剩余执行正常但语义错误更难检出;方法的适用边界是缺陷可检测性。
来源证据四/六/八锚点敏感性仅对原十项分层抽样200次,重评分既有候选。 F ↗
我的解读这是离线选择敏感性,未重新生成规则,不能证明四例即可从零训练出同样裁判。
开放情况与使用许可
公开论文给出最终表达式、参数和实验记录格式,但未核实官方可下载实现、52600条判分数据库或完整提示配置。说明内部写有JSON/SQLite不等于这些数据已公开。
LICENSE论文与图1为CC BY-NC-SA 4.0;保留署名、非商业及相同方式共享条款。原SVG转为PNG,内容未修改;代码/实验档案许可未核实。
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
明确把评分器一致率与智能体任务分数分成两条证据链,失效裁判仍训练出有用技能的消融非常有启发。
报告按任务聚类后的不显著结果、峰值选择偏差及技能回滚接触测试集,边界较诚实。
数值被引用标签替代的奖励投机能定位为具体检测项,而不是只能调一个不透明总分。
反方 · 哪些结论还不够
十例锚点每轮反复用于选择,并不是模型完全不接触监督;同家族教师即使看参考也可能共享偏差。
去锚点消融还关闭技能回滚,不能把下游变化全归因锚点;无生命周期组仍稳定,说明该部分主要是效率而非必要有效性条件。
事后任务知情裁判由读过旧裁判理由后制定,修复也同时改检测器与失败提示,不能视作预注册独立确认或单检测器因果效应。
综合判断
最可靠结论是不能以任务分数验证自进化裁判。可读规则组合具有诊断价值,但小样本一致率收益和88–110%峰值收益保留不证明通用替代真值能力。
我会先做的验证
建议实验(尚未执行):另设从不用于回滚的第三测试集,预注册最终轮与裁判任务约定;跨模型家族、扩大任务样本,分别消融锚点、回滚、检测器修复和提示修复,并报告全体含平局的偏好结果及API成本。