aiwillknow.AI 前沿观察每日 08:00 开始整理
大模型全文深读与原图讲解

Chronos:让代码代理检索一个改动背后的软件演化历史

PR关系图帮助找到语义搜索漏掉的经验;三角色总收益不等于图检索的独立收益

IN A NUTSHELL

Chronos把合并PR蒸馏成包含动机、解法和检索信号的经验卡,再以文件连续性、显式引用、作者跟进和组织关系连成图。代码代理先找语义入口,再沿有类型的关系扩展,按需读历史经验;完整工作流让两个代理分别写补丁,再由第三个代理选一个。结果支持关系历史有检索价值,但总体收益同时包含角色提示与更多候选计算。

01

图解主要方法

代码代理能否通过PR之间的关系,找到单纯语义相似度遗漏的可迁移开发经验?

左侧蒸馏历史PR并分三层连接,中间搜索再阅读经验,右侧两种生成策略与独立选择者共享历史。
图2|经验卡、软件演化图与双候选补丁选择查看大图 ↗
浙江大学、上海交通大学、Hithink Research、国家工业信息安全发展研究中心,arXiv:2610.11578v1。原图未改动,仅用于方法评论。 · 原始来源与图注 ↗ · CC BY 4.0
  1. 1

    离线把PR转成有来源的四字段经验

    Qwen3.5-Plus读标题、描述、讨论与diff,生成Summary、12–20个Signals、因果Motivation、带1–3代码模式及3–5注意点的Solution。去除偶然身份信息,用PR ID保留来源;仅Summary嵌入为2048维text-embedding-v4向量。

  2. 2

    把十一类可观察关系连成有向多重图

    文件Jaccard至少0.5或新文件续改为代码层;显式引用、回移植和60天内同作者目录重叠为意图层;共同审阅者、标签、里程碑等为组织层。边权分别约1–1.5、0.7–1.05、0.3–0.45,手设先验而非训练出的因果可信度。

  3. 3

    语义入口和关系扩展各保留一半短名单

    默认K5先取50向量邻居并按仓库、时间、可选路径过滤;再从最多5入口广搜3跳、每层至多200状态。分数为入口非负余弦×exp(−跳数/3)×(1+路径边权和),多路径取最大、不重复绕环。返回最多5语义卡+5扩展卡,代理再按需graph_read。

  4. 4

    两种思路各写补丁,独立审查只做选择

    change角色按不变量与设计意图查历史,validation角色按行为差与回归风险查;两者均写非测试代码补丁。相同/单个非空候选直接路由,两个不同非空才随机X/Y交审查者;后者查历史和当前源码、禁止改代码,必须二选一,无有效选择时固定seed随机回退。

02

实验与证据

22页论文全文和单独7页提示词附录已读,图2已检查;未独立运行代码基准。

来源证据500题Verified六骨干平均69.2→72.9%;MiniMax76.4→79.8;731题Pro48.3→51.7,200题FEA41.0→43.5。 表3–5 ↗

我的解读这些是完整工作流的每任务一份最终补丁评分,不等于只生成一次;跨基准规则不调,但历史库按目标仓库取。

来源证据每代理250步、1.5美元、200k上下文;完整流程两生成及按需选择。 3.1;5.3 ↗

我的解读不是总任务1.5美元;蒸馏、向量索引、图构建、检索和阅读成本还应分别计,不应把额外计算隐去。

来源证据完整配置五次79.8/80.0/80.6/79.6/80.0%,样本标准差0.37个百分点。 4.2 ↗

我的解读均值区间仅针对该配置,基线及其他消融单次;多次结果没有跨运行合并候选。

来源证据图/平面完整流程79.8/79.0;去一个生成角色为78.4或77.8;mini-SWE-Agent75.8→79.2。 表6 ↗

我的解读图增益与多角色收益分开;单角色相对基线仍同时改提示和检索,无法纯归因于记忆。

来源证据两名内部专家独立标100任务各10卡,讨论裁决前κ0.86;有用卡比例12.4→28.7%。 表7;图3 ↗

我的解读是可行动经验的主观判断,非事实精度或直接修复成功率。移除precedes少0.60、extends少0.44有用卡,边贡献不可相加。

来源证据入口与扩展均排除创建或合并时间不早于当前任务PR创建时刻的记录。 算法1;2.2.1 ↗

我的解读这一过滤有助于阻止取到未来修复,但论文未独立审计评论/标签后续更新时刻;有限50候选过滤后也可能不足5入口。

03

开放情况与使用许可

arXiv公开正文和独立appendix.pdf,附录有蒸馏、生成与选择完整提示词;论文/摘要页未给可核实的官方实现、经验卡库或图快照发布链接,不能据此称开源。

LICENSE论文和引用图2标注CC BY 4.0;历史PR原代码、依赖与模型服务的许可独立,未确认另有软件发布许可证。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

固定每任务十卡的100任务人工评估中,平均有用卡1.24→2.87,至少一张有用卡的任务68%→89%,支持关系扩展改善候选历史。

同MiniMax完整工作流有图79.8%、平面语义79.0%,单生成角色78.4/77.8也高于基础SWE-Agent76.4。

反方 · 哪些结论还不够

完整3.4个百分点增益同时含提示、双候选和选择;关系图独立差0.8个百分点仅500任务中的4题,未给配对显著性或重复基线。

五次完整配置均值80.0%、95%区间79.5–80.5刻画自身均值,不是相对基线增益的置信区间。

蒸馏会丢失或引入信息,内部有用性标注未验证原PR事实正确;权重手设且未做数值敏感性分析。

综合判断

PR关系是有用的历史发现信号;现有结果更支持整体工作流改善代码修复,而不是证明大部分收益由图结构造成,也未证明同总成本最优。

我会先做的验证

建议实验(尚未执行):相同整任务token/成本下比较双采样无记忆、双采样平面检索与图检索;重复基线做配对置信区间,盲评卡片溯源准确度,并截断评论、引用和元数据的实际生成时刻检查时间泄漏。

继续探索大模型