Chronos:让代码代理检索一个改动背后的软件演化历史
PR关系图帮助找到语义搜索漏掉的经验;三角色总收益不等于图检索的独立收益
Chronos把合并PR蒸馏成包含动机、解法和检索信号的经验卡,再以文件连续性、显式引用、作者跟进和组织关系连成图。代码代理先找语义入口,再沿有类型的关系扩展,按需读历史经验;完整工作流让两个代理分别写补丁,再由第三个代理选一个。结果支持关系历史有检索价值,但总体收益同时包含角色提示与更多候选计算。
图解主要方法
代码代理能否通过PR之间的关系,找到单纯语义相似度遗漏的可迁移开发经验?

- 1
离线把PR转成有来源的四字段经验
Qwen3.5-Plus读标题、描述、讨论与diff,生成Summary、12–20个Signals、因果Motivation、带1–3代码模式及3–5注意点的Solution。去除偶然身份信息,用PR ID保留来源;仅Summary嵌入为2048维text-embedding-v4向量。
- 2
把十一类可观察关系连成有向多重图
文件Jaccard至少0.5或新文件续改为代码层;显式引用、回移植和60天内同作者目录重叠为意图层;共同审阅者、标签、里程碑等为组织层。边权分别约1–1.5、0.7–1.05、0.3–0.45,手设先验而非训练出的因果可信度。
- 3
语义入口和关系扩展各保留一半短名单
默认K5先取50向量邻居并按仓库、时间、可选路径过滤;再从最多5入口广搜3跳、每层至多200状态。分数为入口非负余弦×exp(−跳数/3)×(1+路径边权和),多路径取最大、不重复绕环。返回最多5语义卡+5扩展卡,代理再按需graph_read。
- 4
两种思路各写补丁,独立审查只做选择
change角色按不变量与设计意图查历史,validation角色按行为差与回归风险查;两者均写非测试代码补丁。相同/单个非空候选直接路由,两个不同非空才随机X/Y交审查者;后者查历史和当前源码、禁止改代码,必须二选一,无有效选择时固定seed随机回退。
实验与证据
22页论文全文和单独7页提示词附录已读,图2已检查;未独立运行代码基准。
来源证据500题Verified六骨干平均69.2→72.9%;MiniMax76.4→79.8;731题Pro48.3→51.7,200题FEA41.0→43.5。 表3–5 ↗
我的解读这些是完整工作流的每任务一份最终补丁评分,不等于只生成一次;跨基准规则不调,但历史库按目标仓库取。
来源证据每代理250步、1.5美元、200k上下文;完整流程两生成及按需选择。 3.1;5.3 ↗
我的解读不是总任务1.5美元;蒸馏、向量索引、图构建、检索和阅读成本还应分别计,不应把额外计算隐去。
来源证据完整配置五次79.8/80.0/80.6/79.6/80.0%,样本标准差0.37个百分点。 4.2 ↗
我的解读均值区间仅针对该配置,基线及其他消融单次;多次结果没有跨运行合并候选。
来源证据图/平面完整流程79.8/79.0;去一个生成角色为78.4或77.8;mini-SWE-Agent75.8→79.2。 表6 ↗
我的解读图增益与多角色收益分开;单角色相对基线仍同时改提示和检索,无法纯归因于记忆。
来源证据两名内部专家独立标100任务各10卡,讨论裁决前κ0.86;有用卡比例12.4→28.7%。 表7;图3 ↗
我的解读是可行动经验的主观判断,非事实精度或直接修复成功率。移除precedes少0.60、extends少0.44有用卡,边贡献不可相加。
来源证据入口与扩展均排除创建或合并时间不早于当前任务PR创建时刻的记录。 算法1;2.2.1 ↗
我的解读这一过滤有助于阻止取到未来修复,但论文未独立审计评论/标签后续更新时刻;有限50候选过滤后也可能不足5入口。
开放情况与使用许可
arXiv公开正文和独立appendix.pdf,附录有蒸馏、生成与选择完整提示词;论文/摘要页未给可核实的官方实现、经验卡库或图快照发布链接,不能据此称开源。
LICENSE论文和引用图2标注CC BY 4.0;历史PR原代码、依赖与模型服务的许可独立,未确认另有软件发布许可证。
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
固定每任务十卡的100任务人工评估中,平均有用卡1.24→2.87,至少一张有用卡的任务68%→89%,支持关系扩展改善候选历史。
同MiniMax完整工作流有图79.8%、平面语义79.0%,单生成角色78.4/77.8也高于基础SWE-Agent76.4。
反方 · 哪些结论还不够
完整3.4个百分点增益同时含提示、双候选和选择;关系图独立差0.8个百分点仅500任务中的4题,未给配对显著性或重复基线。
五次完整配置均值80.0%、95%区间79.5–80.5刻画自身均值,不是相对基线增益的置信区间。
蒸馏会丢失或引入信息,内部有用性标注未验证原PR事实正确;权重手设且未做数值敏感性分析。
综合判断
PR关系是有用的历史发现信号;现有结果更支持整体工作流改善代码修复,而不是证明大部分收益由图结构造成,也未证明同总成本最优。
我会先做的验证
建议实验(尚未执行):相同整任务token/成本下比较双采样无记忆、双采样平面检索与图检索;重复基线做配对置信区间,盲评卡片溯源准确度,并截断评论、引用和元数据的实际生成时刻检查时间泄漏。