CounterMem:把经过检验的反事实修正变成可复用记忆
记住为什么改、何时适用,并允许选择器跳过记忆
失败后,CounterMem在同一状态的副本中检验局部替代动作,保存原动作、修正、检验证据和适用条件。之后由小型DQN决定用一条记忆还是跳过,基础LLM不更新。这里的世界模型是测试、证明检查器或求解器;经源任务验证的经验依然可能害了新任务。
图解主要方法
图1为什么把同状态检验、适用条件和跳过记忆放在不同阶段?

- 1
从失败决策生成有限局部替代
图1左侧Local edits只修改一个决策单元,使用同一LLM提出最多4个候选,每任务最多扩展两次失败。World model在这里是Lean、仓库测试、SQL结果检查或求解器,不是神经视频预测器。源状态可复制或重置,才可比较修改前后。
- 2
检验增益,再保存带条件的对照
Verify在同一状态执行原动作和候选,效用增益需超过0.05并通过去重/冲突等准入规则。记录含情境、前后动作、结果证据、适用条件和历史复用效用,最多200条。图下SQL示例通过表间关系更正过滤谓词;仅返回一行本身不能证明任意查询正确,仍需参考结果检查。
- 3
检索相容经验,并允许不用
右上Retrieve先排除同任务来源及条件不符记录,以512维字符n-gram哈希相似度加复用效用排序,最多取3条。DQN从一条记录或skip中选,LLM再修改原草稿;3条候选并不是合并3条建议。源码未开放,本段具体配置来自附录而非本站执行。
- 4
分开构建、训练和冻结评估
构建阶段更新记录和效用,随后冻结记忆,训练98维输入、两层64单元的DQN共2000个决策步,奖励完成任务并扣调用、失败及token成本。测试时记忆、复用统计、选择器均冻结,基础LLM始终固定;图中Learn只在训练阶段,不能宣传为测试期间持续自我学习。
实验与证据
已阅读v1完整正文及附录A–E、12基准细分和成本口径,核对图1。以下为作者实验,本站未复现;缺失运行清单和检查器轨迹限制独立验证。
来源证据【主比较】gpt-oss-120b的ReAct/Reflexion在6域12设置共24个对照平均提高12.5625个百分点;四域表按域等权,ReAct提高18.5、Reflexion8.175。跨两主干任务运行token减少7.7%–42.0%。 表1、表6与第4.4节 ↗
我的解读我的解读:基准平均与领域平均不同,不能互换。token不包括离线选择器训练,不能由此宣称总训练费、总时长降低同样比例。
来源证据【验证和存储消融】gpt-oss-120b ReAct/Reflexion:无检验建议仅增5.2/2.1个百分点,只做当前任务检查而不存记忆增7.1/3.4,完整流程增18.5/8.2。 图4、附录D.5 ↗
我的解读我的解读:联合机制有价值,但此对照没有固定规则选择器,无法隔离DQN训练的独立收益。Best-of-5由LLM选候选而不是检验器择优,也不是同一种搜索控制。
来源证据【错误迁移】每种迁移条件60对任务;表面相似但条件变更时,完整方法伤害率11.8%,移除条件后34.2%。移除同时影响检索过滤和呈现文字,不是只删除一句提示。 图3、附录D.4/E.3 ↗
我的解读我的解读:伤害率按被选记录使用次数计,覆盖率按检索机会计;它们不能与120对任务的破坏率互换。源任务成立的修正依旧可能不适用。
来源证据【公开证据缺口】6M-token对照未说明agent–LLM组合及构建/求解分配;完整基线提示、运行manifest等未提供。每个已解任务调用次数下降也可能来自分母变大。 附录D.5/D.6/E.2 ↗
我的解读我的解读:均等task-run token不是总成本公平,调用/已解数量不是总调用。当前可核对论文算术,尚不足以独立复现整套比较。
开放情况与使用许可
摘要明确代码将在接收后发布;本次论文页面未提供可核实实现仓库。附录说明完整重跑还需要任务manifest、runner、环境、检验轨迹和选择器权重,不把数值汇总及绘图材料当作完整开源。
LICENSE未确认实现或权重许可。论文为arXiv非独占托管许可;图1仅用于必要方法评论,版权归作者,图中第三方标识不代表背书。
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
验证、持久存储和条件匹配分别有干预,说明不只是增加尝试次数;跳过记忆能避免将相似错误机械套用。
反方 · 哪些结论还不够
主结果比较整套流程,无法单独证明DQN优于固定规则;成本、覆盖率、伤害率使用不同分母,错误合并会夸大收益。
综合判断
适用范围明确的经验复用框架,值得在可重置计算任务中复核;其world model称呼不意味着学到了通用环境动力学。
我会先做的验证
未执行的验证方案:固定任务划分与总预算,比较随机、相似度、固定阈值和DQN选择;加入表面相似但条件相反的任务,报告按任务与按使用次数分别计算的伤害率,连同记忆构建及离线训练成本。