CMA:记忆改变了动作,是否也把机器人带向正确目标?
固定当前观测,用两段合法过去做反事实审计
CMA 构造当前看起来完全相同、但过去线索要求不同动作的成对任务。它先冻结机器人产生的动作,再交叉放入两种评估世界打分,从而把记忆敏感性、目标方向与真实任务收益分开,避免把“动得不一样”当成“记对了”。
图解主要方法
图 2 的两段过去、同一个现在和四格打分分别控制什么?

- 1
让两段合法历史汇合到相同当前输入
历史 H0/H1 通过原有更新机制产生两份记忆 M0/M1;当前 RGB、机器人状态等所有非记忆输入保持精确一致。只交换记忆,不把不可能的历史拼给模型;这隔离历史条件,但并不消除历史中其他有效线索。
- 2
共用随机种子,先保存动作
冻结策略在两份记忆下分别输出 A0/A1。同一配对使用相同随机种子,减少随机采样造成的差异;必须在看评估世界前固定动作,避免评分目标泄露给策略。
- 3
把两个动作交叉放入两个评估世界
图右侧 W0/W1 仅供评分,构成两动作乘两世界的四格表。先量动作敏感性 S,再看动作是否朝历史要求的分支 F,最后衡量匹配记忆相对错配记忆带来的物理价值 U。动作变了却走错分支,不能算记忆有效。
- 4
以历史对为统计单位,再定位丢失位置
在同一历史对内聚合各随机种子与两个方向,再做成对聚类推断,不能把共享历史的多次运行当独立样本。另用记忆银行清除、最近窗口恢复及旧锚点恢复,检查信息在哪个阶段仍能影响行为。
实验与证据
以下为作者报告;已阅读 v1 全文及可用附录,本站未独立执行研究实验。实验条件与编辑解读分别列出。
来源证据【PB 主队列】64 对历史、每对三种子;动作都有变化,方向匹配 72.9%,但仅 20/64 对在所有种子和两个方向上完全可靠。 主表与审计协议 ↗
我的解读我的解读:平均方向准确率掩盖成对最坏情况。不能把 384 次评分看成 384 个独立历史任务。
来源证据【LaterSwap】24 对、每对两种子,动作虽改变却没有正确分支切换,方向概率为 0.5,增量价值 U=-0.019。 延迟交换分析 ↗
我的解读我的解读:这直接反驳“记忆造成行为变化就有帮助”;变化可以只是同一错误策略内的动作扰动。
来源证据【锚点恢复】36 个案例中,清除记忆银行后成功 6/36,恢复 4096 字节旧锚点后 20/36,原生记忆为 26/36。 记忆银行干预 ↗
我的解读我的解读:最近窗口在干预前已重新填入,实验隔离的是旧锚点贡献,不是通用记忆故障修复保证。
来源证据【PiPER 真机补充】每任务八对、32 次执行;PB 成功 4/32,完成的九次中五次选错目标。 真机附录 ↗
我的解读我的解读:机器人经过本体适配;小样本、种子扰动和执行噪声意味着不能当作零样本普适结论。
开放情况与使用许可
已阅读全文与可用附录,未核实到本研究独立代码或数据制品;论文中的其他策略来源不是 CMA 自身的开源发布。
LICENSE论文采用 arXiv 非独占分发许可;代码与数据许可未确认。
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
把“读取记忆”“选对历史目标”和“完成物理任务”拆开,可发现常规成功率或动作距离指标隐藏的失效。
反方 · 哪些结论还不够
配对世界需要精心构造,审计覆盖取决于历史干预的合法性;有限任务不能穷尽开放环境的记忆机制。
综合判断
适合作为历史条件策略的诊断层,先证明历史在正确方向上有价值,再讨论记忆容量和长度。
我会先做的验证
未执行的验证方案:为三种实际机器人任务构造相同当前画面、不同合法历史的配对;固定采样种子与动作后交叉评分,并以历史对 bootstrap,分别报告敏感性、方向、物理收益与全种子可靠率。