aiwillknow.AI 前沿观察每日 08:00 开始整理
具身智能全文深读与原图讲解

MaP-WAM:把长时记忆留给规划,把固定计划交给执行

语言与视觉计划结合进度校准,执行器上下文不随历史增长

IN A NUTSHELL

机器人记住按钮颜色或已经按过几次,不一定需要每次动作都重读全部视频。MaP-WAM 保存完成段的稀疏真实画面,先生成下一段语言和视觉计划,再让固定上下文的 WAP 模型预测动作及进度,以视觉对齐修正进度漂移。

01

图解主要方法

图 2 如何连接历史证据、视觉计划、动作块与真实记忆更新?

原论文图 2:记忆规划、WAP执行与计划—观察校准
原论文图 2:记忆规划、WAP执行与计划—观察校准查看大图 ↗
Sizhe Zhao 等,arXiv 2609.11561v1;原图内容未改动。 处理记录:原图内容未改动,白底 PNG 转码 · 原始来源与图注 ↗ · CC BY 4.0
  1. 1

    将完成片段保存为真实证据

    图左上每段记录语言指令和八个均匀采样画面,初始图另存;语言规划器读取初图与各段末帧,CWM视觉规划器读取更丰富的历史稀疏序列。训练使用基准提供的分段标注,不是自动发现任意任务边界。

  2. 2

    生成下一段语言—视觉计划

    微调 Qwen3.5-4B 先给出子目标,Wan2.2 初始化的因果世界模型再给八帧视觉引导。分段因果注意力允许历史缓存,但规划历史仍会增长;固定的是执行阶段的计划输入长度。

  3. 3

    联合预测动作和进度

    图下 WAP 的视频、动作、进度专家联合训练,动作和进度不能读取未来视觉目标。训练预测32步,部署执行前8步;未来视频分支在部署可省略,当前进度作为条件反馈,避免把外观相近的不同阶段混淆。

  4. 4

    以视觉匹配校准并切换计划

    图右上在当前进度附近选两个计划帧,用RGB平均绝对差找较近者,与递归进度取平均。预测完成分数超过0.95时进入下一段;写入历史的是实际执行帧,替换生成计划,避免把想象当成已发生事件。

02

实验与证据

以下为作者报告;已阅读 v1 全文及可用附录,本站未独立执行研究实验。实验条件与编辑解读分别列出。

来源证据【模拟协议】RMBench每任务50示范、100次评估,全局seed0;规划器多任务、WAP单任务。平均83.3%,LingBot-VA77.1%,但Rearrange Blocks为66%对100%。 表 1 与第 4.2 节 ↗

我的解读我的解读:总体提升不代表每类记忆都更好;固定种子和按任务执行器限制跨任务泛化结论。

来源证据【真实与消融】Franka两项任务各50次,Find Button88%、Press Buttons68%。三任务进度消融完整平均96.7%,去校准73.7%;Press Button单项去校准98%反高于96%。 图 3、表 2 ↗

我的解读我的解读:视觉校准主要帮助长序列漂移,不能说所有任务必需;两项真实任务也不足以涵盖复杂环境。

来源证据【延迟口径】单A800、BF16、10去噪步下缓存后执行器约827ms/块;排除模型加载、提示编码、传输、VAE与前缀预填充。 图 5 与附录 H ↗

我的解读我的解读:这不是完整动作回路延迟,也不是整个系统恒定时间。简单RGB匹配对光照和遮挡的敏感性尚需实测。

03

开放情况与使用许可

作者项目和仓库已核实;仓库目前只有 README,训练/推理代码及检查点均标为待发布,不能称为实现开源。

LICENSE论文及图 2 为 CC BY 4.0;尚无可核实的实现或权重许可。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

把历史取证和短期控制分开,减少执行器重复处理长视频,同时用真实观察更新记忆闭环。

反方 · 哪些结论还不够

依赖分段监督,训练用真实计划而部署用生成计划;RGB校准和规划成本尚不能由执行器曲线覆盖。

综合判断

适合明确可分段、记忆负担高的操作研究;实际采用前要测试自动分段、计划偏差及端到端延迟。

我会先做的验证

未执行的验证方案:固定演示数量,在遮挡/灯光变化与段边界扰动下比较语言记忆、完整历史、MaP-WAM;分别计规划、缓存建立、VAE和动作延迟,并按长短任务测漏按/重复操作。

继续探索具身智能