aiwillknow.AI 前沿观察每日 08:00 开始整理
世界模型全文深读与原图讲解

Flow Policies:世界模型规划为什么需要可搜索的技能动作空间

四种技能接口对照揭示:低层策略能做,不等于规划器能找到

IN A NUTSHELL

研究把完整流匹配动作块作为世界模型的一步,对比纯噪声种子、学习离散码、对象中心码和符号标签四种接口。相同任务与技能示范下,纯种子在单技能任务仅8%成功,对象中心接口达92%;但长程性能仍受候选生成和搜索限制。实验只覆盖准静态仿真积木,不能据此推断实机通用操作能力。

01

图解主要方法

为何一个会执行的流策略,仍可能让世界模型规划几乎找不到正确动作?

作者展示技能级世界模型规划与流策略在积木操作中的组合;执行一个完整技能后重新观测。
图1|流策略技能接口与世界模型规划查看大图 ↗
Andreu Matoses Gimenez 等,TU Delft,arXiv:2610.04767v1。原图未改动,仅用于方法评论。 · 原始来源与图注 ↗ · 版权归作者;arXiv非独占托管许可不等于图片再分发许可
  1. 1

    先把完整操作压成世界模型的一步

    MuJoCo Panda场景含6个彩色立方体、两个区域及离散落点,技能包括拿放、堆叠、拆叠和不动。120k脚本示范由7500起始状态各16条技能组成。流匹配策略从高斯噪声生成256×10动作设定值,整块开环执行到静止后再规划。

  2. 2

    比较四种动作接口而非一个通用检查点

    纯种子接口使用4维残差和256码的压缩;学习码用625个FSQ状态转移码;对象中心用1512码表示移动对象、目标对象或桌面、网格及变化因子;符号接口使用动作种类、对象、目标和2维残差。四个策略分别训练,公共架构不代表共享权重。

  3. 3

    用技能转移训练潜空间动力学

    LeWM式JEPA联合训练编码器和预测器,以SIGReg避免坍塌,无预训练编码器或EMA目标。学习码接口可把解码出的后继姿态作为动作描述;对象中心接口用码本。学习先验提出后继动作,可行性过滤器由各自执行数据训练。

  4. 4

    在离散候选与连续残差之间嵌套搜索

    主设置束宽32、最多15技能前瞻;符号分支内CEM每轮64候选、5轮,纯种子128候选、10轮。评分取未来状态中距离目标最近的一步并加小幅迟达惩罚,不只比较最后一步。符号接口额外使用手工前提与效果,应计入系统先验。

  5. 5

    执行后重观测,把搜索问题与感知问题分开

    每任务预算最短技能数k加5;技能结束后更新观测。主实验直接用真实姿态,另设三视角姿态回归器冻结后测试感知扰动。后者相机刻意避免完全遮挡,并不是实机全视觉闭环验证。

02

实验与证据

已读完整正文、实验和消融,核对项目开放状态与图1;未独立复现。公开HTML未附额外附录。

来源证据每个最短长度k=1至14各100任务,共1400个配对任务;预算k+5。 实验设置与主结果 ↗

我的解读成功率应按任务难度查看,不能把有利任务的演示视频当整体长程能力。

来源证据单技能任务纯种子8%、学习码79%、对象中心92%;符号接口在k≤6保持90%以上。 主结果 ↗

我的解读不同接口使同一技能族的搜索难度相差很大,但需要同时考虑符号先验与训练样本差异。

来源证据世界模型转移数量:符号51k、纯种子64k、学习码和对象中心各128k。 世界模型训练设置 ↗

我的解读示范来源相同不等于世界模型训练数据等量,不能宣称严格控制了所有变量。

来源证据学习码到k=6约5%,各系统超过12步普遍接近零;特定14步交换任务族有87%成功。 长程结果与案例 ↗

我的解读87%是有利子族,不是全体14步问题。临时远离目标的必要步骤可能被束搜索剪掉。

来源证据纯种子新采样有效技能57%,压缩后30%;压缩后堆叠/拆叠占3.7%,新种子15%。 动作空间诊断 ↗

我的解读可执行技能覆盖率与压缩分布共同限制搜索;扩大种子采样并不保证在有限预算内找到正确技能。

来源证据执行动作的世界模型排序第一率:符号98%、学习码60%、对象中心59%。 世界模型诊断 ↗

我的解读这是预测排序而非任务成功率;对象中心规划更好,不能仅用该指标解释。

来源证据符号残差固定为零与优化相差不超过5个百分点;删符号可行性及效果先验损失10–47个百分点。 规划消融 ↗

我的解读残差优化不是主要增益来源;两类符号先验一起删除,无法单独识别各自贡献。

来源证据感知平均位置误差3毫米、中位2.3毫米;k=1–6平均符号与学习码各降约1个百分点,对象中心约降6。 感知实验 ↗

我的解读对象中心单技能92%降到80%,显示身份与几何结构接口也会放大感知错误;三视角受控结果不能外推遮挡。

来源证据束宽32增到256未改善;给定最优计划的预测成本显著低于随机计划。 搜索分析 ↗

我的解读支持候选与搜索可能是瓶颈,但只检查已提出最优计划,不能证明动力学模型完全准确。

来源证据低层设定值基线单技能约1%、更长为零;外部LeWM/DINO-WM使用不同OGBench设置。 低层动作基线 ↗

我的解读不能把不同观测与任务的外部结果当作同条件排行榜;低层与技能级搜索预算定义也不同。

03

开放情况与使用许可

官方项目列Code与Datasets Coming Soon,未核实可下载代码、权重或模型卡。项目称投稿ICRA 2027,本文不写成已录用。

LICENSE论文采用arXiv非独占托管许可;图1署名用于方法评论,未确认独立图像、代码或数据再分发许可。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

同任务单技能纯种子8%、学习码79%、对象中心92%的差异,支持结构化技能接口能改善可搜索性。

移除符号可行性与效果先验、关闭残差优化、替换感知输入等消融,揭示接口之外的先验和感知依赖。

反方 · 哪些结论还不够

世界模型转移样本从51k到128k不等,不是严格等数据的架构竞赛。

对象中心预测动作排序不优于普通学习码,却规划更好,说明单一预测指标不足以解释成功。

超过12步普遍接近零;一个14步交换任务87%不能概括全部长程任务。

综合判断

在有限积木任务中,证据支持为流策略设计结构化技能接口;尚未证明可扩展到任意长程任务或真实机器人。

我会先做的验证

建议实验(尚未执行):固定每种接口的世界模型样本量、训练算力与搜索预算,在真实遮挡和新对象下比较候选召回率、执行成功率及延迟;将符号前提与效果先验分开消融,并报告多训练种子区间。

继续探索世界模型