RESETTLE:策略连续犹豫时,用同任务示范纠正一个动作
分歧监测、视觉检索与受限残差;短纠正不等于无碰撞保障
RESETTLE冻结原机器人策略,用同条件两个随机动作提议的持续分歧触发干预;V-JEPA2检索同任务成功示范,将机器人状态差形成伺服先验,再叠加受方向和幅度约束的视觉残差。每次只执行一个控制tick后交回原策略。LIBERO-Plus三策略平均成绩分别提升8.7、3.7、4.4个百分点,但一致地做错事可能完全不触发,局部纠正也无法保证解开物体卡住的状态。
图解主要方法
机器人怎样知道该短暂纠正,又如何在不重训原策略的情况下恢复到可继续执行的状态?

- 1
用训练分布校准连续分歧
相同观测和任务条件独立采两个动作块,按执行前缀时间加权距离。Cartesian仅比较平移、不含旋转与夹爪;GR1比较29维归一化RMS。每策略训练数据P95为阈值,连续两次超阈触发,介入后清零。
- 2
在同任务示范中检索视觉参考
适配后的V-JEPA编码当前图,单图复制两帧满足tubelet,归一化1408维特征与同语义任务示范余弦检索。参考同时给图像和机器人状态;最近图像不保证相同物体布局或可达路径。
- 3
构造伺服先验并预测视觉残差
当前到参考的位姿/关节差经形态适配器转成有界原生动作。残差头看当前、参考差、交互特征、本体、上一步动作及先验,推理用高斯均值。它修改参考伺服动作,不是原策略提议。
- 4
守卫残差,只执行一个tick
按平移/旋转组检查方向余弦及残差/先验范数,近零先验加非零残差拒绝。LIBERO余弦门槛0.5/0、幅度比≤0.5;拒绝就用伺服先验,通过再裁剪。丢弃缓存动作,执行一个tick后重观测交回基策略。
- 5
离线联合训练,在线停用动力学预测器
8帧片段以未来帧作参考,监督残差、原生动作Huber、门控/饱和惩罚和单步JEPA潜预测。EMA目标不反传;预测器不递归滚动且仅训练用,部署只保留编码器与残差头。
实验与证据
完整正文与附录A–F已读,涵盖全部控制公式、参数量、预算、逐任务结果、监测盲点和真实实验;图2原图核验,GitHub/API实查空仓库;未复现实机。
来源证据LIBERO-Plus10030案例、每例1次seed7:FastWAM49.3→58.0、π0.5 70.0→73.7、QwenPI80.2→84.6。 表1;C.5 ↗
我的解读平均按各扰动案例数加权;光照下π0.5和QwenPI各降0.2个百分点,不是所有维度皆增。
来源证据Meta-World每任务10回合、50任务,表2QwenPI60.66→65.99、SmolVLA59.20→65.48。 表2、13–14 ↗
我的解读该平均是4个难度组等权,不是500回合总体成功率;SmolVLA push100→30、reach-wall60→10等退化不能被总均值掩盖。
来源证据RoboCasa24任务各50次:QwenGR00T53.67→60.50,LDA50.33→52.42;Swap100次Harness42→50。 表3–4;C.5;F ↗
我的解读同任务等额测试可池化;高层GPT规划仍有增益,但该高层只调工具,不直接生成关节动作。
来源证据真实FR3双RGB视角,每任务50示范;4配置×4任务×20次=320次。QwenPI平均66.67→78.75,VLAct86.25→92.92。 表5;E.1–E.6 ↗
我的解读三个任务二值SR,Use Spoon三阶段每段1/3,后者50%或86.7%是完成阶段占比,不是完整舀豆任务成功率。
来源证据83.6ms恢复=编码50.8+检索32.0+伺服0.2+残差0.6;QwenPI原推理约109ms另计。 表6;D.2 ↗
我的解读约零额外监测耗时来自条件缓存复用和测量精度,不是零计算;还需连续两次决策才能触发。
来源证据相对VoLoAgent计算耗时降74.04–93.57%,后者生成place/grasp轨迹。 D.2 ↗
我的解读这是一次监测加准备恢复输出的比较,不是完整机器人任务加速或同长度动作输出对照。
来源证据LIBERO恢复模块部署1.019B参数,训练优化1.324B、含EMA实例化2.336B;8H800,LIBERO20k、GR1 150k更新。 表7–8;B.1;C.6 ↗
我的解读冻结原策略不等于无训练;5条轨迹只支持阈值校准,不能缩减恢复学习和参考库的数据需求。
来源证据QwenPI实际49528/1855166动作为恢复,占2.67%;27.31%轨迹介入,机器人初始扰动贡献79.24%恢复动作。 表11 ↗
我的解读稀疏动作占比不能直接换算墙钟开销;依然有12.59%的Robot类动作来自恢复。
来源证据P85总83.1、P95 84.6、P99 83.6;Noise下P85 79.5低于基线86.2。 表12 ↗
我的解读更频繁纠正未必好,噪声和初始位姿扰动存在相反阈值趋势;P95不是每类最优。
来源证据未触发失败包括目标选错、抽屉卡住;已触发失败包括多物体误抓、预算耗尽和语义不匹配。 A;D.3 ↗
我的解读守卫只约束相对先验的方向/幅度,不是碰撞证明;成功帧也无法单独隔离检索、先验和残差贡献。
开放情况与使用许可
已打开作者GitHub并核对API:size=0、license=null,contents返回404,网页明确empty;尚无可用代码、权重、模型卡或代码许可,不标已开源。
LICENSE论文为arXiv非独占托管许可,图2用于必要方法评论且保留原图和来源;空仓库未声明许可。
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
冻结同一策略的配对测试覆盖6类基策略、多个仿真及两种真实策略,支持动作接口层的兼容性。
伺服先验已有收益,视觉残差在LIBERO-Plus再增0.8–2.1个百分点,说明不是仅更换策略权重造成效果。
反方 · 哪些结论还不够
QwenPI失败轨迹触发率77.89–100%,但SmolVLA只有23.64%;分歧不能统一代表失败概率。
真实20次每任务,平均混合三项二值成功与一项阶段分,不能当成全任务成功率。
低延迟对照输出规模不同:本法一个动作,VoLoAgent一条轨迹;未计原策略推理、轮询与真实执行。
综合判断
这是一种有配对实验支持的局部恢复层,适合补充现有策略;它依赖训练和同任务记忆,也需要语义进展或接触信号处理稳定但错误的行为。
我会先做的验证
建议实验(尚未执行):在同任务预算下报告完整机器人墙钟时间、碰撞与恢复成功率;补充确定性策略和无同任务示范条件,按任务测退化;将分歧与目标身份、接触、进展检测组合,比较误干预及漏检成本。