aiwillknow.AI 前沿观察每日 08:00 开始整理
具身智能全文深读与原图讲解

REACT:让同一动作块经历多次新观察,而不是反复重画短计划

滚动去噪加异步调度;主配置3Hz视觉更新、30Hz动作输出

IN A NUTSHELL

REACT维护一个50动作的持续缓冲区,分成五个10动作块,越接近执行噪声越少。每轮用最新可用观测对整个缓冲区去噪一步,执行前块、左移后块并补入新噪声。动作因而在执行前被多次观察修正,同时保留长时上下文。异步视觉编码恢复连续动作输出,但也引入旧条件:普通任务中同步版本略胜,倒米和反应任务才更体现完整调度的价值。

01

图解主要方法

持续多观察细化动作,如何缓和频繁重规划与长动作连续性的冲突?

颜色边框追踪同一动作块,末端补入噪声;右侧为概念/汇总展示,具体主配置是3Hz输入和30Hz输出。
图1|同一个动作块跨观察逐步去噪并移向执行端查看大图 ↗
上海交通大学、PrimeBot、浙江大学、上海科技大学、新加坡国立大学,arXiv:2610.12007v1。原图未改动,仅用于方法评论。 · 原始来源与图注 ↗ · CC BY 4.0
  1. 1

    建立噪声程度递增的持续动作缓冲

    H=KS,主设置K5、S10;五块噪声时间为0.2/0.4/0.6/0.8/1。每次在整个50动作窗口执行一个Euler步、步长1/K,使前块变干净;后块保留部分去噪结果而不是每轮全部随机重采。

  2. 2

    执行前块并滚动未来

    发出10动作,余块左移,末尾填Gaussian噪声;每个稳态输出块历经五轮细化。启动从重置姿态与噪声插值,先在同初始观测下暖启K−1轮且不计输出,之后才正常执行。

  3. 3

    用匹配位置的阶梯噪声训练

    每示范块位置用固定噪声时间,一次前向联合监督五种阶段,仍以干净示范和噪声的速度差作目标。它保证查询的位置/时间网格覆盖,不保证生成轨迹和不断变化观测与训练数据完全同分布。

  4. 4

    解开视觉编码与动作执行等待

    每S个相机周期选一帧,异步VLM工人写入按捕获时间单调更新的latest-ready缓存,DiT用最新完成条件。主配置同一4090放两个VLM工人和动作专家;工人数不等于GPU数,吞吐公式需有效服务能力足够。

02

实验与证据

全文及附录A–F已读,图1视觉核对,检查官方任务演示和资源入口;无独立复现。

来源证据七个RoboTwin任务,各50 clean示范,30k训练步,clean/randomized各100rollout/任务;真机六平台任务对各30次。 4.1;附录C.6 ↗

我的解读不是全50任务基准;同随机放置控制测试场景,仍未重复独立训练seed。

来源证据PaliGemma-3B加300M动作专家;AdamW峰值2.5×10⁻⁵、10%暖启,仿真batch32,真机20epoch。 附录C.2–C.3 ↗

我的解读ARX batch128、Franka256(反应任务32);动作表示ARX14维关节,Franka20维末端,不能跨平台直接比jerk绝对大小。

来源证据完整REACT普通真机64.8%,无DD65.7%,长块58.7%;Franka钥匙环53%低于长块70%。 表2 ↗

我的解读平均改善并非逐任务更好;异步条件老化是作者解释,尚需单变量延迟干预验证。

来源证据S10、30Hz相机:主输入3Hz、输出30Hz;VLM37ms、DiT3ms作为分析参考。 附录B表5 ↗

我的解读表5吞吐是代公式计算,S1的30Hz输入是条件上界;主设置单工人参考27Hz已足够,不能声称需要两卡或按工人数线性加速。

来源证据条件年龄平均233ms、p95 383ms、max416ms;选帧周期333ms。 3.2 ↗

我的解读最新完成条件仍可能超过一个周期老,不应称实时无延迟;乱序完成未观察到,单调时间戳缓存用于防回退。

来源证据同步每次更新66.04→39.96ms,1.65倍;REACT每轮一步、稳态每输出块五次细化,普通基线每整块十步。 附录C.4表7 ↗

我的解读不是总去噪只做一步的同预算比较,启动暖启和物理执行时间另算。

来源证据倒米完整63%、无DD57%、长块3%、短执行33%;反应完整734±94、Async747±123、无DD754±127、长块1505±502ms。 表3;附录C.7 ↗

我的解读专项试验数未充分交代;正文“鼠标点击”与附录实际USB键盘按键不同,测量以显示缓冲提交到OS按键事件为准。

来源证据人类遥操作同一机械臂同脚本705±73ms,完整REACT均值高29ms。 附录C.7 ↗

我的解读共享测量链路减少设备差异,但差值不完全隔离模型计算,还含运动策略和人的操作过程;非裸人类反应速度比较。

来源证据成功轨迹模拟jerk:长块658.9、REACT1219、Async2022.2;Franka18.4/28.6/31.6。 图3;附录D ↗

我的解读REACT不是最平滑,成功条件化也不保证无选择偏差,失败动作不在这些统计内。

来源证据对Async两比例z检验均p<10⁻⁵,但作者未训练独立seed。 4.2;第6节 ↗

我的解读只反映所测rollout采样误差,跨任务汇总和场景配对亦应谨慎,不能推及训练鲁棒性。

来源证据三任务3k步成功52.7%对25%,15k步匹配基线30k;随机化离线MSE0.272→0.048。 4.4;附录F ↗

我的解读证明报告的优化步效率,未报告同倍数墙钟/GPU成本;图中带为任务范围非置信区间,开环MSE不等于闭环安全。

来源证据固定S10,K1→5成功13.6→49.7%;固定K5,S1→10为6.3→49.7%。 附录E ↗

我的解读K或S改变时总H也变,不能把增益单独归更多观察或更强反应;每设置单独训练,未测试零样本换调度。

03

开放情况与使用许可

官方react-vla.github.io提供论文、真实任务视频和方法说明,所见资源入口未列可下载研究实现、检查点或训练数据;基础π0.5公开不能代替REACT开放状态。

LICENSE论文与图1为CC BY 4.0,官方页面内容亦标CC BY 4.0;尚未核实另有研究软件或权重许可。

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

同π0.5基础上,滚动同步版本RoboTwin Clean/Randomized49.71%/20.86%,优于长块37.43%/11.43%,支持持续缓冲区与匹配训练。

完整REACT对Async+RTC保持相同主配置输入/输出吞吐,真机成功64.8%对17.7%,ARX成功轨迹jerk90.1对284.1。

反方 · 哪些结论还不够

完整DD版本一般任务44.86%/19.86%及真机64.8%,低于无DD49.71%/20.86%及65.7%,不能说异步化所有指标都更好。

最平滑仍是完整长块基线;REACT与Async成功样本集合不同,只在成功样本上算jerk仍可能有选择偏差。

反应734±94ms对Async747±123ms只差13ms,专项试验数与差异检验不足;无训练seed,不能宣称已显著接近或超越人类。

综合判断

强项是把长期动作连续性和新观察更新放进同一滚动生成过程;实验支持特定π0.5部署下的取舍改善,不能泛化为无旧观测、无训练或所有任务均最优。

我会先做的验证

建议实验(尚未执行):匹配训练步数和每块有效去噪预算,以多训练seed重做滚动/阶梯监督/DD三因素对照;在固定场景、失败也保留的运动质量指标下测完整延迟分布,并系统注入摄像头和编码延迟。

继续探索具身智能