aiwillknow.AI 前沿观察每日 08:00 开始整理
具身智能RESEARCH BRIEF

VLAct

在固定机器人数据预算下,把表示学得更好

IN A NUTSHELL

保护 VLM 已有知识,用多个动作头共同监督,并只统一物理意义相容的动作维度,训练更可迁移的机器人底座。研究强调固定数据与微调预算下的表示质量,而不只是扩充采集量。

01

方法与关键变化

继续预训练时冻结视觉编码器和语言模型下半层,辅以图文监督;OFT、PI、GR00T 三类动作头共享骨干,随后丢弃这些头,在下游任务上重新初始化动作头。

跨本体表示只合并物理语义可对应的维度,其余保留独立槽位,并对周期关节等特殊维度处理损失。下游微调再解冻完整模型。

02

实验与证据

作者报告 LIBERO-Plus 总成功率 82.6%;RoboCasa-GR1 用 20% 下游微调数据取得 49.5%,对照所列全量数据 GR00T-N1.6 为 47.6%。这些是作者协议下的结果,后者是迁移加微调,不是零样本部署。

03

开放情况与使用许可

官方仓库提供训练流程,Hugging Face 已包含预训练检查点。下游模型、底座及数据各自的许可需分别保留。

LICENSE代码:MIT;预训练检查点模型卡:Apache-2.0

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

让预训练骨干不绑定单一动作头,有机会提升同一批轨迹的复用价值。其最有意义的承诺,是换控制范式后仍能继承有效表示,而非预训练任务本身得高分。

反方 · 哪些结论还不够

下游微调收益可能同时来自数据、骨干初始化和训练预算,不宜全部归因于多头设计。少量真实 rollout 的方差较大,也不能说明连续部署可靠。

综合判断

我倾向于优先复现其低数据适配收益,并要求固定预算对照。若优势只在特定动作头成立,“通用骨干”的表述就应收窄。

我会先做的验证

固定骨干规模、轨迹数和优化步数,对照单头/多头预训练,换两种下游动作头并多随机种子重复;同时报告每任务分布与真实执行的置信区间。

继续探索具身智能