aiwillknow.AI 前沿观察每日 08:00 开始整理
具身智能RESEARCH BRIEF

LingBot-VLA 2.0

从双臂操作扩展到全身与跨机器人控制

IN A NUTSHELL

用约 6 万小时预训练数据覆盖多类机器人与第一视角人类视频,统一更多身体自由度,并加入未来预测监督。研究重点是模型如何适应不同硬件,而不是仅提高一个仿真榜单分数。

01

方法与关键变化

将多种机器人映射到 55 维规范状态与动作空间,包含手臂、末端、手指、腰、头和移动底座。动作专家引入稀疏 MoE,兼顾共用知识和硬件差异。

通过当前与未来感知查询,从深度模型和视频表示模型蒸馏几何及动态信息。预训练数据包括约 5 万小时、20 种机器人配置的轨迹,以及约 1 万小时人类视频。

02

实验与证据

论文使用 GM-100 泛化评测,并报告两类平台的长程移动操作。官方仓库提供训练、部署代码和预训练权重,7 月 25 日还发布了 RoboTwin 后训练权重;仿真与真实硬件结果应分别阅读。

03

开放情况与使用许可

训练与部署代码及模型权重可下载。代码采用 Apache-2.0;所依赖的 Qwen、深度与视频教师模型分别遵循自身许可,不能把主仓库许可自动套到全部组件。

LICENSE主仓库代码:Apache-2.0;权重及依赖许可分别核对

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

将多身体数据、动作表示与预测目标一并公开,允许研究共享能力究竟来自哪里。若跨本体知识能减少新机器人采集量,对实际开发比单任务最高分更有意义。

反方 · 哪些结论还不够

统一维度只是格式,不是物理语义统一。某些机器人或数据源可能主导训练;坐标系、时间同步和动作标定不一致,也会被错误地归因于模型能力。

综合判断

值得作为跨本体后训练的开放基线,但应先验证数据和动作接口,再谈模型升级。对新身体的样本效率比训练分布内成功率更关键。

我会先做的验证

留出一种身体或末端执行器,固定适配样本数,对照从零、同身体预训练与多身体预训练;分开统计动作映射错误、感知失败和策略失败。

继续探索具身智能