本地编程智能体操作机械臂:代码能力如何变成动作
45 次真机试验,也暴露了人工技能与安全边界
研究让本地 Qwen3.8-27B 通过工具调用和临时脚本操作 UR3e。45 次试验有 30 次无需介入完成;无需任务微调并不意味着无需机器人知识,系统依赖人工手册、六份技能和底层保护。
图解主要方法
图 2 中模型、技能、脚本与硬件安全服务分别负责什么?

- 1
固定硬件与可调用接口
UR3e 配 Robotiq 2F-85、腕部 RealSense D435,服务暴露九类操作:观察、状态、运动、夹爪、像素深度、颜色检测及接触运动等。无论直接工具调用还是脚本 SDK,均经过同一工作空间、速度和力限制。
- 2
在本机读手册并编写临时程序
Qwen3.8-27B 在 RTX PRO 6000 96GB 上以 vLLM FP8 权重及 KV 缓存运行,最大上下文 262144。pi 编程框架配 68 行系统提示、617 行手册和每个游戏两份手工技能;这是一套精心配置的系统,不是裸模型看图控制。
- 3
围绕当前实测值生成动作
模型测量物体、读取标定、写计算抓取与动作的脚本,再观察结果。每次会话有独立工作目录,技能强调使用本次测量而非复用旧数值;语言模型调度不是高频闭环控制,接触下降由底层阻塞接口执行。
- 4
把复用收益与学习区分开
同一会话再次执行可复用已写脚本和测量流程,减少 token 与调用。模型权重没有在线训练,跨会话也不保留工作空间,因此只能称会话内程序复用,不能称持续自主学习。
- 5
检查保护覆盖范围
TCP 的空间盒限制不能完整覆盖夹爪本体;错误孔位判断、姿态锚定和长序列失误仍会触发急停或保护停。动作代码能够运行不代表几何可达性和安全约束都得到证明。
实验与证据
以下为作者报告;已阅读 v1 全文及可用附录,本站未独立执行研究实验。实验条件与编辑解读分别列出。
来源证据【表 IV】九任务各五次,共 45 次,30 次无需介入;耗时约 3.4–67.5 分钟,棱柱任务 1/5、梁任务 2/5。 表 IV ↗
我的解读我的解读:成功率和速度高度依赖任务。正文结尾的失败次数与表格不一致,本稿采用可加总的逐任务表。
来源证据【安全记录】表 IV 列出六次急停、一项保护停,共七项相关记录。 表 IV ↗
我的解读我的解读:这些计数不应当作互斥的失败类别;更不能以有保护服务推断无需监督。
来源证据【复用】从每任务最快和最慢的成功运行选取 17 次第二轮,16/17 成功;相对耗时约 0.48,调用 734→354,token 约 1054.1k→354k。 第二轮实验 ↗
我的解读我的解读:样本先筛选成功运行,存在选择偏差;结果不能外推为所有初次失败都能自我修复。
来源证据【系统依赖】六份技能各约 182–324 行,包含测量与操作经验。 系统设置与附录 ↗
我的解读我的解读:无需微调的价值成立,但人工准备成本必须与模型能力一起报告。
开放情况与使用许可
作者项目页明确说明平台与智能体代码尚未发布;提供系统提示、技能文字、记录及演示入口。引用的 airo-mono 是上游组件,不能视为本研究完整平台已开源。
LICENSE研究平台代码与许可未发布;公开说明及演示不等同可复现实现。
我的判断
独立分析 · 未复现实验正方 · 为什么值得投入
统一硬件接口与可检查的临时程序,让本地模型的推理和失败轨迹可以逐步审查。
反方 · 哪些结论还不够
成功样本选择、较长执行时间、手工知识和安全停机限制了自主性;文章不同段落的计数也需按原表核对。
综合判断
这是本地编程模型连接真实操作的有价值案例,当前适合受监督研究台架,尚未证明泛化的无人值守操作。
我会先做的验证
未执行的验证方案:固定硬件和预算,逐步移除任务技能,并加入新物体、错误深度与标定扰动;同时报告全体试验的任务成功率、介入率、碰撞与完整人工准备时间。