RobotWorld · 实验报告 01 · 预评测
一个 agent,84 道机器人任务
机械臂、灵巧手、家居机器人、足式机器人、小车和无人机。多模态模型,同一套工具,没有示范,也没有微调。
要点
每道任务按 0 或 1 分计分。下列统计与主页使用同一份结果数据。
RobotWorld 想回答一个简单的问题:把机器人当成一组工具交给通用多模态 agent,它能不能把活干完?agent 看到相机画面和机器人状态,发出动作,收到执行回执;最后由一个它看不到的私有评分器判分。
模型在不同批次中运行,采用了不同推理档位。最终分数按各任务规定的预算计算。我们同时报告实验设置、结果和录像,为模型间的比较提供必要背景。
实验设置
| 项目 | 配置 |
|---|---|
| 任务 | 每个模型 84 题,基于开源仿真环境构建。按机器人形态:双臂与灵巧手 24、移动操作机器人 20、固定底座机械臂 14、轮式车辆 11、双足与人形 4、轮足 4、空中 4、四足 3。按任务领域:桌面与灵巧操作 38、移动操作 20、足式与轮足运动 11、车辆驾驶 11、无人机飞行 4。 |
| 接口 | 机器人以工具形式提供:观测(图像、关节与任务状态)、动作(各环境专用动作,按控制步执行)和执行回执,允许使用辅助分析工具。 |
| 模型 | GPT-6 Astra, Opus 5.5, Kimi K3, DeepSeek V4.1 Flash, Gemini 3.8 Flash. |
| 设置 | 推理强度、非动作预算因模型和批次而异,单条任务保留对应设置。 |
| 预算 | 沿用原题步数预算,其中 10 项移动操作任务以 2000 步为上限。非动作上限会终止一直观察、却不让机器人动起来的尝试。 |
| 结束方式 | 不向模型提供放弃工具。模型结束回答时如果环境仍在运行,控制循环会提醒它继续。只有环境终止,或步数/非动作预算用完,一次尝试才结束。 |
| 评分 | 每道任务根据预先定义的成功条件和评测预算,按 0 或 1 分计分。 |
| 尝试 | 每个模型每题采用一条结果。基础设施异常后的重跑不重复计分。 |
控制步指仿真中实际执行的一步物理控制,和日志事件的记录序号不是一回事。
核心发现
成功率之外,轨迹还揭示了什么?
模型会自行搭建感知与控制工作流。
轨迹中出现了颜色分割、相机标定、空间估计和动力学计算。模型开始将视觉推理与代码结合,转化为可以执行的机器人指令。
执行了动作,不代表完成了任务。
失败可能来自对当前状态的误判、收到反馈后未调整策略,或目标尚未满足就宣称完成。可靠的 robot use 需要持续检查:刚才的动作究竟实现了什么。
不同模型采用不同的感知与控制策略。
在叠方块案例中,Astra 先通过连续视觉估计抓起第一块方块,之后才拟合相机几何;Opus 则先编写分割程序、拟合相机参数。在无人机颠球中,两者都计算了动力学,但 Opus 更好地维持了连续击球。差异在于如何组织估计、计算与反馈。
结果
下图每个小方块是一道题。按结果排序后可以看到,解出的题很少,Kimi K3 和 DeepSeek V4.1 Flash 解出的题更少。
在 20 道移动操作任务中,GPT-6 Astra 完成 4 道,Kimi K3 完成 1 道,其余模型均未成功。下图展示五个领域的结果。
GPT-6 Astra 与 Opus 5.5 解出了哪些任务?
能力如何转化为机器人行动
论文追踪了观测、计算与反馈如何转化为实际控制。下面的案例解释单条轨迹中的机制;录像展示动作过程,文字分析则结合了交互日志。
反馈带来下一步动作的改变
Kimi K3 发现末端位移减小后,缩短连续推抽屉的动作段,再撤开检查;环境在撤开时确认成功。Astra 在插充电器时遇到腕部相机旋转被拒,随后降低并调整空闲机械臂的位置,再次尝试后旋转成功执行,整条轨迹最终完成插入。反馈的作用体现在:它改变了接下来的动作。
把视觉估计转化为抓取
叠方块时,Astra 在外部图像处理或相机拟合之前就抓起了第一块蓝方块;Opus 5.5 则先编写颜色分割程序,再通过机械臂移动采样、拟合相机参数。两者在接近的物理步数完成首次放置与撤回(270 对 268)。此后 Astra 完成整座堆叠,Opus 在未完成时耗尽辅助调用预算。这里比较的是到达初步进展的不同路径,并非两条成功轨迹。
第一次接触之后,能否维持连续控制
无人机颠球中,Astra 和 Opus 5.5 都进行了离线动力学计算。Opus 协调调平、击球前加速、接触后降低推力和重新移至球下方,在 800 步内完成 15 次有效击球;Astra 完成 3 次后,在第 188 步终止。两者每次动作实际步数的中位数都是 3:建立模型、采用短动作段,本身不足以保证持续控制。
机器人闭环在哪里失效
失败结果说明目标没有实现,交互日志则帮助解释进展为何停滞:所需物体状态丢失、一直停留在准备阶段,或把未完成的任务误判为完成。
机械臂还在动,物体状态却没有恢复
Kimi K3 在接近时撞倒了瓶子,随后多次左臂尝试未能抓牢,到第 240 步才切换右臂。后续接近动作耗尽剩余预算,第 400 步时倒液任务仍未完成。机械臂到达新的位置,并没有恢复任务所需的抓持状态。
准备阶段没有推进到下一个子目标
切菜任务中,Kimi K3 的全部 69 次正步数动作调用都用于观察周围、导航或绕开家具;最后一条指令仍在尝试进入厨房。直到 2,000 步用完,都没有发出切菜指令。这条轨迹的瓶颈是到达操作区域,不能据此判断尚未尝试的切菜能力。
动作仍在执行,纠错却已经停止
Kimi K3 在第 861 步宣称扫方块完成,之后 69 次调用只改变空闲机械臂的高度,走完最后 139 步。DeepSeek 在导航到灶台时认为无需再移动,最后 105 步都发出零底盘速度指令。两题最终都未成功。继续调用工具,并不代表继续纠正未完成的目标。
交互与预算
下面的图统计每次尝试如何结束、使用了多少控制步预算。这些是执行统计;终止条件本身并不能解释背后的失败机制。
较少的控制步可能来自提前成功、环境终止或非动作预算耗尽,需要结合任务结果和结束原因解读。
时间与费用
查看录像
点击图表或任务卡片查看记录。动态录像可播放;单帧记录显示静态图,无录像或文件异常会单独标注。
局限
- 每个模型每题采用一条结果;基础设施重跑不重复计分。
- 各模型的推理强度、批次和非动作协议存在差异,应结合实验设置解释分数。
- 对应任务使用已完成的 Shell-on 批次,所有模型均包含无人机排球 1v1。
- 仅在仿真中测试,没有评估真机迁移、安全性和接触力。