自主构建感知与控制工作流
模型将视觉推理与分割、相机标定、动力学计算结合,转化为机器人动作。
查看感知与控制案例01 / Overview
每道题把机器人暴露为一组工具。模型看图像与状态,决定动作,环境执行后返回回执与新观测;是否完成任务由模型看不到的评分状态判定。
02 / Embodiments
从灵巧操作到全身运动,从地面驾驶到空中控制:用统一的控制语义,连接 18 个机器人本体、20 个控制配置与全部 84 个任务。
正在加载机器人本体图谱…
03 / Benchmark
04 / Results
06 / 任务与录像
悬停预览录像,点击放大观看。
07 / Protocol
仿真控制步是环境实际执行的物理控制步,受每题预算限制;轨迹记录序号是日志中的事件编号,二者不同。
沿用原题预算,其中 10 项移动操作任务以 2000 步为上限;16 项重新设计的场景使用已批准时长与 world-state-v1 判定。
达到控制步上限、环境原生终止、world-state 终止分别标注。不向模型提供放弃工具;模型结束回答但环境仍在运行时,会提醒它继续。基础设施中断不计分,不算 0 分。
现行规则:连续 15 次交互没有执行控制步,或累计达到每题上限 30/60/120 次,即停止并判定失败。部分早期结果使用其他上限或没有上限,以每次尝试记录的协议为准。
API 断流与偶发图片处理拒绝,保留同一仿真与会话,退避 10/20/40 秒原地恢复,最多 3 次,不重放已完成动作。
每模型 84 题,覆盖五大领域。各题展示实际结果、录像与协议;未完成记录仍为未评分。
08 / Citation
@misc{yang2026robotworld,
title = {{RobotWorld}: Benchmarking Multimodal Agents for Robot Use
Across Diverse Tasks and Embodiments},
author = {Yang, Zhiqin and Li, Chenxin and Hu, Xiaomeng and Liu, Yibin
and Huang, Weidong and Sun, Jiankai and Li, Haitao and Wu, Zijian
and Huang, Yuzhi and Huang, Fanding and Sun, Hanwen and Liu, Jiashun
and Tong, Jingqi and Huang, Mingxin and Hu, Shaoli and Huang, Shijue
and Bai, Tianyi and Wang, Xinyuan and Lin, Yunlong and Tang, Zhengyang
and Zhang, Zhexin and Chen, Zhuo and Song, Xierui and Dai, Juntao
and Chen, Boyuan and Ji, Jiaming and Zhan, Fangneng and Hu, Mengkang
and Xue, Wei and Zhang, Yonggang and Hu, Han and Ho, Tsung-Yi
and Guo, Yike},
year = {2026},
eprint = {2610.10409},
archivePrefix = {arXiv},
primaryClass = {cs.RO},
url = {https://arxiv.org/abs/2610.10409}
}