把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?

Gemini 领跑,GPT表现平平,国立清华、英伟达提出双奖励孪生网络,告别算力焦虑。

Gemini 领跑,GPT表现平平,国立清华、英伟达提出双奖励孪生网络,告别算力焦虑。
VLM大模型(VLM)在静态视觉与推理任务上已展现出强悍能力。然而在具身智能领域,当模型需要面对复杂的动态交互与机械臂控制时,它们能否准确评估智能体的动作与画面变化,依然是一个待检验的问题。
过去不少人以为,能“看懂画面”就意味着能“当好教练”。但对具身智能来说,从识别场景到精准评估动作进展,完全是两码事。
为了厘清各大模型在真实动作评估中的底细,国立清华大学与 NVIDIA 联合团队在最新研究《VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning》中,把 Gemini 2.0、GPT-4.1 等主流大模型拉进同一个考场,对它们的视觉裁决能力做了一场综合评估。

论文链接:https://arxiv.org/pdf/2607.00483
01
考场设计:四大仿真套件、
10 大场景与“看图判进展”规则
研究团队选用的 10 个典型任务,涵盖了具身智能的四大主流仿真套件。
其中既有Cart Pole(倒立摆平衡)这类考察基础刚体平衡控制的任务;也包含了Straighten Rope(拉直绳索)与Pass Water(平移水杯),这类专门考察模型对非刚体形变与连续流体微观感知能力的柔体操作。

研究所选用的 10 大典型具身智能任务场景
此外,任务库还涵盖了Soccer(踢球入网)、Sweep Into(扫方块入洞)和Open Drawer(拉开抽屉),这类任务考察的是模型对三维空间中机械臂末端与物理接触关系的精准理解;
以及《我的世界》中的Combat Spider(击杀蜘蛛)、Milk Cow(挤牛奶)、Shear Sheep(剪羊毛)和Hunt Cow(追逐猎牛),这类任务考察的则是模型在复杂视角下,进行长时程、多步骤逻辑规划的综合能力。
在这场测试中,研究团队剥离了游戏或物理引擎内部的“上帝视角数据”(比如物体的精确三维坐标、速度等)。大模型只能像人类玩家一样,接收第一人称 RGB 视觉画面以及一句简单的自然语言任务目标。
从智能体的探索轨迹中随机采样出前后两个时刻的观察画面,连同任务文本提示词一同喂给冻结参数的VLM。大模型需要做出判断:画面 1 和画面 2 相比,哪一个画面代表智能体离任务目标更近?
为了保证评测的客观性,研究团队为每个任务都精心准备了 100 对包含伪真值的对照画面组,用来直接衡量各大 VLM 在具身场景下的偏好判断准确率。
比赛规则已经明确,接下来就是各大主流 VLM 登场硬碰硬的时刻了。
02
横向实测:Gemini 综合最稳,
开源小模型局部反超
当这批十项具身考核任务布置下去后,各大VLM表现出来的差异之大,远超预期。

各大主流VLM在 10 项具身任务中的进展预测准确率
▎综合领跑:Gemini-2.0-Flash 准确率全线突破 70%
在这场具身感知大打擂中,Gemini-2.0-Flash展现出了极佳的综合泛化能力。 虽然在个别任务上被开源小模型拿走了最高分,但 Gemini 是唯一一个在所有 10 项任务中准确率全部保持在 70% 以上的模型。
它在 Cart Pole 任务上达到了91%,在 MetaWorld 的机械臂任务中也稳定在84%~87%。这种全场景无短板的推理稳定性,让它能敏锐察觉到“水杯有没有倾斜过头”、“机械臂末端是否钩住抽屉”等微观物理变化。
▎局限明显:GPT-4.1 表现平平,传统 CLIP 彻底失灵
相比之下,另外几位“明星选手”的表现则令人有些意外。
GPT-4.1-nano在大多数具身任务中准确率仅在60%~66%徘徊,对于稍微复杂一点的空间时序变化(如踢足球入网 Soccer 仅 60%)判断力明显不足。
CLIP / MineCLIP等传统靠向量余弦相似度打分的对比学习模型彻底陷入低迷。即便是专门在《我的世界》海量视频上做过微调的MineCLIP,在 MineDojo 任务中的准确率也仅在39%~59%之间。
这印证了一个行业共识:缺乏高阶VLM推理能力的特征匹配模型,很难看懂连续动作中的微观物理进展。
▎局部反超:Phi-3.5 与 DeepSeek 在特定任务爆发
更有趣的是,几款开源轻量模型虽然综合能力不如商业大模型,但在特定场景下却爆发出了惊人的“专业对口”天赋 。
- Phi-3.5-Vision-Instruct(4.15B 参数)虽然在基础控制任务上表现平平,但在《我的世界》的“挤牛奶”和“剪羊毛”任务中,打出了惊人的90% 准确率,表现甚至反超了 Gemini!
- DeepSeek-VL2-Tiny(3.37B 参数)在小模型普遍吃力的“打蜘蛛”高动态战斗场景中,拿下了85%的高分。
- MiniCPM-o-2.6(8.67B 参数):在极难捕捉液体状态的“倒水”任务中,做出了73%的精准裁决。
无论是全能的 Gemini 2.0,还是在特定场景爆发的开源小模型,都证明了VLM大模型完全具备作为高水平“具身视觉裁判”的能力。但另一个问题随之而来:既然教练这么聪明,我们真的能直接请它来“全程执教”吗?
03
高频调用成本难承受,
且单图绝对打分易失灵
既然打擂结果表明 Gemini 2.0 等大模型具备出色的具身判断力,那么直接让大模型全程坐镇、实时给强化学习(RL)智能体打分不就行了吗?
然而,研究团队在实际落地的过程中,很快撞上了两座难以逾越的大山。
▎成本与延迟:高频请求 API 带来天价账单与延迟
强化学习的策略优化通常需要经历数十万甚至上百万步的环境交互。 如果智能体每走一步(甚至每隔几步),都将当前画面打包上传到云端 API 请求一次 Gemini 或 GPT-4.1,后果将是灾难性的:
- 天价账单:几十万次高频次的VLM API 调用,单次训练成本就会飙升至数万美元。
- 延迟崩溃:网络请求与大模型推理的延迟,会让本就耗时的 RL 训练速度降低数十倍,在工程上几乎不可接受。
▎算法缺陷:绝对打分导致评分漂移与循环任务失效
退一步讲,即便忽略 API 成本,仅依靠 VLM 对单个状态进行绝对打分这种传统思路(如以往的 SOTA 方法 RL-VLM-F),在算法逻辑上也存在着致命缺陷。
- 奖励评估剧烈漂移
在 RL 训练初期,智能体能看到的画面非常有限。随着训练推进,智能体不断探索出全新的场景,绝对打分模型的评分基准会随之发生剧烈漂移。
在同一个《我的世界》“挤牛奶”专家轨迹上,绝对奖励在训练到 512k 步和 942k 步时给出的得分曲线剧烈波动、极不一致。这种时高时低的奖惩信号,会直接把智能体“搞晕”。

- 循环逻辑彻底失效
具身任务中充斥着大量非线性或循环动作,例如机械臂来回微调、按固定路线巡逻、绕圈找牛等。
研究团队用了一个非常经典的环形跑道来揭示这个问题:

在 Ringworld 环形任务中,传统的绝对打分会导致智能体陷入死循环(收益为 0)
在环形跑道中,智能体需要沿着圆环顺时针不断移动。 由于圆环上的状态不存在全局固定的“先后顺序”,试图给每一个位置打出固定的全局高低分在数学上是根本不成立的。 采用绝对奖励训练的智能体收益始终为 0,完全无法学会这种周期性任务。
一边是昂贵的调用开销,一边是单图打分容易引发的死循环与评估漂移。 为了让大模型真正成为合格且便宜的具身教官,清华与 NVIDIA 团队交出了一套极为巧妙的破局方案。
04
架构解法:
双奖励结合孪生网络蒸馏,
查询开销降至1/20
面对“请不起云端大模型”和“单图绝对打分易失效”的双重瓶颈,清华与 NVIDIA 团队提出了名为VLM-AR3L的全新框架。

VLM-AR3L 框架:大模型在后台离线打标,本地轻量孪生网络在前台指导
这套解法的精妙之处在于两点:打分逻辑上的“双奖励融合”,以及工程落地上的“大模型轻量蒸馏”。
▎绝对+相对双奖励:兼顾全局方向与微观步骤推进
既然只看单张图的“绝对打分”容易引发分数漂移和循环路况失灵,那就引入“相对对比”!
- 绝对奖励(Absolute Reward,看全局):评估单个状态离目标的远近,为智能体提供全局的方向感。
- 相对奖励(Relative Reward,看增量微操):比较当前观察s_t与过去某一步观察sₜ₋ₖ(引入时间偏移$$k=1$$)之间的变化,判断智能体这一步到底是进步还是退步了。
为了防止大模型产生幻觉或盲目预测,团队还设置了一套双向对称置信度检验规则:只有当相对模型同时高度确信“当前状态优于过去状态”且“过去状态不如当前状态”时,才会发放正向奖励。
最后,将两者归一化后按照比例结合,既保留了全局大方向,又锚定了微观步骤的真实推进。
▎离线打标与孪生网络:把大模型 API 查询频次打下 20 倍
为了把高昂的 API 账单打下来,研究团队并没有在 RL 探索时直接去频繁查询大模型。
如图所示,他们巧妙地将过程拆分为两条线:
1.后台异步打标:大模型只负责在后台定期从经验回放池(Replay Buffer)中离线采样图像对,并生成偏好标签。
2.本地轻量替代:团队使用这些离线标签,训练了一个极小的孪生网络。在前台 RL 策略训练时,智能体直接调用本地这个轻量网络获取奖励。

这项工程优化直接将 VLM 的查询需求降低了约 20 倍,原本需要数万美元的训练成本和高延迟问题迎刃而解。
05
实战效果:攻克长时程探索死局,
表现超越人类手写奖励
这套“双奖励+孪生网络蒸馏”的组合拳在真实具身任务中的战力如何?论文给出了非常具有说服力的答案。

VLM-AR3L 与各类基线方法的最终任务成功率
在面对《我的世界》等复杂的具身场景时,以往依靠绝对打分的 RL-VLM-F 方法表现大幅下滑(如在 Shear Sheep 中成功率仅 0.47);而 VLM-AR3L 在 Combat Spider(打蜘蛛,85%)、Milk Cow(挤牛奶,95%)等任务上均实现了高成功率收敛。

VLM-AR3L训练曲线
更令人惊喜的是,在像挤牛奶、剪羊毛、猎牛这类极度依赖长时程探索的任务中,即便是人类工程师精心手写的稀疏真值奖励,智能体也因为反馈过于稀疏而完全无法学会(成功率为 0)。
而 VLM-AR3L 凭借密集且稳定的相对进展信号,成功引导智能体学会了完整的长时程交互流程,表现甚至打败了人类手写的真值奖励!
06
具身智能时代的分工:
大模型当总教官,小模型做动作执行
这篇论文的意义不仅在于提出了一个高效的算法框架,更在于它为大模型与具身智能的结合提供了一种极其清晰的思路。
在未来的具身智能范式中,通用VLM或许不需要亲自操盘底层的每一个电机转动或关节控制,也不需要在每个毫秒级的控制循环中实时响应。
大模型的真正价值,在于扮演一个高屋建瓴的总教官。它凭借对世界的深刻认知与常识,去评判进展、离线打标,并将这种感知能力蒸馏给轻量化、端到端的策略小模型。这或许正是具身智能迈向高可靠、低成本落地的钥匙。
文章来自于"AI科技评论",作者 "张璐"。
相关主题
读完之后
加入 AINRK 交流群
了解加入交流群的方式,与更多 AI 从业者交流。




