具身 Agent 系列 02:从任务规划走向现实闭环

本文目录
  1. 一、Planner+VLA 仍然是一条单向执行链
  2. 二、具身 Agent 是围绕现实目标运行的闭环
  3. 三、具身智能应该从模型中心走向系统中心
  4. 引用与来源

机器人观察抓取结果,并通过具身 Agent 闭环调整动作

上一篇我们谈到,通用 Agent 可以为具身智能补充更广泛的理解与组合能力。

但具身 Agent 到底是什么?它和常见的 Planner+VLA,又有什么区别?

一、Planner+VLA 仍然是一条单向执行链

Planner+VLA 的基本逻辑是:

接收任务 → 分解任务 → 调用 VLA → 输出动作。

它解决的是“复杂任务如何拆成多个动作”,但整套流程仍然默认:计划是正确的,动作也会按照预期执行。

问题在于,物理世界不会完全按照计划运行。

机械臂可能没有抓住物体,物体可能在执行中发生位移,原本可行的路径也可能突然被遮挡。

如果执行以后不能重新观察和调整,那么 Planner 只是让机器人拥有了计划,还没有让它成为 Agent。

Planner 和 VLA 组成单向执行链,动作失败后没有反馈

二、具身 Agent 是围绕现实目标运行的闭环

具身 Agent 关注的不是“有没有输出动作”,而是“现实目标有没有完成”。

它需要持续围绕目标运行:

理解状态 → 调用能力 → 执行动作 → 检查结果 → 继续或调整。

因此,我更愿意这样定义:

具身 Agent,是能够围绕现实目标,根据环境和执行结果持续调整行为的智能体。

例如,让机器人把黑色碗放进木托盘。Planner 可以生成“找到碗、抓取、移动、放下”的计划。

但如果机器人没有抓住碗,继续执行后面的动作就没有意义。具身 Agent 会检查抓取结果,再决定继续、重试或者调整方法。

机器人根据现实反馈调整抓取动作,形成闭环

所以:

Planner 解决“准备怎么做”,具身 Agent 解决“如何根据现实反馈,把事情真正做完”。

三、具身智能应该从模型中心走向系统中心

过去,具身智能主要围绕一个问题展开:

能不能训练出一个模型,直接从观察和指令生成正确动作?

具身 Agent 关注的问题则是:

如何让整个系统根据现实反馈持续调用不同能力,最终完成目标?

这并不意味着模型不再重要,而是模型在系统中的位置发生了变化。

具身智能从单模型直接执行转向由系统组织能力并接收反馈

现有研究已经开始沿着这条路线推进。下面列举三个 2026 年的代表性工作:

  • 2026 年 6 月,NVIDIA Research 发布 Vesta,把规划、工具调用和多模态记忆接入低层机器人模型。【1】
  • 2026 年 7 月,以清华大学为主的团队发布 Harness VLA,将冻结的 VLA 作为可以重试的操作能力,由 Agent 结合记忆和其他工具持续调整。【2】
  • 2026 年 9 月,以浙江大学为主的团队发布 EmbodiedSkills,在技能执行前检查条件,并在执行后验证结果。【3】

这些路线并不完全相同,但都指向同一个变化:具身智能正在从模型中心走向系统中心。

在前面讨论的 Planner+VLA 架构中,VLA 仍是中心,Planner 负责为它提供执行计划。而在具身 Agent 架构中,系统围绕现实目标组织规划、记忆和工具调用,VLA 是其中一种能力;系统根据执行结果决定继续、重试或调整。

区别不仅在于有没有反馈闭环,更在于从围绕模型安排计划,转向由系统组织能力、持续完成目标。

下一篇,我们继续讨论:为什么同一个 VLA 放进具身 Agent 系统以后,可以完成更多任务。

引用与来源

【1】Vesta: A Generalist Embodied Reasoning Model
NVIDIA Research

【2】Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents
arXiv:2607.08448

【3】EmbodiedSkills: A Unified Framework for Orchestrating, Training, and Deploying VLA Agents
arXiv:2609.01281

聊聊这篇文章

评论提交后公开显示,请勿填写私人信息。