具身 Agent 系列 03:系统如何让 VLA 更强?

本文目录
  1. 一、系统如何增强 VLA 的泛化
  2. 二、Agent 如何通过记忆理解能力、复用流程
  3. 三、Agent 如何通过闭环获取记忆
  4. 参考文献

Agent、记忆与评估共同支持 VLA

上一篇,我们谈到,具身智能应该从模型中心走向系统中心,VLA 成为系统可以调用的一种能力。

那么,为什么要把 VLA 放进系统里?这样做究竟有什么好处?

一、系统如何增强 VLA 的泛化

我们可以从两个方面来看:空间泛化和语言泛化。

空间泛化,关注的是物品位置等空间条件变化后,任务还能不能完成。语言泛化,关注的是用户提出不同要求时,系统能不能做出相应的行为。

假设机器人能够拿起桌面中央的物品,但物品放到桌角后,它就容易失败。

Agent 可以先调用其他移动或抓取工具,把物品移到合适的位置,再交给 VLA 执行后续动作。

系统通过调整执行条件,让出现在更多位置的物品,都能进入 VLA 可以处理的范围。

系统先调整物品位置,再调用 VLA

假设我们希望机器人按要求整理桌面:这次收起杯子和书,下次只收文具,另一次则收好所有物品。

如果采用每种任务组合对应一个专门 VLA 的做法,就需要为不同要求准备不同模型。桌面上有五类物品,每一类都可以选择收或不收,就有 32 种组合,其中 31 种涉及实际收取。

但这些任务反复需要的基础动作,可能都是拿起和放下。

Agent 可以理解“这次要整理什么”,选择目标、安排顺序,再反复调用同一个具备拿放能力的 VLA。

原本需要多个专门模型分别覆盖的任务组合,可以由 Agent 编排同一个 VLA 来完成。

Agent 编排同一个 VLA 完成不同任务组合

空间上,系统调整执行条件;语言上,系统理解要求并组织动作。通过这些方式,VLA 已有的能力可以被用到更多任务中。

但这里有一个前提:Agent 得知道 VLA 的能力范围,才能判断什么时候直接调用,什么时候需要先做调整。

它怎样获得并保留这种认识?这就引出了记忆。

二、Agent 如何通过记忆理解能力、复用流程

参考 Harness VLA 论文【1】,我们可以从工具记忆和任务记忆两个方面理解记忆的作用。

Agent 要调用 VLA,需要知道它擅长什么、在什么条件下能完成,以及哪些情况下容易失败。这些关于模型和工具的使用经验,就是工具记忆需要保存的内容。

例如,某个 VLA 擅长拿放桌面中央的物品,那么 Agent 面对桌角的物品时,就可以先安排位置调整,再调用它。

工具记忆让 Agent 对 VLA 的能力范围形成可以复用的认识,从而知道怎样把任务交给合适的能力来执行。

但完成一个任务,往往需要连续调用多个能力。

当系统找到一套有效流程后,也需要把它保存下来,以便下一次完成类似任务时复用。这就需要任务记忆

例如,整理桌面可以形成这样的流程:理解用户要求、确定目标物品、逐个检查执行条件、调用拿放能力,最后核对结果。

任务记忆保存这套方法,使系统能够在新任务中沿用有效步骤,并根据当前环境调整。

因此,工具记忆帮助 Agent 知道“手里的能力应该怎样使用”,任务记忆帮助它知道“完成这件事应该怎样组织流程”。

工具记忆与任务记忆

那么,这两类记忆又是怎样来的?

三、Agent 如何通过闭环获取记忆

记忆可以由人提前设定。

人可以告诉 Agent:某个 VLA 擅长什么,调用前需要满足哪些条件,以及一个任务应该怎样完成。

但更重要的方式,是让 Agent 在实际执行中自己获取经验,形成和更新记忆。

这需要一个闭环:

观察 → 结合已有记忆思考 → 执行 → 评估结果 → 更新记忆 → 继续或调整。

执行闭环持续更新记忆,记忆指导后续行动

假设 Agent 第一次处理桌角的物品,直接调用 VLA,没有成功。

它重新观察现场,尝试先调整物品位置,再调用 VLA,并检查物品是否被正确拿起和放下。

如果调整后成功了,系统就获得了一条经验:在这次条件下,先调整位置,再调用 VLA,是有效的。

这条经验可以帮助 Agent 补充对模型能力范围的认识,形成工具记忆。如果一系列步骤能够完成整个任务,还可以被整理为可复用的流程,形成任务记忆。

其中,评估负责判断真实结果是否符合目标。只有检查执行效果,系统才能判断哪些方法有效、哪些需要调整。

记忆也需要保留经验适用的条件,并在后续执行中继续接受检验。随着尝试增多,系统可以补充有效经验、修正错误认识,逐渐形成更可靠的能力理解和任务流程。

闭环让 Agent 获得经验,记忆让经验能够积累并被再次使用。

系统因此能够越来越了解怎样使用 VLA,并把这些经验带入后续任务。

既然 VLA 将作为一种能力,被 Claude Code、Codex 这样的智能系统调用,那么 VLA 本身又需要作出哪些改变,才能更好地适应系统?

下一篇,我们从模型这一侧继续讨论:VLA 应该如何适应具身 Agent 系统?

参考文献

【1】Yixian Zhang 等. Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents. 2026. arXiv:2607.08448.

聊聊这篇文章

评论提交后公开显示,请勿填写私人信息。