具身 Agent 系列 05:通用 Agent 终将接管物理世界

本文目录
  1. 一、系统会越来越快
  2. 二、Agent 会越来越具身
  3. 更强的 3D 理解
  4. 更强的物理预测
  5. 三、Harness 会越来越简单而强大
  6. 现实正在回应这一趋势
  7. 引用与来源

通用 Agent 终将接管物理世界

上一篇,我们讨论了具身 Agent 如何依托 Claude Code、Codex 这样的智能系统积累经验,让系统与模型持续进化。

但智能系统本身也在变化。随着它的速度和物理世界能力不断提升,今天的具身 Agent 系统会变成什么样?

一、系统会越来越快

具身 Agent 要把现实任务做完,不能只输出一次计划。它需要反复经历:

观察 → Agent 推理 → 机器人行动 → Agent 评估 → 继续或调整。

闭环是它应对现实变化的基础,却也让等待进入了任务执行过程。机器人行动之前,Agent 要理解现场并决定下一步;行动之后,它还要检查结果。若没有成功,系统可能重新观察,选择重试、调整条件,或换用其他能力。

一次判断的等待不一定很长,但任务经过多个循环后,这些等待会累积。Anthropic 的机器人实验给出了一个量级:带一两张图像、没有深度推理的模型调用通常需要 5–15 秒;较高推理强度下,Claude Opus 4.6、4.7 的典型调用需要 15–60 秒。这是该实验记录的单次调用耗时,会随模型和任务条件变化。【1】

当前瓶颈:系统推理太慢

因此,系统提速不只是让某个模型更快返回答案。当推理和评估串在连续执行的路径上,缩短每一轮等待,整个具身 Agent 才能更及时地响应物理世界。

二、Agent 会越来越具身

通用 Agent 要真正进入物理世界,核心需要补上两种能力:理解三维空间,以及预测物理变化。前者回答“现在是什么状态”,后者回答“我这样做之后会发生什么”。

更强的 3D 理解

一张相机画面可以让 Agent 认出杯子和机械臂,却未必能让它稳定判断杯子离夹爪有多远、物体之间是否遮挡、夹爪从哪个方向接近更合适。同一个位置在不同视角下也可能看起来很不一样。

这个能力的增强,需要模型从更多具有空间结构的数据中学习。多视角视频让它看到同一场景如何随视角变化;深度、点云、物体姿态和机器人状态提供更明确的三维关系;真机操作则把这些空间判断与实际接近、抓取和放置结果连接起来。

随着模型更稳定地理解位置、距离、方向和可达范围,Agent 就能减少对外部空间描述的依赖,更直接地判断当前动作是否可行、该怎样调整执行条件。

更强的物理预测

理解物体在哪里,还不足以完成操作。Agent 还需要预判:夹爪接触盘沿后盘子会不会滑动,拿起容器后其中的物品会不会洒出,推开障碍物是否真的会让路径变得可用。

物理预测能力需要从行动及其后果中学习。连续视频呈现变化过程;仿真让模型接触更多可控的物理情形;真机轨迹和执行反馈则告诉它,预测在现实中是否成立。世界模型等研究路线尝试把场景变化和交互结果作为可学习的对象,但接触、材质和复杂动作的预测仍有困难。

当 Agent 能更好地预测动作后果,它的规划就不只是安排步骤,还能在行动前判断风险,在行动后解释偏差,再决定重试、调整或调用其他能力。

3D 理解让 Agent 看清现场;物理预测让它理解行动会怎样改变现场。两种能力一起增强,通用 Agent 才会越来越具身。

Agent 进入物理世界,需要 3D 理解和物理预测

三、Harness 会越来越简单而强大

Coding Agent 的发展已经提供了一条可观察的经验:模型能力变强后,一些原本需要 Harness、固定规则或专门工具补上的能力,可以逐渐由模型直接承担。系统因此能够减少重复的提示、判断和编排,把精力放在模型仍做不好的部分。

具身 Agent 也可能沿着这条路径演进。今天,Agent 要借助外部感知工具理解三维现场,借助专用模型完成动作,还要依靠 Harness 在各个环节之间传递结果、检查条件并设计恢复流程。复杂的系统设计,往往是在补模型当前的能力缺口。

如果 3D 理解和物理预测逐渐进入基座模型,Agent 可以更直接地认识现场与动作后果。一部分原先要靠多次调用、额外规则和人工编排完成的判断,就可能内化为模型能力。模型越能承担这些判断,Harness 为它补能力的部分就越有机会简化。

简化之后,Harness 仍要连接机器人、模型和工具,接收真实执行反馈,并组织超出 Agent 自身能力范围的任务。专用 VLA、小模型和确定性控制器也仍会承担各自适合的工作。系统可以减少常见任务中的重复环节,同时保留处理新任务和失败的能力。

所以,“越来越简单”不是说机器人任务变得容易,而是模型吸收更多能力后,系统不必长期维持同样繁复的补救结构。更强的 Agent 与更清晰的 Harness 分工,才能让整个系统一起变强。

能力内化后,Harness 更简洁、更强大

现实正在回应这一趋势

我在今年 7 月和朋友讨论这些变化时,Anthropic 的 MHS 和 OpenAI 的 GPT-6 Astra 尚未发布。到了八月底和九月初,这两个变化先后出现,也让当时关于通用 Agent 进入物理世界的判断,开始有了可以观察的现实进展。

2026 年 8 月 27 日,Anthropic 发布 MHS(Model Hardware Standard,模型硬件标准)的研究预览,让 Agent 可以通过通用接口操作机械臂等物理设备。【2】

9 月 3 日,OpenAI 发布 GPT-6 Astra。【3】随后,开发者和研究者陆续把通用模型接入相机、控制工具和机械臂,让它根据现场反馈尝试完成物理任务。【4】

下一篇,我们再讨论这些变化可能怎样影响行业和企业。

引用与来源

【1】Anthropic,Claude plays robotics,2026。实验日志中的模型调用耗时,用于说明多轮推理的时间量级。原文

【2】Anthropic,Previewing the Model Hardware Standard,2026。MHS 的研究预览、发布日期与物理设备接口范围。原文

【3】OpenAI,GPT-6 Astra: A new generation of intelligence,2026。GPT-6 Astra 的发布日期。原文

【4】RoboCurve,GPT-6 Astra on robot arms,2026。通用模型通过相机、控制工具和现场反馈操作真实机械臂的实验。原文

聊聊这篇文章

评论提交后公开显示,请勿填写私人信息。