
上一篇,我们讨论了具身 Agent 如何依托 Claude Code、Codex 这样的智能系统积累经验,让系统与模型持续进化。
但智能系统本身也在变化。随着它的速度和物理世界能力不断提升,今天的具身 Agent 系统会变成什么样?
一、系统会越来越快
具身 Agent 要把现实任务做完,不能只输出一次计划。它需要反复经历:
观察 → Agent 推理 → 机器人行动 → Agent 评估 → 继续或调整。
闭环是它应对现实变化的基础,却也让等待进入了任务执行过程。机器人行动之前,Agent 要理解现场并决定下一步;行动之后,它还要检查结果。若没有成功,系统可能重新观察,选择重试、调整条件,或换用其他能力。
一次判断的等待不一定很长,但任务经过多个循环后,这些等待会累积。Anthropic 的机器人实验给出了一个量级:带一两张图像、没有深度推理的模型调用通常需要 5–15 秒;较高推理强度下,Claude Opus 4.6、4.7 的典型调用需要 15–60 秒。这是该实验记录的单次调用耗时,会随模型和任务条件变化。【1】

因此,系统提速不只是让某个模型更快返回答案。当推理和评估串在连续执行的路径上,缩短每一轮等待,整个具身 Agent 才能更及时地响应物理世界。
二、Agent 会越来越具身
通用 Agent 要真正进入物理世界,核心需要补上两种能力:理解三维空间,以及预测物理变化。前者回答“现在是什么状态”,后者回答“我这样做之后会发生什么”。
更强的 3D 理解
一张相机画面可以让 Agent 认出杯子和机械臂,却未必能让它稳定判断杯子离夹爪有多远、物体之间是否遮挡、夹爪从哪个方向接近更合适。同一个位置在不同视角下也可能看起来很不一样。
这个能力的增强,需要模型从更多具有空间结构的数据中学习。多视角视频让它看到同一场景如何随视角变化;深度、点云、物体姿态和机器人状态提供更明确的三维关系;真机操作则把这些空间判断与实际接近、抓取和放置结果连接起来。
随着模型更稳定地理解位置、距离、方向和可达范围,Agent 就能减少对外部空间描述的依赖,更直接地判断当前动作是否可行、该怎样调整执行条件。
更强的物理预测
理解物体在哪里,还不足以完成操作。Agent 还需要预判:夹爪接触盘沿后盘子会不会滑动,拿起容器后其中的物品会不会洒出,推开障碍物是否真的会让路径变得可用。
物理预测能力需要从行动及其后果中学习。连续视频呈现变化过程;仿真让模型接触更多可控的物理情形;真机轨迹和执行反馈则告诉它,预测在现实中是否成立。世界模型等研究路线尝试把场景变化和交互结果作为可学习的对象,但接触、材质和复杂动作的预测仍有困难。
当 Agent 能更好地预测动作后果,它的规划就不只是安排步骤,还能在行动前判断风险,在行动后解释偏差,再决定重试、调整或调用其他能力。
3D 理解让 Agent 看清现场;物理预测让它理解行动会怎样改变现场。两种能力一起增强,通用 Agent 才会越来越具身。

三、Harness 会越来越简单而强大
Coding Agent 的发展已经提供了一条可观察的经验:模型能力变强后,一些原本需要 Harness、固定规则或专门工具补上的能力,可以逐渐由模型直接承担。系统因此能够减少重复的提示、判断和编排,把精力放在模型仍做不好的部分。
具身 Agent 也可能沿着这条路径演进。今天,Agent 要借助外部感知工具理解三维现场,借助专用模型完成动作,还要依靠 Harness 在各个环节之间传递结果、检查条件并设计恢复流程。复杂的系统设计,往往是在补模型当前的能力缺口。
如果 3D 理解和物理预测逐渐进入基座模型,Agent 可以更直接地认识现场与动作后果。一部分原先要靠多次调用、额外规则和人工编排完成的判断,就可能内化为模型能力。模型越能承担这些判断,Harness 为它补能力的部分就越有机会简化。
简化之后,Harness 仍要连接机器人、模型和工具,接收真实执行反馈,并组织超出 Agent 自身能力范围的任务。专用 VLA、小模型和确定性控制器也仍会承担各自适合的工作。系统可以减少常见任务中的重复环节,同时保留处理新任务和失败的能力。
所以,“越来越简单”不是说机器人任务变得容易,而是模型吸收更多能力后,系统不必长期维持同样繁复的补救结构。更强的 Agent 与更清晰的 Harness 分工,才能让整个系统一起变强。

现实正在回应这一趋势
我在今年 7 月和朋友讨论这些变化时,Anthropic 的 MHS 和 OpenAI 的 GPT-6 Astra 尚未发布。到了八月底和九月初,这两个变化先后出现,也让当时关于通用 Agent 进入物理世界的判断,开始有了可以观察的现实进展。
2026 年 8 月 27 日,Anthropic 发布 MHS(Model Hardware Standard,模型硬件标准)的研究预览,让 Agent 可以通过通用接口操作机械臂等物理设备。【2】
9 月 3 日,OpenAI 发布 GPT-6 Astra。【3】随后,开发者和研究者陆续把通用模型接入相机、控制工具和机械臂,让它根据现场反馈尝试完成物理任务。【4】
下一篇,我们再讨论这些变化可能怎样影响行业和企业。
引用与来源
【1】Anthropic,Claude plays robotics,2026。实验日志中的模型调用耗时,用于说明多轮推理的时间量级。原文
【2】Anthropic,Previewing the Model Hardware Standard,2026。MHS 的研究预览、发布日期与物理设备接口范围。原文
【3】OpenAI,GPT-6 Astra: A new generation of intelligence,2026。GPT-6 Astra 的发布日期。原文
【4】RoboCurve,GPT-6 Astra on robot arms,2026。通用模型通过相机、控制工具和现场反馈操作真实机械臂的实验。原文
聊聊这篇文章