具身 Agent 系列 06:具身智能行业会被大模型吞并吗?

本文目录
  1. 一、具身智能行业可能沦为大模型的附庸
  2. 二、具身 Agent 会推动行业的真实进步
  3. 三、公司会重新站位
  4. 尾言

具身智能行业会被大模型吞并吗?

上一篇讨论了通用 Agent 进入物理世界后,具身系统可能如何变化。接下来更尖锐的问题是:当大模型自己开始操控机器人,具身智能行业会得到帮助,还是会被它吞并?我认为,两种结果可能同时发生。

一、具身智能行业可能沦为大模型的附庸

GPT-6 Astra 发布后,通用大模型在机器人任务上的表现已经不只是概念演示。在公开的零样本测试中,它直接通过相机和控制工具完成任务,表现明显压过专门的 VLA 模型。这让多种具身模型路线都面临同一个问题:如果大模型无需针对任务重新训练,就能做出更好的结果,具身模型凭什么继续占据机器人系统的智能中心?

更让人不安的是进步速度。大模型的视觉理解、推理和工具使用能力不断随新一代模型抬升;从“看懂任务”到“自己组织行动”,能力边界正在快速外扩。反观具身模型,π0.5 开源至今已有一年,我看到的真实环境能力进步,远没有行业对世界模型、WAM 和具身基模的预期增长得快。一边是通用智能快速进入物理世界,一边是具身行业投入大量训练和数据,却仍难以交出同样幅度的真实效果变化。

这直接改变了现有行业的处境。如果大模型继续补上空间理解和物理预测,具身模型可能不再是机器人系统的智能中心,而只是大模型调用的一种动作接口。那些把世界模型或 WAM 作为未来行业入口、据此获得高估值的公司,也会面对一个尴尬的问题:大模型已经能从外部做成任务,自己的模型还能凭什么占据中心?最激进的结论是,整个具身智能行业可能不再独立决定机器人的智能方向,而会沦为大模型行业的附庸。

智能中心可能从具身模型转移到通用大模型

但行业地位被冲击,不等于机器人技术会受损。对现有公司的估值叙事,这可能是坏消息;对长期缺少真实效果突破的具身智能,这也可能是一次机会。

二、具身 Agent 会推动行业的真实进步

具身 Agent 提高泛化能力有两条路径。部署时,系统帮助现有模型理解目标、调整执行条件,并根据行动结果重试或恢复。例如,同样是把杯子放进收纳盒,杯子换了位置、盒子被其他物体挡住,Agent 可以先调整现场,再调用模型已有的放置能力。训练时,系统把这些任务中的成功轨迹、失败经验和调整过程整理成更多样的数据,回流训练,让下一代模型有机会掌握更多能力。

这种变化表现为:面对新指令、新物体或环境变化,机器人不再只能等待一个专门为该场景训练的策略。它可以尝试已有能力,发现抓取位置不合适后改变接近方向,放置失败后重新观察并调整流程。随着数据回流,部分原本需要系统帮助完成的任务,也可能逐渐由模型更稳定地完成。

部署增强与数据回流共同推动泛化能力增长

泛化增强,机器人才能走出反复准备过的固定演示,进入更多真实场景:同一台机器人可以面对不同桌面、不同物品组合和执行中的意外,而不必每换一种情况就从头训练。可用任务范围扩大、陌生环境下完成任务的能力提高,才是具身 Agent 带给行业的真实进步。但这份进步不会平均落到每家公司,接下来就看企业会怎样分化。

三、公司会重新站位

把重宝押在自有具身模型上的公司,可能会经历波折。如果通用大模型能承担越来越多的任务理解和决策,单靠“我们的模型更大、更通用”就难以维持原有地位。这些公司需要证明自己的模型在精细动作、实时控制或复杂物理交互中有什么独特价值,也需要把模型放进现实闭环,而不是只展示孤立的模型成绩。

重视系统的公司可能更容易适应这轮变化。具身 Agent 需要把模型、Harness 和具身控制接成一条能运行的链:理解任务、选择能力、执行动作、检查结果,失败后继续调整。已经积累真机任务和执行反馈的团队,可以把更强的通用 Agent 接入现有系统,较快地检验它究竟让机器人多完成了什么。

这轮变化还可能带来一次平权。过去,想做“具身大脑”的团队,往往需要训练自有大模型,准备大量显卡和数据,才有资格进入竞争。现在,团队可以先调用现成的大模型,搭建 Harness,把它接到机器人上,用具体任务检验效果。竞争的起点因此可能重新降低:更多公司有机会靠系统能力和真实结果,站到新一轮竞争的前排。

重押模型、重视系统与新进入团队在新一轮竞争中重新站位

尾言

具身智能确实是个令人激动的行业。世界模型刚火热了半年左右,新一轮技术变化又已经开始。无论它给现有行业带来冲击还是机会,机器人能做什么、谁能把它做出来,都在快速变化。

行业和公司正在重新站位,个人也要回答自己的问题。系列最后一篇,也是我认为最核心的一篇:已经进入具身智能行业,或正准备进入的人,应该如何准备,才能跟上具身 Agent 时代?

聊聊这篇文章

评论提交后公开显示,请勿填写私人信息。