具身 Agent实践部分:推荐我复现过的三个开源工作

本文目录
  1. 一、Show-Harness
  2. 二、GPT-Policy
  3. 三、Harness VLA
  4. 尾言

自己做具身 Agent 有一段时间了,复现、尝试了不少 Harness,基本都是在真机上。这次选出三个我觉得不错的工作:Show-Harness、GPT-Policy 和 Harness VLA。它们都有开放代码,可以拿来搭建系统、尝试具体任务,下面简单聊聊各自的特点和我的复现体验。

一、Show-Harness

Show-Harness:通过 GUMI 界面操作机器人

图源:Show-Harness 官方项目,展示 GUMI 操作界面。

发表时间:2026 年 9 月 9 日(预印本首次提交)。
机构:新加坡国立大学 Show Lab。
链接论文 · 开源代码

核心特点与优点:这篇很有趣,把机器人操控做成了一个上下左右移动、控制夹爪的“夹娃娃游戏”。感知、策略和动作通过同一套交互串成闭环,处理平面上的移动和抓放任务比较高效。

局限:离散动作的设计也限制了机械臂的动作空间。实际操作更偏向平面任务,遇到需要复杂空间姿态才能抓取的物体,就比较困难。

整体评价:适合作为入门理解 Harness 的 Demo,直观、容易上手。但它能覆盖的任务和性能有限,预先写死的动作规则,也在设计上限制了具身 Agent 本身的能力发挥。

二、GPT-Policy

GPT-Policy:人类视频、视频与动作、目标图像、交互和自身历史构成上下文

图源:GPT-Policy 官方项目概览图,截取上下文学习部分。

发表时间:2026 年 9 月 16 日(项目公开发布)。
机构:Morphi Robot、上海创智学院、华中科技大学、复旦大学等。
链接论文与项目主页 · 开源代码

核心特点:最值得关注的是引入了上下文学习。人类示范视频、机械臂操作视频、目标图像,都可以作为上下文,引导具身 Agent 完成任务,不需要为每个任务重新训练模型。

复现体验与局限:它的动作执行需要经过轨迹规划,因此比较依赖精确的标定。在我的复现中,标定效果不好时,可能出现目标轨迹无法求解、动作不能执行的问题。

整体评价:值得学习它如何把不同形式的示范和任务信息交给 Agent 使用。不过,要在自己的机械臂上跑好,标定和轨迹规划这部分需要先打通。

三、Harness VLA

Harness VLA:VLA 动作与规则动作交替执行

图源:Harness VLA 论文系统概览图,截取底部动作序列。黄色为 VLA 调用,绿色为规则动作。

发表时间:2026 年 7 月 9 日(预印本首次提交)。
机构:清华大学、Striding AI、普渡大学、中科院自动化所、无问芯穹等。
链接论文 · 开源代码 RPent

核心特点:前两个工作的动作执行不依赖专门的 VLA,而 Harness VLA 尝试把 VLA 和规则工具结合起来,由 Agent 协调调用。论文整体思路和结合方式都比较好,适合作为具身 Agent 的典型工作来学习。

复现体验与局限:论文实验主要在仿真环境中完成。到了真机上,VLA 与规则工具之间的切换和执行会受到很多实际约束。就我自己的尝试而言,真机效果与论文展示的仿真效果还有很大差距。

整体评价:系统思路值得学习,但从仿真迁移到真机,仍有不少问题需要解决。

尾言

和之前从框架推演相比,在真机实践里发现了很多有趣的东西。

这些东西让我更加确信,具身 Agent 一定能把具身智能带到新的高度。

下一篇,我会把自己的观察和思考整理成一篇观点集,站在拥有信息差的第一线。

聊聊这篇文章

评论提交后公开显示,请勿填写私人信息。