自己做具身 Agent 有一段时间了,复现、尝试了不少 Harness,基本都是在真机上。这次选出三个我觉得不错的工作:Show-Harness、GPT-Policy 和 Harness VLA。它们都有开放代码,可以拿来搭建系统、尝试具体任务,下面简单聊聊各自的特点和我的复现体验。
一、Show-Harness

图源:Show-Harness 官方项目,展示 GUMI 操作界面。
发表时间:2026 年 9 月 9 日(预印本首次提交)。
机构:新加坡国立大学 Show Lab。
链接:论文 · 开源代码
核心特点与优点:这篇很有趣,把机器人操控做成了一个上下左右移动、控制夹爪的“夹娃娃游戏”。感知、策略和动作通过同一套交互串成闭环,处理平面上的移动和抓放任务比较高效。
局限:离散动作的设计也限制了机械臂的动作空间。实际操作更偏向平面任务,遇到需要复杂空间姿态才能抓取的物体,就比较困难。
整体评价:适合作为入门理解 Harness 的 Demo,直观、容易上手。但它能覆盖的任务和性能有限,预先写死的动作规则,也在设计上限制了具身 Agent 本身的能力发挥。
二、GPT-Policy

图源:GPT-Policy 官方项目概览图,截取上下文学习部分。
发表时间:2026 年 9 月 16 日(项目公开发布)。
机构:Morphi Robot、上海创智学院、华中科技大学、复旦大学等。
链接:论文与项目主页 · 开源代码
核心特点:最值得关注的是引入了上下文学习。人类示范视频、机械臂操作视频、目标图像,都可以作为上下文,引导具身 Agent 完成任务,不需要为每个任务重新训练模型。
复现体验与局限:它的动作执行需要经过轨迹规划,因此比较依赖精确的标定。在我的复现中,标定效果不好时,可能出现目标轨迹无法求解、动作不能执行的问题。
整体评价:值得学习它如何把不同形式的示范和任务信息交给 Agent 使用。不过,要在自己的机械臂上跑好,标定和轨迹规划这部分需要先打通。
三、Harness VLA

图源:Harness VLA 论文系统概览图,截取底部动作序列。黄色为 VLA 调用,绿色为规则动作。
发表时间:2026 年 7 月 9 日(预印本首次提交)。
机构:清华大学、Striding AI、普渡大学、中科院自动化所、无问芯穹等。
链接:论文 · 开源代码 RPent
核心特点:前两个工作的动作执行不依赖专门的 VLA,而 Harness VLA 尝试把 VLA 和规则工具结合起来,由 Agent 协调调用。论文整体思路和结合方式都比较好,适合作为具身 Agent 的典型工作来学习。
复现体验与局限:论文实验主要在仿真环境中完成。到了真机上,VLA 与规则工具之间的切换和执行会受到很多实际约束。就我自己的尝试而言,真机效果与论文展示的仿真效果还有很大差距。
整体评价:系统思路值得学习,但从仿真迁移到真机,仍有不少问题需要解决。
尾言
和之前从框架推演相比,在真机实践里发现了很多有趣的东西。
这些东西让我更加确信,具身 Agent 一定能把具身智能带到新的高度。
下一篇,我会把自己的观察和思考整理成一篇观点集,站在拥有信息差的第一线。
聊聊这篇文章