AI技术文章

PhyAgentOS v1.0.0 正式发布,开启物理智能递归自进化时代 | GAIR Paper 128

作者:PhyAgentOS team0 次浏览 来源:AI科技评论
PhyAgentOS v1.0.0 正式发布,开启物理智能递归自进化时代 | GAIR Paper 128

模型竞争的下一站,是让智能体在真实世界里可执行、可验证、可进化。

模型竞争的下一站,是让智能体在真实世界里可执行、可验证、可进化。

从 OpenAI 开源 Codex Harness,到 DeepSeek 提出“一切皆插件”,再到 Anthropic 发布模型硬件标准 MHS,头部实验室的动作指向同一个判断:模型竞争的下一站,是让智能体在真实世界里可执行、可验证、可进化。而RSI(Recursive Self-Improvement,递归自进化)的核心,正是让经过验证的改进进入下一轮。

无独有偶,两个月前悄然开源的 PhyAgentOS,如今交出了它的正式版答卷。8 月 31 日,面向物理世界的 RSI 基础设施PhyAgentOS v1.0.0正式发布。它为物理智能模型补上了最关键的一块拼图,每一次动作的执行有据可查,每一次任务的成败有据可验,只有经过验证的经验才能沉淀下来、反哺下一轮进化,从模型决策、物理执行到经验回流,递归自进化的完整闭环就此形成。

该框架由 X-Era Lab(拓元智慧)、中山大学 HCP 实验室与鹏城国家实验室具身智能研究所联合研发,2026 年 7 月开源后即持续迭代,Star 数已超过 2000。

Github: https://github.com/PhyAgentOS/PhyAgentOS-core

项目网站:https://phy-agent-os.x-era.com/

技术报告:https://arxiv.org/pdf/2607.16636

01

从动作结束到任务验收:

一条物理执行主线,两条可信闭环

在物理世界里,动作做完和事情做成,是两回事。机械臂走完了轨迹,夹爪也合上了,但目标物抓没抓稳、放没放对位置,传统框架往往无从回答。PhyAgentOS v1.0.0 将执行过程纳入同一条链路,让每一步都能被追问到底。

文章配图

图 1|PhyAgentOS 新版总体架构:一条物理执行主线,两条可信闭环。

在这条链路中,Agent 规划目标,动作经 Forge Tool API 进入 ToolEndpoint 与 Dora 数据流直达机器人,AgentTask 全程留痕,Evidence 与 Verifier 依据现场证据验收结果。其中 Forge Gateway 只做“守门人”,负责能力发现、路由与执行状态管理,不替用户定义什么叫成功。而得益于统一的 Tool 契约,更换模型、仿真器乃至机器人本体时,上层应用一行代码都不用改。

执行可信了,接下来的问题自然浮现:如何把这份"可信"沉淀为可复用的工程秩序?PhyAgentOS的选择,是从给物理动作"立规矩"开始。

02

核心演进与模块升级,

从给物理动作“立规矩”开始

物理世界不像代码,点错了可以撤销重跑。所以 v1.0.0 立的第一条规矩,就是把“看”和“动”彻底分开。Forge Query 负责看,只读取状态、只做不改变环境的计算。Forge Action 负责动,每一次真实的物理动作都必须从它这里发起。而且 Gateway 收下动作,只代表任务排上了队,不代表事情办成了。一旦遇到超时、取消或结果未知,系统不会盲目继续,而是先回头核实现场,再决定下一步。

第二条规矩,是让每种信息规范在对应的文件中。人和 Agent 要读的长期知识,继续留在 AGENTS.md、SKILL.md 这类 Markdown 文件里。真正跑起来的执行,一律走 Forge Tool API。执行中产生的事实,则交给 AgentTask、PlanRevision 与 Evidence Bundle 这些结构化记录来保管。旧版那套靠轮询 Markdown 文件来驱动执行的做法,就此退出历史舞台。

文章配图

图 2|协议精简不是放弃 Markdown,而是让知识、执行与事实分别进入合适的载体。

第三条规矩,是任何结论都要拿证据说话。Query 和 Action 记下执行了什么,图像和机器人状态记下现场什么样,Verifier 则拿着目标和成功标准独立验收。证据本身也不是拿来就用,格式、大小、来源、时序,四道关一道都不能少。如果验收没通过,系统不会推倒重来,而是在原任务上追加一次 PlanRevision,带着此前的动作、证据和判断,换个计划接着干。

文章配图

图 3|执行事实、现场证据与任务结论彼此独立,Verifier 负责把它们组织成可检查的验收结果。

文章配图

PhyAgentOS 任务验证与重新规划能力演示

立完规矩,能力本身也被纳入工程化管理。Skill 沉淀任务方法,Tool 代表当前可调用的能力,Skill Runtime 则像一位尽职尽责的“管家”,包揽安装、启动、健康检查与生命周期管理。每个 Skill 都打包完整分发,经过校验之后才会上线,安装前还会自动确认 Gateway 和所需 Tool 是否就位。内置的 move-arm-by-ee Skill、benchmark skill 开箱即用,一行命令启动对应的 Dora profile,状态查询、末端运动和夹爪动作即刻就绪。

文章配图

图 4|Skill 指导 Agent,Tool 进入 Forge 执行;经过验证的任务经验再通过门槛形成新 Skill 或 Scoped Lesson。

文章配图

PhyAgentOS 通过安装 Skill Runtime实现特定技能

03

具身 RSI:

拒绝过拟合的受控进化闭环

让系统自我进化,最难的从来不是“进化”本身,而是分得清什么是真经验。一次偶然的抓取成功,可能是目标物恰好停在了顺手的位置,可能是摩擦力帮了忙。如果照单全收,系统学到的就不是方法,而是运气。PhyAgentOS 的回答很克制,只有经过验证的 AgentTask,才有资格进入经验的提炼流程。

系统会把每个任务的目标、计划修订、工具轨迹、验证结果和证据指纹,整理成一份完整的 TaskEpisode,然后按成色分流。稳定可复现的流程,晋升为 SkillCandidate 候选技能。反复出现的工作流问题,记为 FailureObservation,等待修复。至于设备掉线、网络抖动、证据不足这类“环境噪音”,只留下一份诊断记录,绝不混进经验库。该学的一课不落,不该学的一点不沾。

门槛还不止于此。一个 Skill 想正式晋升,一条 Lesson 想被激活,都必须有多个相互独立的任务共同背书,再通过结构与安全两道检查。具体坐标、凭据、Endpoint、可执行 ID,以及任何试图绕过 Forge 或 Verifier 的指令,一律不得写入 Skill。内置 Skill 同样动不得,新版本只以 workspace override 的形式叠加,历史版本完整保留。就算写入或演进中途失败,也不会殃及原任务的执行结果。

所以,v1.0.0 所谓的“自进化”,走的是一条刻意求慢的路。先执行,后验证。先积累独立证据,再抽象成经验。先通过边界检查,才允许影响下一次任务。让每一步进化都踩在证据上,这才是物理世界里可持续的 RSI。

文章配图

PhyAgentOS 技能进化与经验沉淀功能演示

04

严谨基准:三大具身 Benchmark

验证真实泛化增益

自进化是否真实有效,最终要拿数据说话。PhyAgentOS 将任务分发、环境重置、策略执行、证据采集、失败分析和报告生成纳入 AgentTask 与 Forge 流程。评测分为两个口径:First attempt 记录策略首次运行成绩,Final outcome 记录有界恢复后的最终结果;两者分开统计,重试不计作新 episode。

文章配图

在 LIBERO 上,X-VLA 首次失败的 54 个 episode 中有 26 个经分析和恢复后完成,最终失败数降至 28,过程中未修改策略模型代码。Benchmark Skills 还支持用自然语言选择基准、策略和任务范围,并输出包含任务来源、失败证据和复现配置的结构化报告。

文章配图

Video: Automated evaluation of OpenVLA implemented on theLiberobenchmark

05

生态扩展与升级收益:

从 43 种构型到 1.0.0 产品周期

能力闭环之外,v1.0.0 的生态版图也在快速扩张。截至 v1.0.0,PhyAgentOS 支持的机器人构型由 19 种增至 43 种,覆盖机械臂、四足、人形、移动操作平台和灵巧手;其中 9 种支持真机运行,包括 PIPER、GO2、G1、SO-101、GR-3、Astra-Pro、H1-Pro、Lekiwi 与 Stella 灵巧手。

算法节点由约 4 个增至 9 个,覆盖 Pi0.5、SmolVLA、VLA-JEPA、LingBot-VA、FastWAM、SAM3、YOLO、ACT 与 Diffusion Policy,另有 11 个节点列入路线图。新机器人通过 ToolSpec、Query / Action ToolEndpoint 和 manifest v2 Skill Bundle 接入,无需改动 Agent 调度层。

项目采用 dev 日常更新、main 版本发布的双轨机制。核心仓库已迁至 PhyAgentOS 组织并更名为 PhyAgentOS-core,相关文档同步更新。截至发稿,GitHub Star 数接近 2000;9 月将启动机械臂 Agent、跨构型迁移和仿真到真机等技术直播。

PhyAgentOS 采用 MIT 协议开源。X-Era Lab 是主要工程贡献者和首批真实场景部署方,XLeRobot、松灵、睿尔曼和零次方参与官方维护。统一 Tool 契约减少模型对单一机器人接口的绑定,也为机器人、仿真和教学场景提供一致的任务记录与验证链路。

06

快速上手:五行命令开启

递归自进化物理智能探索

运行以下命令即可开始:

git clone https://github.com/PhyAgentOS/PhyAgentOS-core.git

cd PhyAgentOS-core

python -m pip install -e .

paos onboard

paos agent

加载机器人 Skill:

paos skill install move-arm-by-ee

paos skill start move-arm-by-ee --profile mujoco

paos skill status move-arm-by-ee

Forge Gateway 需根据 Skill Runtime 与环境单独启动。PhyAgentOS 也支持 LIBERO、CALVIN、RoboCasa365、Isaac Sim 和真实机器人。

07

结语:让物理行动可核对、

让进化经验可复用

模型能力不断提升,但真实环境还要求系统说明:动作经过什么边界、结果由哪些证据支持,失败后如何继续。

PhyAgentOS v1.0.0 将这些环节放进同一条链路:Agent 负责目标与策略,Forge 负责执行,AgentTask 记录过程,Evidence 保存现场,Verifier 判断结果,Skill Runtime 管理能力,Evolution 只沉淀经过验证的经验。

这套分工让任务结果可检查,失败过程可复盘,验证过的经验可继续使用。物理智能体的递归自进化,由此变成可落地的基础设施。

文章来自于"AI科技评论",作者 "PhyAgentOS team"。

相关主题

读完之后

加入 AINRK 交流群

了解加入交流群的方式,与更多 AI 从业者交流。

查看交流群说明(在新窗口打开)