AI News Feed
Market watch
Robotics

SeeAct AI穆尧:具身智能终局是从被训练走向自我进化

SeeAct AI创始人穆尧提出,具身智能的规模化不能只靠数据和模型扩张,更需要“经验规模化”,最终走向奖励驱动的递归自我进化。

穆尧现任上海交通大学长聘教轨助理教授,入选国家级青年人才计划,谷歌学术引用超过5000次。2021年,他进入香港大学MMLab,在罗平教授和汤晓鸥教授共同指导下开始具身智能研究。更早之前,他在清华大学读硕士期间研究自动驾驶,坚持端到端Policy和奖励驱动两条技术路线。

他回忆,2017年系统学习强化学习,看到Alpha Go通过奖励驱动、自我规划与自我推演产生超越人类的智能,由此判断奖励驱动可能是人工智能的重要方向。2018年研究自动驾驶时,他主张用神经网络承载策略,并由视觉反馈和奖励驱动决策。当时自动驾驶仍普遍将感知、决策、规划、控制分开,这一观点较为超前。

从自动驾驶转向具身智能后,穆尧认为汽车作为具身智能体,道路类型和动作空间相对有限。2021年他进入香港大学MMLab时,具身智能几乎空白,缺乏成熟数据集和标准Benchmark。2023年大模型出现后,机器人处理复杂长程任务的能力上限被推高。他先后参与EmbodiedGPT、RoboCodex等项目,通过上层大模型做任务拆解、生成底层代码并调用机器人执行器。

RoboTwin从代码生成构建仿真合成数据的路线中发展而来。穆尧团队希望做出学生用游戏本也能运行的机器人引擎和仿真数据管线。RoboTwin 1.0覆盖场景生成、任务生成、数据生成和对早期Policy Model的Benchmark;2.0将任务规模扩大到约50个,并升级行为生成和代码生成;3.0与摩尔线程合作,支持国产显卡和国产物理引擎。穆尧表示,RoboTwin希望成为更大生态,接入不同显卡和引擎。

在代码生成路线趋于完善后,他进一步思考底层API的可扩展性问题,开始做端到端策略基础模型,并形成两类研究:端到端策略基础模型,以及以代码生成为主的Agent System。他认为,当端到端模型成功率足够可用后,可以将其作为Skill嵌入Agent System,上层负责复杂任务推理和拆解,底层作为可扩展、泛化能力较好的Skill被调用。团队随后与智元合作发布RoboClaw。

穆尧将具身智能scaling分为三层:Scale up Data、Scale up Model和Scale up Experience。他认为前两层竞争已白热化,第三层“经验规模化”目前做得不够好。经验规模化强调机器人在与环境交互中持续产生对自身有用的新经验。如果数据主要来自人类演示,机器人学到的是人在特定情况下会怎么做;但机器人自己执行时会遇到什么问题、不同动作会有什么结果、失败后如何调整,仍需要亲身经历。

他以拧瓶盖为例说明,人类演示时抓住瓶盖后可能顺利拧开,机器人执行时可能抓偏或打滑,需要根据实际反馈判断重新抓、调整力度还是换方法。这些交互可以记录成数据用于训练,因此经验和数据并非截然分开。穆尧强调,需要建立持续产生经验的机制,让机器人遇到不会的问题时自主探索,把尝试过程和结果积累下来供后续学习复用。

他进一步区分,Experience Scaling解决经验从哪里来,自我进化解决这些经验如何转化成能力。机器人经历得多并不必然提高能力,中间还需要评价和学习过程。奖励驱动的作用是通过任务结果和环境反馈,让系统判断哪些尝试更有效,并据此改进策略。改进可以发生在底层具体操作,也可以发生在上层任务规划和决策。

穆尧提出“递归自我进化”,即Recursive Self-Improvement:完成一轮提升后,系统可以自主执行出更多经验,且新经验质量高于上一轮。他用学生做题作比,一名学生从只能解决基础题60分的水平,进一步提升后可能做出七八十分的题,由此产生新一轮经验,策略再继续演化。能力提升产生更高质量经验,新经验又推动能力提升。

在穆尧看来,强化学习是自我进化的工具之一,但不是唯一,因为长序任务推理、具体执行等多个维度都需要进化。强化学习可能更多驱动端到端策略进化,而经验总结也可以以文档形式存储,相当于智能体层面的进化。具身自我进化需要策略基座或整套系统协同进化。

他希望自进化系统覆盖从预训练到后训练的完整流程。预训练阶段要给策略基座嵌入自主纠错基因,汇聚来自不同机器人、不同场景、不同任务的自主纠错经验,统一训练进策略基座,使其到新场景后能高效后训练。他提到π₀.₅因预训练嵌入视觉泛化而获得较好评价,对应自主纠错,也需要产生规模化的经验数据。后训练阶段面向用户真正的目标场景,策略需要真正执行,通过交互和反馈快速达到用户满意标准。