AI News Feed
Market watch
Robotics

Knowin Releases GLOW Technical Report, Claiming Robots Can Learn Tasks From a Single Human Demonstration

诺因发布面向通用具身智能的生成式学习架构GLOW技术报告,称机器人可通过一次人类演示实现跨物体、跨环境、跨任务复用,并在RoboDojo、LIBERO-Pro及Embodied Arena等评测中取得领先成绩。

报告将GLOW的核心能力表述为“一教就会”。按其描述,用户无需把需求拆解为机器指令,机器人可将人的一次完整操作、当前环境、自身状态与执行历史放在同一链路中理解,捕捉物体、空间关系、动作顺序和状态变化,再把画面、物品关系与执行反馈转化为行动。

报告列举了开盒收纳、浇水、擦桌和调酒四类任务。开盒收纳包含开盖、放物、合盖三个步骤,机器人在更换盒子与物品后仍可按人类操作顺序完成动作;浇水任务中,人类演示使用黑色细嘴壶,执行时换成绿色浇水壶,机器人仍会调整抓取位置与动作姿态;擦桌任务中,机器人可复现人类沿心形轨迹移动抹布的动作;调酒任务涉及多个酒杯和倾倒顺序,机器人需自行匹配现场酒杯并按序完成取杯、倾倒、回正、放回。

GLOW由四个模块构成。KnowinGLOW是统一的多模态自回归模型,将视觉理解、语义解析、空间推理、任务规划与动作生成整合在同一模型内,取代“视觉模块+动作模块”的拼接方案。KnowinDream是合成具身经验引擎,以完整交互经历为训练单元,记录世界状态、行动过程与物理后果,并通过改变光照、材质、纹理、背景以及家庭场景、相机视角和机器人配置来扩展训练条件。

KnowinWorld负责动作条件下的世界推演,评估碰撞风险、接触稳定性与路径可达性等物理约束,训练阶段可替代真机进行试错推演,运行阶段可在动作执行前预判风险。KnowinAgent(Harness)是上下文驱动的任务运行系统,持续记录执行节点并接收实时反馈,出现偏差时就地修正,在接近瓶口、碗沿、抽屉把手等精细区域时切换为小幅微调模式,以维持长程任务的连续性。

报告称,用户在完成一次操作后,系统会把整个过程编码为可复用的技能信息;执行新任务时,模型无需重新训练或更新参数,而是结合眼前环境、机器人状态、任务进展和历史反馈实时判断下一步。系统学习的目标是任务目标、物品关系以及环境变化后的继续完成方式,而非人的手臂经过的具体位置。

报告披露了GLOW在RoboDojo、LIBERO-Pro及Embodied Arena中的评测结果。在RoboDojo的18项仿真任务中,GLOW取得62.2%的平均成功率和71.1分的平均得分,报告称较GPT-6(Robocurve)基线分别高出40个百分点和41.3分。

在LIBERO-Pro的Object、Goal与Spatial六个扰动分项中,GLOW独立运行的平均成功率为86.7%。报告称,这一成绩较GPT-6 Astra的58.2%提升28.5个百分点,六项中五项领先,位列单策略模型第一,领先第二名单策略模型ASPIRE 15个百分点。在Embodied Arena的2D-Embodied QA Benchmarks榜单中,KnowinBrain-1.5以65.62的综合得分在20个参评模型中排名第一,该成绩由九项基准分数计算得出,覆盖第一视角理解、时空定位、目标驱动规划、物理推理等维度。

报告还提及,GPT-6 Astra发布后,行业对具身智能技术路线的讨论增多。报告认为,通用大模型正在展现操控机器人的能力,而自回归架构正成为模型架构的收敛方向,具身智能的竞争核心将转向数据与学习方式。诺因表示,将继续推进GLOW的物理学习与泛化能力,使机器人在变化环境中自主执行任务。