
机器人基础模型正在从针对单一任务和单一平台训练的专用策略,逐渐走向能够共享数据、技能和表征的通用模型。随着训练规模扩大,机器人已经可以在更多任务、场景和物体之间迁移能力,但机器人学习仍然存在一个语言和视觉模型不需要面对的变量:身体本身也会变化。
不同机器人拥有不同的运动学结构、几何尺度、传感器位置、末端执行器、驱动方式和动力学特征。同一个任务在人手、刚性机械臂、双臂系统或柔性机器人上,可能对应完全不同的观察和动作。如果模型学到的任务能力与某一种身体的感知和控制方式紧密耦合,那么每增加一种机器人,都需要重新建立一部分原本已经获得的能力。
Fi 是擎羽对 Foundation Intelligence 的长期研究方向。Fi0 是这一方向下的第一代跨本体基础模型,我们希望研究一种更通用的机器人学习范式:将可以跨本体复用的任务与世界知识,与依赖具体身体的动作生成联系起来,使模型能够在身体发生变化时保留对任务和物理过程的理解,并根据当前本体重新组织行动。
Fi0 将语言、视觉、人类示范、环境状态和机器人本体共同作为模型的上下文。语言描述任务目标,视觉和环境状态提供当前世界的信息,本体表征描述机器人正在使用怎样的身体;当已有训练没有覆盖当前任务时,一段人类 demonstration 还可以作为 skill context,在推理过程中向模型提供新的任务信息。
这意味着 Fi0 需要同时解决两个相互关联、但并不相同的问题:理解一个任务需要在物理世界中发生什么,以及确定当前这副身体应该如何让它发生。
大多数机器人技能仍然通过训练获得。遇到新的任务,通常需要采集新的机器人数据,再通过训练或微调把这些经验写入模型参数。对于开放世界中的机器人而言,这条链路很难覆盖不断出现的新任务和新的操作组合。
Fi0 因此将一部分技能获取转化为 context learning 问题。对于已经包含在模型能力范围内的任务,Fi0 可以直接根据语言指令和当前观察生成动作;对于训练中没有直接覆盖的任务,人类示范可以在推理时作为额外上下文输入模型,而无需先针对这一任务完成一次新的参数更新。
这里的关键并不是把人的运动轨迹映射成机器人的运动轨迹。一次示范同时包含了对象选择、任务顺序、状态变化、接触建立与解除以及最终目标等信息,而具体的手部轨迹只是这些任务约束在人类身体上的一次实现。Fi0 将示范编码为 skill context,使模型能够从中获得关于任务结构和交互过程的信息,再结合当前环境与机器人本体生成动作。
这种表示方式尤其适合跨本体学习。一个杯子需要被稳定抓取,一个抽屉需要从关闭状态移动到打开状态,一件物体需要最终到达指定位置;这些目标和物理关系可以跨机器人共享,但人手、两指夹爪、灵巧手和柔性机械臂实现它们的运动方式并不相同。
因此,同一段 demonstration 不需要定义所有机器人的标准动作轨迹。它提供的是关于任务的上下文,而具体行动仍然由当前机器人决定。

跨本体学习同时意味着跨视角学习。
人类 demonstration 通常从第一视角记录机器人需要学习的操作,而真正执行任务的机器人可能通过腕部相机、头部相机、机身相机或外部相机观察环境。即使两个机器人执行完全相同的任务,由于相机位置、视场、运动方式和身体遮挡不同,它们获得的视觉输入也可能具有很大的分布差异。
Fi0 通过跨视角学习建立这些观察之间的联系。模型并不要求人的第一视角与机器人视角具有直接的像素对应关系,而是利用不同视角对同一物理过程的观察,学习相对稳定的世界信息,包括对象状态、空间关系、接触事件、任务阶段以及未来可能发生的变化。
例如,一件物体从桌面被抓起时,第一视角和腕部相机记录的是两段不同的视频,但物体从静止到运动、机器人与物体从分离到接触,以及任务由接近阶段进入操作阶段,这些变化属于同一个物理事件。
通过让不同视角共同约束模型对这些事件的表示,Fi0 希望减少技能与特定摄像机配置之间的绑定,并使来自人类和不同机器人的经验能够进入一个共享的世界表示。
这也是人类示范可以成为机器人上下文的基础:模型不需要让机器人看到与人完全相同的画面,而需要理解两者正在与同一个物理世界交互。

共享世界知识并不意味着忽略身体差异。对于机器人控制而言,身体决定了模型可以采取哪些行动,也决定了相同的控制意图最终会产生怎样的物理结果。
Fi0 将机器人本体作为显式条件输入模型。结构化本体表征描述机器人的运动学拓扑、关节与几何结构、传感器配置、末端执行器、驱动方式以及与行动相关的动态状态,使动作生成建立在对当前身体的条件化之上。
这种设计允许任务表示与动作表示承担不同的角色。模型可以在不同机器人之间共享关于对象、任务阶段和交互关系的知识,同时根据机器人自己的可达空间、自由度、执行器和动力学形成不同的控制序列。
因此,cross-embodiment 并不要求建立一个所有机器人都使用的统一几何动作空间。Fi0 更关心的是学习任务、世界状态、本体与行动之间的条件关系:当任务目标和环境保持不变,而身体发生变化时,什么样的行动仍然能够产生需要的结果。
在这一框架中,本体不再只是数据集中的 robot ID。它成为模型理解行动能力的一部分。

柔性机器人为研究这种关系提供了一个特殊的测试空间。
对于传统刚性机器人,不同本体通常表现为若干离散的平台:六轴机械臂、七轴机械臂、双臂系统或不同类型的末端执行器。柔性机器人的身体差异则可以进一步延伸到连续空间。不同平台和配置可以具有不同的长度、分段数量、刚度和驱动方式,而在一次实际执行过程中,柔性结构的形态本身也会持续变化。
这使 embodiment 不再只是模型在任务开始时获得的一项固定信息。机器人的当前形态和身体状态会持续影响可达空间、接触几何和动作响应,同一个控制目标在不同身体状态下可能需要不同的实现。
Fi0 当前利用擎羽的单臂、双臂和多臂柔性机器人研究这一问题,并将柔性本体的结构参数和动态身体状态纳入本体条件。我们希望借此研究模型能否从多个机器人和多种身体配置中学到关于 embodiment 的连续结构,而不仅仅是在若干已知机器人之间进行离散切换。
柔性机器人因此是 Fi0 当前的重要研究平台,但并不定义 Fi0 的适用边界。相反,我们把它看作一个更严格的 cross-embodiment setting:如果一个模型能够在身体结构和形态持续变化时仍然保持任务知识,并根据新的身体条件调整行为,这种能力也应该能够帮助模型适应更广泛的机器人平台。

本体变化不仅影响机器人能够采取什么动作,也会改变动作产生的后果。即使两个机器人试图完成同一个任务,相似的控制策略也可能因为几何结构、接触方式或动力学不同而带来完全不同的结果。
Fi0 因此不仅生成行动,也对行动之后的世界进行预测。
World Dynamics Model(WDM)以当前世界状态、机器人本体和候选行动为条件,预测这些行动可能导致的未来状态,包括物体运动、接触关系和任务进程的变化。未来预测使模型可以用动作在世界中造成的结果来理解和比较行动,而不仅依赖动作本身与训练轨迹的相似程度。
在此基础上,Multi-Objective Action-World Assessment(MAWA)对候选未来进行评估。不同候选动作可以根据任务进展、成功可能性、物理风险以及模型的不确定性进行比较,并将评估结果用于后续行动选择。
这种机制对于跨本体尤其重要。不同机器人面对同一个任务时,可以产生不同的候选行动,而 WDM 对这些行动分别在当前身体条件下产生的未来进行预测。模型最终需要保持一致的并不是动作形式,而是行动是否把物理世界推向了正确的目标状态。
世界理解因此不仅服务于 perception。对未来的建模直接进入了 control loop。

Fi0 将 context learning、世界表示、本体条件化和未来预测放在同一个问题下研究:机器人已经获得的知识,有多少能够在任务、视角和身体发生变化后继续使用。
新的 demonstration 可以在推理时扩展模型获得的任务上下文;来自人类和不同机器人的视觉经验帮助模型建立关于物理过程的共享表示;更多机器人与身体配置扩大模型学习 embodiment 的空间;机器人真实执行中产生的成功、失败、接触和恢复,则进一步提供行动与物理结果之间的经验。
随着这些经验积累,模型需要逐渐学会区分哪些规律属于任务和世界,哪些约束来自当前身体,以及两者如何共同决定下一步行动。
这也是擎羽构建柔性本体、机器人数据与基础模型的共同出发点。新的本体不仅增加一种可以部署模型的硬件,也增加一种观察和作用于物理世界的方式;新的数据不仅增加任务数量,也增加不同身体与环境发生交互的经验。当这些经验能够被同一个模型共同利用时,每增加一种机器人,不再意味着从头学习一个完全独立的控制系统。
未来的机器人不会只有一种形态。制造、物流、实验室、家庭、医疗以及极端环境对于尺度、力量、精度、顺应性和移动方式具有不同要求,因此机器人身体很可能长期保持多样化。
Fi0 是擎羽在这一方向上的第一步。我们希望构建一种能够随着物理经验持续扩展的基础智能,使任务和世界知识可以在不同身体之间复用,同时让具体行动始终适应正在执行任务的机器人。
这就是我们所说的 Foundation Intelligence Across Embodiments。