8月17日,雷峰网发布对北京大学计算机学院长聘副教授、BeingBeyond智在无界创始人卢宗青的专访。卢宗青表示,当前具身智能领域仍未出现类似Transformer和Next Token Prediction那样具有确定性的基础技术范式,世界模型也未必就是最终答案。

卢宗青团队正在探索隐空间世界动作模型(Latent World-Action Model)。与直接生成视频画面的路线不同,该方法不以像素级画面生成作为核心目标,而是在embedding space中联合预测机器人下一步动作、环境状态以及未来变化。按照其介绍,这种路线更关注机器人控制所需的状态理解和动作决策。
在卢宗青看来,具身领域的“世界模型”不能脱离具体任务讨论。对于机器人而言,模型最终需要将感知输入转化为动作输出,并在真实物理环境中完成闭环控制。因此,模型的骨干架构会直接影响训练成本、推理速度以及能否部署到真实机器人上。
他将当前相关路线大致分为两类:一类是在视频生成模型基础上进行后训练,在生成视频的同时输出动作;另一类则是不生成画面,直接在隐空间中预测后续状态和动作。卢宗青认为,视频生成路线具有较强的展示效果,但像素级预测带来较高训练成本,且机器人实时控制对推理延迟有更高要求。其团队的判断是,在数据量和参数量相同的假设下,隐空间预测的算力成本约为像素空间视频生成模型的1%。这一比例属于团队对两类路线的估算,并非行业统一结论。
数据是这一路线的另一项重点。卢宗青称,团队从2025年开始押注人类第一视角视频数据,并已积累超过50万小时。在其团队此前公布的Being-H0.5工作中,UniHand-2.0融合了人类第一视角手部操作数据、机器人操控数据和视觉语言理解数据,总规模超过35000小时,并覆盖30种机器人形态。相关工作试图通过统一state-action空间,让不同机器人以及人手动作之间形成可共享的操控表示。
卢宗青同时强调,隐空间路线并不意味着技术方向已经被证明。对具身智能而言,真正的验证仍然来自真实机器人和真实场景:模型能否在更换环境、硬件和任务链之后保持稳定,能否处理长程任务、双臂协同以及物理接触,仍需要持续实验。换言之,隐空间可能成为具身智能的重要路径,但它距离行业最终收敛仍有较长距离。