具身智能走到世界模型这一步,“问题”反而更多了
腾讯科技 · 科技资讯
原创 值得关注的 2026-09-05 13:42 北京 机器人究竟需要怎样的“世界观”? 封面图为AI生成 文|李海伦 编辑|徐青阳 具身智能正处在技术路线加速分化的临界点,探索越来越多,新模型、新方法也越来越多。 “谈到具身智能的技术路线,确实有点‘眼花缭乱’”,一位科技领域从业者向腾讯科技表示:“前两年大家还在讲VLA,最近一年又开始频繁讨论世界模型、隐空间这些新方向,也有团队把强化学习、触觉、在线反馈不断加入模型。每家公司都有自己的一套说法,听多了反而更难判断,到底哪条路线更有可能走向未来。” 中国电子学会机器人分会主任委员、香港大学机器人与自动化讲座教授及系主任、新兴技术研究所所长席宁告诉腾讯科技,目前具身的技术路线仍处在“百花齐放”的阶段。不同团队都在尝试各自的方法,哪条路线真正有效,还要经过实践检验;在路线收敛之前,新的思路和方法还会不断出现。 路线的分化还在继续往下延伸。即便都叫“世界模型”,不同团队对它究竟该学什么、解决什么问题,也有不同答案。 美国当地时间9月1日,斯坦福大学教授李飞飞团队发布了全球首个多模态世界模型Atlas,其核心能力围绕“理解和模拟3D世界”展开,希望让模型通过物体的位置、形状、距离和空间关系来理解一个世界。 几个月前,李飞飞写过一篇文章《A Functional Taxonomy of World Models》,梳理对“世界模型”思考。她把世界模型按照功能拆成Renderer(渲染器)、Simulator(模拟器)和Planner(规划器):有的负责生成看起来真实的世界,有的试图模拟世界怎样运行,还有一些最终要帮助智能体判断下一步应该做什么。目前所有被称为”世界模型”的东西,其实是这个循环在三个不同方向上的投影。 在李飞飞的分类里, 这三种能力最终可能走向融合,但今天的世界模型显然还处在多条路径并行探索的阶段。 8月24日,图灵奖得主杨立昆等学者发布论文 《LpWM: A Case for Sparse Representations in World Models》 , 进一步研究世界模型应该怎样在内部表示物理世界。论文提出用稀疏表征(sparse representations)替代此前 LeWM 所采用的稠密表征,使得动作发生后的世界状态变化更容易预测,从而降低规划所需的预测器复杂度。 几天后的8月27日,杨立昆等人又发布了LeVJEPA,将此前LeJEPA的学习方法进一步拓展到视频,继续研究AI怎样从视频里理解世界。它希望用更少的计算量,从大量视频中学会物体怎么运动、环境怎么变化,以及前后状态之间的联系。 从产业公司到李飞飞、杨立昆等前沿研究者,其实行业关注的核心都是正在同一个问题: 模型究竟该 如何学会 理解和表征真实 的 世界,并进一步把这种理解转化为预测、规划和行动能力。 围绕这个问题,国内具身智能团队也开始给出各自更具体的技术答案,不同团队也在分别从VLA、世界模型、强化学习等方向推进。 “这也是我们做 物理原生模 型的核心目标:真正去底层理解世界规律,”光象科技创始人兼CEO张涛在近期的一场媒体交流会上表示。 清华系背景的光象科技,最近联合清华大学李升波教授课题组发布了第一代物理原生世界模型 Phi-WM 1.0 ActEffect。 这条路线把重点放在物理状态、状态转移和动作影响上,希望模型能够理解世界如何变化,以及机器人动作会带来什么结果 , 最终指向的是提高机器人的泛化能力。 张涛认为,具身智能接下来真正需要验证的主要是两方面:一个是机器人能否理解物理世界的底层规律,从而在面对新物体、新任务时减少反复试错;另一个则是这种能力能否进入真实场景,解决传统自动化长期难以覆盖的问题,并创造可以量化的生产价值。 在光象实验室首席科学家吕尧看来,物理世界里的“理解”,最终要落实到模型究竟从数据中学到了什么:是继续拟合输入和输出之间的统计关系,还是能够识别出状态如何变化、这些动作为什么会带来不同结果,以及其中哪些信息可以被迁移到新的任务和场景。 “仅靠成功示范做模仿学习,模型之间的差距有限。 真正拉开能力上限的,是同一状态下不同动作及其成败结果形成的反事实数据 。 ” 吕尧说 。 具身行业的数据规模还会继续增长,模型也会继续迭代,但真正拉开差距的,可能会越来越落在 “模型到底学会了什么 ”这件事上。 光象科技创始人兼CEO张涛、光象科技首席科学家吕尧。图片为AI生成 以下为光象科技创始人兼CEO张涛、光象实验室首席科学家吕尧在媒体交流会的精选版实录: 01 让机器人先搞懂“为什么” 问:光象科技发布物理原生世界模型Phi-WM 1.0,这里所说的“物理原生”,具体是指什么? 吕尧: 我们主要有两层理解。 第一,Phi体系从一开始就是面向机器人与真实物理世界交互来设计的。