李飞飞最新洞察:空间智能最终是 4D 的,World Labs 正在押注下一种 Scaling

有新Newin · 商业与创投

原创 有新 2026-09-05 16:29 浙江 World Labs 最新发布的 Atlas,把过去长期分开的像素生成和 3D 重建放进了同一个模型,并把新视角预测(New View Prediction)设成最基础的任务...... World Labs 最新发布的 Atlas,把过去长期分开的像素生成和 3D 重建放进了同一个模型,并把新视角预测(New View Prediction)设成最基础的任务, 即给定一个场景的若干图像、视频或者描述,Atlas 会把这些信息放进同一个空间上下文,再让虚拟相机移动到其他位置,预测从那里应该看到什么。 World Labs 联合创始人李飞飞在本周 a16z 节目中与 Justin Johnson、Ben Mildenhall 以及 a16z 合伙人 Martin Casado 等人进一步介绍了 Atlas。 相比此前已经公开的模型能力,这场对谈更重要的信息,是团队第一次比较完整地解释了为什么选择新视角预测,以及这条路线如何从 3D 重建延伸到动态世界、机器人和行动规划。 World Labs 对 Atlas 的核心押注是,新视角预测在空间智能中的作用 ,可能类似 Next Token Prediction 在大语言模型中的作用。 如果这个判断成立,Atlas 的意义就不只是一款新的 3D 或视频模型,而是在尝试寻找一个可以伴随模型规模和数据持续 Scaling 的空间智能基础任务。 ▍ 生成和重建开始合流 Atlas 和普通视频生成模型之间,一个重要区别,是「视角」不再只是 Prompt 中的描述,而成为模型可以直接理解的输入。每一张进入 Atlas 的图像都可以对应明确的 3D 相机位姿,相机在哪里、朝向哪里,以及这个位置对应的 RGB 和 Depth Map,都可以成为模型空间上下文的一部分。 这让生成过程获得了更明确的空间约束。Ben Mildenhall 把传统视频生成形容得更直观:很多时候仍然有些像「老虎机」,用户通过文本告诉模型想要什么,再不断重新生成,直到得到满意的镜头。Atlas 则可以直接规定内容所在的位置、相机从哪里经过以及朝哪里看。 这背后对应的是两条过去长期分开的计算机视觉路线。生成模型擅长创造现实中没有出现过的像素,传统 3D 重建则依赖多个视角之间的几何关系,尽可能准确地恢复真实空间。前者可以想象,但不一定空间准确;后者足够准确,却只能恢复真正被相机观察到的部分。 Atlas 第一次在同一个模型架构中同时处理生成和 3D 重建 。 模型从预训练阶段开始就原生处理文本、图像、视频、相机位姿和 3D 信息,而不是先生成图像,再外挂一套传统 3D 系统完成空间恢复。 李飞飞认为,这一点的重要性容易被低估。计算机视觉发展超过半个世纪,像素生成、识别和 3D 重建长期属于不同研究方向,大量研究分别围绕这些任务展开。Atlas 则以 Viewpoint 为连接点,把生成与重建放进同一个模型。 对于空间智能来说,这种统一还有进一步的意义。最终的模型不仅要生成空间,还需要理解其中的几何结构、物体关系和物理规律,再进一步完成渲染、模拟和行动规划。李飞飞认为, 生成像素只是其中相对早期的一步, 更难的问题是让生成出来的像素真正拥有空间上下文,并受到几何关系约束。 ▍ 几百张照片压缩到几张 生成与重建结合之后,最直接的变化首先发生在 3D 数据采集上。 传统 Dense Reconstruction 对数据覆盖的要求很高:一个希望出现在重建结果里的位置,通常需要从多个视角被拍摄。桌子底下、麦克风下面、家具之间的缝隙甚至植物叶片背后,都需要尽可能被相机覆盖。 因此,一个房间可能需要拍摄 100、200 甚至 300 张照片。一套多房间住宅对于第一次操作的人来说,完整扫描可能需要一两个小时。过去 3D 重建很难进入普通用户工作流,很大程度上并不是最终效果的问题,而是前端采集本身太重。 Atlas 希望改变的是这一环节。 团队给出的目标,是把传统密集重建所需的输入量降低约 50 至 100 倍,一个房间最终可能只需要约 3 张照片。 Ben 已经开始把自己过去的采集素材重新放入 Atlas。一套此前使用约 2000 张图片完成采集的多房间住宅,在输入压缩到约 30 至 40 张后,生成的空间穿行效果已经基本接近原来的结果。 这会直接改变哪些数据能够被用于 3D 重建。过去没有按照专业重建流程采集的手机照片、普通视频、旧影像甚至互联网上已有的图片,都可能重新变成可用输入。 如果稀疏重建继续成立,3D 世界的数据来源会从「专门采集」扩大到大量已经存在的视觉数据。 Stanford Quad 的实验展示了这种机制。团队输入的只有 3 至 25 张站在地面拍摄的照片,但最终可以从空中视

查看原文