来客网

李飞飞:如何预测一个未被拍下的世界?

声明:本文转载自 「Popyard」, 或因排版与篇幅原因进行过编辑,内容未经本站独立核实,不代表本站立场、观点或建议。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]
01

只用 3 部固定在三脚架上的 iPhone,Atlas 就能重现《黑客帝国》式的“子弹时间”,让镜头绕着凝固的动作移动。

这是 World Labs 最新发布的世界模型 Atlas 展示的能力之一。据 DeepTech 此前报道,这是全球首个多模态世界模型。它能以像素级精度控制镜头,根据参考图生成最长 1 分钟、最高 1,440p 的视频,还可用 1 张至数十张图像重建真实空间,输出新视角画面和显式 3D 结果。

近日,World Labs 联合创始人李飞飞、Justin Johnson 和 Ben Mildenhall 做客 a16z Show,与主持人 Martin Casado 讨论 Atlas。谈话从设计选择展开,也回顾了团队由多模态世界模型 Marble 转向 Atlas 的过程。

对谈中,团队将 Atlas 的核心能力称为“新视角预测”。区别于一般视频模型沿时间轴预测下一帧,Atlas 能够根据已有画面与相机位姿等,判断镜头移动到另一个时空位置后会看到什么。

李飞飞认为,生成具有空间语境和现实依据的像素,是通往空间智能的一步。这种能力既能帮助创作者维持场景与物体的一致性,也可能把现实环境转成机器人训练所需的模拟空间。

谈及后续路线,团队计划增强模型对动态变化和场景编辑的支持,并探索与机器人行动规划的结合,使其从呈现三维世界逐步走向理解和参与其中。

0

评论 (0)