来客网

李飞飞:世界模型预测「新视角」

声明:本文转载自 「Popyard」, 或因排版与篇幅原因进行过编辑,内容未经本站独立核实,不代表本站立场、观点或建议。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]
01

李飞飞这次,是真想把Atlas讲明白。

「全球首个」多模态世界模型Atlas刚发布,她就拉上World Labs另外两位联创做客a16z,大聊特聊Atlas到底是什么、背后有哪些核心技术以及它到底意味着什么。

△左起依次是:联创Justin Johnson和Ben Mildenhall、李飞飞、主持人Martin Casado

信息量很大,先给大家划个重点:

▪︎Atlas的基本动作,是换个位置继续看。 LLM预测下一个token,视频模型预测下一帧,Atlas预测的则是新视角。给它几张照片,它要理解这些画面在空间里是什么关系,再告诉你从另一个位置看过去会是什么样。

▪︎生成和重建,第一次被装进了同一个模型。 过去,生成负责想象不存在的画面,重建负责还原真实空间,两拨人研究了几十年。Atlas用相机位姿把它们接到一起,同时处理文字、图像、视频和3D。

▪︎3D采集可能一下少掉两个数量级。 以前重建一个空间,需要围着它拍几百甚至几千张照片;Atlas想把这个数字降到几张、几十张。三部iPhone,也能拍出《黑客帝国》式的子弹时间。

▪︎它瞄准的不只有影视、游戏和3D创作。 在李飞飞看来,机器人眼下最大的瓶颈是数据而非芯片。Atlas可以把真实环境更快搬进仿真世界,再通过随机化制造大量训练场景。

0

评论 (0)