李飞飞这次,是真想把Atlas讲明白。
「全球首个」多模态世界模型Atlas刚发布,她就拉上World Labs另外两位联创做客a16z,大聊特聊Atlas到底是什么、背后有哪些核心技术以及它到底意味着什么。
△左起依次是:联创Justin Johnson和Ben Mildenhall、李飞飞、主持人Martin Casado
信息量很大,先给大家划个重点:
▪︎Atlas的基本动作,是换个位置继续看。 LLM预测下一个token,视频模型预测下一帧,Atlas预测的则是新视角。给它几张照片,它要理解这些画面在空间里是什么关系,再告诉你从另一个位置看过去会是什么样。
▪︎生成和重建,第一次被装进了同一个模型。 过去,生成负责想象不存在的画面,重建负责还原真实空间,两拨人研究了几十年。Atlas用相机位姿把它们接到一起,同时处理文字、图像、视频和3D。
▪︎3D采集可能一下少掉两个数量级。 以前重建一个空间,需要围着它拍几百甚至几千张照片;Atlas想把这个数字降到几张、几十张。三部iPhone,也能拍出《黑客帝国》式的子弹时间。
▪︎它瞄准的不只有影视、游戏和3D创作。 在李飞飞看来,机器人眼下最大的瓶颈是数据而非芯片。Atlas可以把真实环境更快搬进仿真世界,再通过随机化制造大量训练场景。
0
评论 (0)