“There is more beyond language intelligence.”
李飞飞:语言智能之外,还有更大的世界。
大模型能写代码、做数学题,也能从一张照片里认出桌子和杯子。可如果把它放进一间陌生的房间,它未必知道杯子离桌边还有多远,伸手去拿会不会碰倒旁边的水壶。
李飞飞把这条差距称为AI的下一章:空间智能。
在新一期访谈中,李飞飞用了两个多小时讨论人类视觉、AI学习和创造力。
讲到World Labs时,她把话题拉回正在发生的技术变化:大语言模型让机器掌握了文字和概念,下一步要让它理解空间、时间和物体之间的关系。
开发者很快就会遇到这类模型。游戏场景、机器人训练、建筑设计和虚拟制作已经开始接入世界模型。
过去API返回文字或图片,现在World Labs想返回一个可以进入、编辑和继续运行的环境。
以下为访谈内容,我们进行了翻译与整理。
Agent读完代码库,也不代表它理解了世界
主持人提到了一个场景。
一个孩子见过猫以后,即使只看到书架后面露出一截尾巴,也可能认出那是一只猫。他没有看过几百万张猫的图片,更没有浏览过整个互联网。
0
评论 (0)