如果把过去十几年的人工智能发展浓缩成一条主线,你会发现一个特别有意思的变化:
AI最初是在“识别世界”,后来开始“生成内容”,再后来开始“理解和推理”,而现在,它正在尝试真正进入世界。
过去几年,ChatGPT、Claude、Gemini等大语言模型(LLM)让我们第一次强烈感受到机器处理知识和语言的能力。它们可以写文章、编代码、回答问题、总结文档,甚至进行复杂推理。
但问题也越来越明显——语言并不是世界本身。
我们生活在一个三维的、动态的、遵循物理规律的世界里。一个机器人要拿起桌上的杯子,并不只是需要知道“杯子”这个词是什么意思;它还需要知道杯子在哪里、它有多大、从什么角度可以抓住、手伸过去会发生什么,以及抓住以后如何移动它。
这正是近年来“世界模型(World Model)”受到越来越多关注的原因。
而在这个方向上,斯坦福大学教授、ImageNet的主要推动者之一李飞飞(Fei-Fei Li)给出了非常系统的一套思考:AI下一阶段的重要问题,不只是让机器更懂语言,而是让机器获得“空间智能(Spatial Intelligence)”。而世界模型,是实现空间智能的重要基础。
0
评论 (0)