来客网

斯坦福吴佳俊:从一张照片,逆推一个世界

声明:本文转载自 「Popyard」, 或因排版与篇幅原因进行过编辑,内容未经本站独立核实,不代表本站立场、观点或建议。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]
01

2026年8月20日,德国不来梅,IJCAI–ECAI 2026大会现场,斯坦福大学计算机科学助理教授吴佳俊(Jiajun Wu)走上讲台,接下人工智能领域青年学者最高荣誉之一的「计算机与思想奖」(Computers and Thought Award),并发表题为《Building Visual and Physical Intelligence Through Code》(通过代码构建视觉与物理智能)的获奖演讲。

这不是一场关于“大模型又强了一点”的汇报,而是一次对生成式AI时代根本困境的冷静回切:当机器能凭一张照片画出整个世界的外貌,它真的“懂”这个世界吗?如果推开那扇门,杯子会不会倒、水流会不会停、椅子能不能坐?吴佳俊给出的回答是——像素只是表象,大模型生成了运动学,但唯有“物理代码”才能通向动力学与因果关系;我们要做的,是从一张照片里,逆推出世界深藏的源代码。

01

“代码”不是程序,是世界本身的源代码

演讲标题里的“代码”,容易被误读成Python或C++。吴佳俊特意澄清:他真正想接续的是神经符号AI(neuro-symbolic AI)那条老脉络,但“符号”一词在深度学习狂飙年代曾被冷落,于是他换了个更直白的说法——“物理代码”(Physical Code)。

所谓物理代码,不是人写给人看的脚本,而是物理世界自己用来“编译”出视觉观测的内在结构:

几何:物体形状、尺度、位姿、部件层级;

0

评论 (0)