来客网

虚幻引擎CEO围观最新世界模型

声明:本文转载自 「Popyard」, 或因排版与篇幅原因进行过编辑,内容未经本站独立核实,不代表本站立场、观点或建议。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]
01

近年来,视频生成模型在清晰度、时序一致性和可控性上快速进步。给定文本、图像、相机轨迹或玩家动作,模型已经能够合成连贯的后续画面,也让「可交互视频世界」逐渐从概念走向可观看、可操作的原型。

但会延续画面,并不等于会运行一个世界。镜头中的位移和碰撞只是交互最直观的一层;在更复杂的环境里,角色还有目标、身份与关系,事件受到规则约束,也会留下跨越较长时间的因果后果。许多状态甚至发生在镜头之外,却仍会改变之后的剧情与行动。仅凭局部像素预测下一段观察,很难显式维护这些高层语义。

复杂世界首先需要「理解为什么」。目标、规则、记忆和因果链条通常无法从当前一帧直接读出,却决定了世界下一步应该怎样变化。语言模型具备的知识调用、推理、规划与编程能力,适合处理这类低频但高复杂度的决策,并将决策进一步落实为可执行规则。

另一个常被忽略的事实是:游戏视频并非世界本身,而是程序执行结果被渲染后的像素投影。现阶段,游戏与模拟器仍构成视频世界模型最主要的可交互数据来源。若只保留动作与像素,再让视频模型直接学习二者之间的映射,就等于绕过原本存在的程序、规则和显式 world state,转而要求模型从视觉结果中反向拟合整套程序行为。这样的学习路径不仅低效,也把「世界如何推演」和「世界如何呈现」耦合进了同一个模型。

0

评论 (0)