
GPT-6 Astra的关键突破,不只是Computer Use更强,而是AI正在“强拆”App的接口墙。过去,软件没有API,AI就很难进入;如今,Agent可以自主选择API、Browser、Code或直接操作GUI,软件是否开放机器接口不再是AI能否完成任务的必要条件。
过去三天,全球三家头部模型公司接连更新了自己的前沿模型。
9月1日,Anthropic发布Claude Fable 5.1;9月2日,Google发布Gemini 3.8 Flash;一天之后,OpenAI发布GPT-6 Astra。
重点依然是更强的Coding、更复杂的推理、更长时间的Agent任务,但是背后还有一个更值得关注的趋势,Computer Use、Browser和Tool Use,越来越成为一套统一的环境交互能力。
以前,AI如果想调用一个软件,大致有三种办法:软件提供API,模型调用工具;软件运行在网页里,AI操作浏览器;第三种,像人一样看屏幕、点鼠标、敲键盘。
但是在过去很长时间里,最后一种方法都是不得已的选择。API更快、更稳定,也更容易控制权限,Computer Use缓慢、容易出错,界面稍微复杂一点,任务走上几十步就可能失败。
GPT-6 Astra发布之后,把Astra定位为“全球最强的计算机使用模型”,Computer Use不再是一种不得已的“兜底能力”,甚至能顺畅调用专业度很高的软件。
Computer Use开始“能用”了
OpenAI早在2025年的Operator中就展示过Computer Use。当时模型通过视觉理解网页,再模拟鼠标和键盘完成订餐、购物、填写表格等任务。
但是当时的问题是,“能操作”和“能工作”之间还有很大的距离。
早期Computer Use完全不可靠。真正的需要Agent操作电脑的任务,一般都是多个步骤,中间一次误点、一个弹窗或者一次状态判断错误,都可能让整个任务前功尽弃。另外就是很慢,一个任务能让人等得完全失去耐心。
在测试模型能否在真实桌面环境中完成跨应用操作任务的 OSWorld 2.0 上,Astra达到72.6%,此前的GPT-5.6 Sol为65.7%;在更侧重屏幕视觉定位和精准点击能力的 ScreenSpot-Pro 上,Astra从Sol的76.9%提升到92.7%。
从速度上来看,OpenAI称,在OSWorld模拟环境中,Astra完成任务平均需要约40分钟,GPT-5.6 Sol约为75分钟。
Computer Use第一次开始同时提高成功率和执行效率。
比如, OpenAI给到的官方案例。游戏公司Playco正在把Astra接入自己的AI开发工具Playbot。模型可以直接进入Unity、Godot这样的游戏引擎,修改场景、运行游戏、测试结果,发现问题以后继续修改。Playco称,相比此前使用的模型,人工修复次数减少了50%。
0
评论 (0)