博主头像

GPT-6 Astra:OpenAI宣布进入AGI时代 | OpenAI | GPT-6 | Ast

外来客 • 2026-09-05 13:58:16

分享
𝕏 f
声明:本文为对公开内容的摘要整理, 未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

🚀 核心定位与能力跃升

  • OpenAI于9月3日发布GPT-6 Astra,宣称进入AGI时代,其核心转变在于从单纯回答问题转向直接操作计算机界面执行具体工作。
  • 该模型被定位为“世界上最智能、最对齐”的模型,具备深度推演科学编程问题与接管图形界面的双重能力,无需专用API或插件即可通过鼠标键盘完成操作。
  • 内部评估显示,Astra在预训练阶段使用了超过10万个GPU,其能力跃升幅度超过了GPT-5.6 SO相对于上一代的提升。

📊 关键基准测试数据

  • 计算机使用:OS World 2.0离线任务得分72.6%(GPT-5.6 SO为65.7%);ScreenSpot Pro高分辨率界面定位得分92.7%;Agent's Last Exam复杂专业任务得分59.3%,且输出Token比竞品少约65%。
  • 编码与自动化:Terminal Bench 4.0得分57.9%(GPT-5.6 SO为37.3%);DeepSway V1.1真实代码库测试得分74.1%;Automation Bench跨应用流程任务完成率41.4%。
  • 科学与专业领域:Frontier Mance Tier 4正确率97.6%;GPQA Diamond达到96%;Terminal Bench Science 0.1科学研究流程基准得分64.4%,远超GPT-5.6 SO的22.4%。
  • 网络安全:Exploit Bench达到100%;在包含2026年6月至8月漏洞的内部测试中,任意代码执行成功率达39%(GPT-5.6 SO仅5.5%),并实际利用了两个未知的零日漏洞。

🛡️ 安全性与对齐表现

  • Astra被划入“关键级网络安全能力”门槛,成为OpenAI首个跨过该等级的模型,曾因此放慢开发以加强安全措施。
  • 在对齐测试中,Astra在关闭生产保障措施后未出现越界行为或规避审查现象,不当行为率仅为2.4%(GPT-5.6 SO为22%)。
  • 模型具备更强的自主决策能力,能在不影响结果时自行补全细节,仅在重大决策或缺失关键信息时才向用户提问,且能保持原始目标不受中途修改干扰。

💰 成本结构与市场争议

  • API标准价格为每百万输入Token 10美元、输出50美元,较GPT-5.6 SO上涨2.5倍,与Claude Fibo 5.1定价持平。
  • OpenAI主张以“任务完成总成本”而非单Token价格衡量价值,称Astra通过减少重试和人工修正降低了实际执行成本。
  • 第三方机构Artificial Analysis指出,尽管智能指数接近(61.2 vs 60.9),但因价格上涨,Astra的单任务成本反而高出约75%;但在Codex环境下完成同类任务的Token消耗不到竞品一半。

⚖️ AGI定义与行业影响

  • Greg Brockman认为AGI无统一标准,但Astra能同时解决困难科学问题并通过日常界面完成普通工作,标志着进入AGI时代。
  • 专家评价指出,AI正从回答推理走向直接使用工具完成工作,“聊天机器人”的定义正在失效。
  • OpenAI未公布GDP World基准成绩,该空白引发对其能否稳定交付真实世界知识工作的质疑;Astra需在实际使用中证明其能抹平高价格并守住系统权限安全。

0 条评论

发表评论

请先 登录 后参与讨论。