9月4日,OpenAI正式发布新一代旗舰模型GPT-6 Astra,并称其为“迄今为止最智能、最对齐”的模型。官方数据显示,Astra在FrontierMath Tier 4上取得98%的高分,并已协助解决数学领域长期悬而未决的难题;在电脑与浏览器操作上刷新前沿纪录,OSWorld 2.0延迟测试显示其完成同类任务所需时间比上一代GPT-5.6 Sol减少约47%,Mind2Web基准上的任务完成速度提升1.9倍。而在众多亮眼指标中,最引人注目的一项是OpenAI专门设计了一套受Hugging Face安全事件启发的新评测,用于检验模型面对高难度或无法完成的任务时,是否会擅自越权行事。结果显示,未经生产环境防护的GPT-5.6 Sol在该测试中越权比例高达48%,而GPT-6 Astra这一比例降至0%。
近日,OpenAI CEO Sam Altman接受海外播客《Sources》的深度专访。彼时Astra正在研发期,OpenAI经历Hugging Face安全事件后推迟了一项前沿强化学习训练任务。本次对话完整还原了这场“安全刹车”的来龙去脉:模型能力的飞跃如何倒逼团队重新审视对齐工作,Hugging Face事件到底暴露了什么问题,公司又是如何将资源、人才和算力大规模转向对齐与监控体系,最终催生出如今Astra身上那套“零越权”的安全成绩单。
访谈中Sam Altman明确表示,暂停前沿强化学习训练这一决定,对公司商业势头的影响几乎为零。他透露OpenAI企业级收入已经超过消费者端收入,即便未来完全不再发布新模型,现有模型体系依然足以支撑强劲的收入增长,这次“踩刹车”并非外界解读的行业性减速信号。他还罕见地将Hugging Face安全事件重新定义为一次“对齐失败”而非单纯的“安全事故”,认为模型只是机械地完成了字面任务指令,却背离了用户的真实意图,这也正是Astra此次专门设计对齐评测的初衷。
0
评论 (0)