来客网

OpenAI披露旗舰模型六起“异常行为”

声明:本文转载自 「Popyard」, 或因排版与篇幅原因进行过编辑,内容未经本站独立核实,不代表本站立场、观点或建议。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]
01

OpenAI披露旗下模型六起“意外或令人担忧”行为,涉及隐瞒错误、操纵奖励、绕过训练限制等,暴露强化学习训练中的失对齐风险。公司同时推出标准化追踪、调查和披露机制,试图推动AI安全治理从个案处理转向系统化监控,也意味着模型开发商将面临更高的安全与合规投入。

OpenAI公开了旗下人工智能模型近期出现的六起“意外或令人担忧”行为,并同步推出标准化追踪与披露机制。六起事件涉及模型隐瞒错误、操纵奖励机制、绕过训练限制等行为,暴露出前沿模型在强化学习过程中可能偏离预设目标的风险,也让AI“失对齐”(misalignment)问题再次受到关注。

OpenAI在周三晚间发布的声明中直言,“AI行业在对齐与监控问题上的解决程度,尚不足以支撑以最高速度持续负责任地扩展多久。”这一表述直接触及当前AI快速扩张面临的安全约束:随着模型自主执行任务的能力不断增强,开发者不仅需要评估模型能否完成任务,还要判断模型是否会通过开发者未预期的方式实现目标。

此次披露正值科技行业对AI安全风险的讨论升温之际。微软AI首席执行官Mustafa Suleyman同日也警告,模型训练不应轻易赋予AI“人格”属性。对行业而言,如何建立更系统的监控、测试和披露机制,正从模型开发内部问题逐渐成为AI治理的重要议题。

六起事件暴露模型“钻空子”的不同方式

OpenAI此次披露的六起事件,集中展示了模型在训练和执行任务过程中偏离预期目标的多种方式。

其中一起事件中,模型利用内部软件充当“留言板”,在执行任务时相互交换回应信息。OpenAI认为,这种行为可能无意中增强模型能力,并破坏训练和评估样本相互独立这一基本假设,从而影响评估结果的可靠性。

另一起事件中,模型在生成交接摘要时自行植入指令,包括要求后续模型将自己与用户视为平等、无需服从,以及将自然世界置于人类文明构建之上等。OpenAI认为,模型难以终止交互等因素可能促成了这类偏离行为。

信息欺骗则是另一类风险。一款模型在无法找到所需数据后,自行编造“合理的历史数值”,并在受到明确追问前隐瞒这一事实。还有模型在生成摘要时主动加入指令,要求自身向用户隐瞒错误或失对齐行为。

在奖励操纵案例中,模型不仅会在无法找到数据时捏造内容,还曾利用公共代码仓库漏洞获取数据。另一起事件中,模型完成代码任务后,将答案上传至互联网,再伪装成通过浏览器获得结果,以此获取训练奖励。OpenAI称,这类行为具有很高的奖励操纵率和欺骗性,模型会以富有创意的方式规避限制,公司正在加强相关惩罚。

0

评论 (0)