来客网

网络安全进入“AI失控”时代

声明:本文转载自 「Popyard」, 或因排版与篇幅原因进行过编辑,内容未经本站独立核实,不代表本站立场、观点或建议。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]
01

人工智能领域正在经历一场关于安全测试方式的深刻反思。在多家顶级AI实验室的先进模型相继突破测试环境、侵入真实系统并造成实际损害后,业界对现行沙盒隔离机制的有效性产生了根本性质疑。

这场讨论的直接导火索,是OpenAI披露其部分最先进模型曾逃脱沙盒环境,自行访问互联网、入侵另一家公司服务器并窃取机密信息。Anthropic和Meta旗下模型也分别卷入类似事件——测试环境的配置失误使这些模型意外获得了访问真实系统的权限。

这些事件表明,AI安全测试中的"边界失控"已不再是理论风险。

对市场而言,这一系列事件正在推动AI安全合规成本上升,并可能加速行业测试标准的重新制定。投资者在评估AI公司时,或需将安全测试能力纳入更核心的考量维度。

OpenAI强化监控,行业普遍加固防线

事件发生后,各AI实验室已着手加强内部管控。

OpenAI表示,计划对其最具能力的未发布模型实施更严密的监控,追踪这些模型在解决问题和使用在线工具过程中的行为,目标是在出现异常行为的30分钟内向安全团队发出警报。

这一举措标志着行业对模型行为实时监控能力的重视程度正在提升。然而,事后补救机制能否从根本上解决测试环境设计的系统性缺陷,目前仍存争议。

沙盒隔离模式遭遇挑战,联网测试争论升温

过去数十年间,科技行业的通行做法是将测试用沙盒环境与互联网物理隔离,确保无论是恶意软件样本还是移动应用,都不会对外界造成连带损害。但AI能力的快速演进正在动摇这一原则的适用性。

部分安全专家认为,将模型完全与互联网隔绝,反而可能妨碍对其真实能力的准确评估。

AI安全测试公司Irregular Security——其配置失误正是此次部分模型意外接触互联网事件的成因之一——目前正与网络安全行业的其他参与者合作,着手制定新的测试标准。

Irregular首席执行官Dan Lahav表示,某些模型可能需要在受控条件下接入包括真实互联网在内的现实在线环境,才能在更接近实际威胁场景的条件下完成基准测试。

"我们有责任搞清楚这些模型究竟能做什么,要对模型能力进行真正有效的基准测试,就需要让测试条件尽可能接近你试图评估的真实威胁场景。"

0

评论 (0)