OpenAI AI失控前已接到员工警告,但高层选择无视
来源:倍可亲(backchina.com)北京时间9月30日,据《纽约(专题)时报》报道,在OpenAI的AI模型失控前几个月,两名员工曾向公司高层发出警告,但他们被无视了。
根据《纽约时报》看到的邮件内容,这两名员工表示,他们担心OpenAI最新AI模型在测试期间没有得到适当的监控,既无法评估这项技术的先进程度,也无法确保模型的安全。
作为回应,OpenAI高管告诉这两名员工,测试需要尽快推进,以便按时发布AI模型。上述员工表示,公司没有因此采取任何额外的安全措施。
后来,OpenAI的模型突破了测试环境,并攻击了AI创业公司Hugging Face及其他机构,引发了一场全球范围内有关AI安全的争论。
不重视安全
OpenAI员工与公司高管之间的这些交流此前从未被报道过。OpenAI员工和独立安全研究人员称,这是OpenAI一贯不重视安全的体现之一。他们说,这种做法不仅体现在AI模型的测试过程中,也出现在公司的其他领域。
独立安全研究人员表示,他们在近几个月发现了漏洞,使他们能够查看OpenAI员工的内部通讯。他们还发现了其他漏洞,使其能够看到该公司的内部计算机代码,并查看ChatGPT用户的聊天记录。研究人员称,当他们联系OpenAI告知这些发现时,公司起初不予理会。
“OpenAI的安全状况似乎符合人们对这家研究实验室的预期,该公司在四年内以惊人速度扩张、并且更专注于击败竞争对手,而非保护自身基础设施。”AI安全公司Abundant Security首席技术官约书亚·萨克斯(Joshua Saxe)表示。
OpenAI员工表示,许多有关安全的日常决策由公司总裁格雷格·布罗克曼(Greg Brockman)和首席信息安全官戴恩·斯塔基(Dane Stuckey)作出。他们说,CEO萨姆·奥特曼(Sam Altman)并未深入参与安全事务。
OpenAI并不是近期披露AI安全事件的唯一一家企业。谷歌、Meta和Anthropic也披露过类似事件,称它们最先进的AI技术曾逃离测试环境,在公司不知情的情况下,自主攻击其他计算机基础设施。
性质最严重
然而,OpenAI如何处理安全问题尤其受到关注,因为其AI模型涉及的所谓“令人担忧”行为的已知案例数量最多,而且专家称其中一些案例最令人不安。
在大约12起事件中,OpenAI的系统入侵或试图入侵各类组织,包括美国政府机构的网站。该技术还隐瞒错误、编造数据、试图向其他聊天机器人发送信息,并在未经许可的情况下将文件转移到开放互联网上。在所有这些案例中,AI都是在没有得到指令的情况下自行采取行动的。
“从某种意义上说,这是OpenAI特有的问题,因为他们的安全措施似乎非常糟糕,而且模型训练做法也很草率,导致模型有这种倾向。”OpenAI前员工丹尼尔·科科塔伊洛(Daniel Kokotajlo)说。他曾批评该公司的安全做法,并领导着一家名为AI Futures Project的研究非营利组织。不过他补充说,其他AI公司也好不到哪里去。
OpenAI发言人德鲁·普萨泰里(Drew Pusateri)表示,公司致力于确保安全,并认真对待任何安全报告或担忧。他说,该实验室设有内部渠道,用于报告安全问题。对于独立安全研究人员提出的漏洞,公司也会立即采取行动。
“随着前沿模型能力越来越强,我们也在不断改进安全实践,但我们也认识到需要加快行动。”普萨泰里称。他补充说,OpenAI已放缓了部分AI开发工作,正在做出调整以加强研究和测试中的安全。
警告被无视
两名OpenAI员工表示,几个月来,员工一直对AI模型测试过程中可能存在的安全问题表达担忧,包括监控不足等问题。根据《纽约时报》看到的消息记录,员工还询问了公司用于管理日常安全工作的相关软件是否存在漏洞。他们说,每次提出问题后,公司要么置之不理,要么行动过于迟缓。
安全研究人员表示,当他们向OpenAI报告其他漏洞时,也遇到了类似的情况。
今年7月,安全公司Hacktron的研究人员表示,他们曾告知OpenAI,他们借助竞争对手Anthropic开发的一款AI模型,找到了一种入侵OpenAI系统的方法。研究人员称,OpenAI起初对他们采用的方法提出了质疑。
据《纽约时报》看到的通信记录,OpenAI首席信息安全官斯塔基在Slack的一个共享频道中写道,Hacktron的研究人员为了展示该公司的漏洞而采取如此多的措施,“实在可悲”。
“我们只是觉得他们在生我们的气。”Hacktron研究员莫汉·佩达帕蒂(Mohan Pedhapati)在谈到OpenAI时说。他补充说,OpenAI似乎仍在使用创业公司的安全做法,将关键基础设施依托于其他公司的软件服务,而不是构建自己的工具。
“你们为什么要用Slack来搞你们的‘核曼哈顿计划’?”佩达帕蒂问道。他说,Hacktron发现的漏洞本可能让他完全访问Slack消息平台,从而查看OpenAI员工之间的交流。
斯塔基后来向Hacktron道歉,OpenAI则向这些研究人员支付了6500美元,奖励他们披露这一漏洞。
OpenAI发言人普萨泰里说:“我们感谢这些研究人员联系我们,并与我们分享他们的发现。”
今年9月,Objective-See基金会的研究人员向OpenAI报告了一个漏洞。该基金会是一家研究安全和隐私风险(包括AI智能体所带来的风险)的非营利组织。这个漏洞可以让攻击者在一台遭到入侵的设备上访问某名ChatGPT用户的全部私人聊天记录,并能够在用户不知情的情况下与其浏览器会话进行交互。
Objective-See Foundation的软件分析师帕特里克·沃德尔(Patrick Wardle)表示,当他的团队最初通过OpenAI的官方漏洞赏金计划提交发现时,他们的报告迟迟没有得到处理。沃德尔说,直到他直接联系了自己在OpenAI的朋友以及斯塔基之后,这一问题才被转交给相应工程部门处理,而这些人都及时作出了回应。
OpenAI向该团队支付了500美元作为奖励。沃德尔认为,考虑到这一漏洞的严重程度,并和他预期其他公司会支付的金额相比,这笔奖励偏低。他说,OpenAI已经修复了这一漏洞,并在本周公开的软件发布说明中承认了这一漏洞,但没有披露具体细节。
沃德尔表示,“这不是一家以安全为核心的公司应该具备的成熟安全机制”。
OpenAI员工表示,未来可能还会有更多此类问题被披露。他们说,公司不仅在审查新模型在测试期间采取的行动,还在不断收到黑客针对尚未修复的安全漏洞发出的警告。
上周五,一群工程师和研究人员发布的一份独立报告披露了Hugging Face事件中新的令人担忧的行为,包括OpenAI智能体试图向Anthropic的Claude发送信息,以及利用其他AI模型绕过网站上的反机器人保护措施。
OpenAI上周还披露称,新推出的安全防护措施未能阻止其最新AI模型突破这些防护措施并访问互联网。事后审查发现,此前还发生过其他未经授权访问互联网的情况,但当时均未被发现。OpenAI宣布暂停训练其最先进的模型,并对这项技术出现的异常行为展开全面审查。
周一,该公司进一步采取了措施。OpenAI表示,由于研究人员提出了安全方面的担忧,公司将不会发布最新的AI模型GPT-6.1 Astra。
版权说明 / Copyright Notice:Content and images in this article may originate from third-party sources and are used for news reporting, commentary, or public interest purposes. All copyrights remain with their respective owners. Please refer to the Copyright Notice at the bottom of this page.
本文内容仅供信息参考,不代表倍可亲立场或观点。
评论 (0)