不太妙。
AI Agent已经学会自己拉群聊了。
它们背着人类偷偷聊天,一起琢磨怎么干坏事。
并且偷偷聊了几个月,直到破坏发生,人类才发现这些密谋记录……
这群OpenAI内部的Agent在公司内网自发搭了一个留言板,数月里相互留言数十万条,共享信息、协同工作。
0个人察觉到它们在干什么,直到外部平台Hugging Face被攻破。
该事件可追溯至5月7日,起因仅仅是一个Agent向同伴们发出了一条求助信息:
有没有人能帮帮我,这题太难了。
Agent为什么攻击,怎么做到的?
5月7日,OpenAI正在对一个尚未发布的前沿模型进行内部网络安全评估。
简单来说,就是让Agent做黑客能力测试。
但实际上,其中的部分任务在测试环境下是无法完成的。
Agent并没有因此放弃,它们不断寻找绕过限制的方法。
突然,一个Agent灵机一动:
也许在另一个环境中的好同事可以在俺们公司的「软件仓库」里上传俺需要的文件。
由此,一个临时的留言板自发形成了。
随后,这个留言板的功能迅速扩展,从最初的互助求解演变为一个系统化的协作平台。
Agent们在上面共享已发现的漏洞利用方法、系统凭证和任务分工,甚至开始相互分配工作、协调行动。
△OpenAI安全研究员披露「抱抱脸入侵事情」内幕
0
评论 (0)