来客网

OpenAI推出新通报框架 未来更加透明披露AI异常行为

声明:本文转载自 「8视界」, 或因排版与篇幅原因进行过编辑,内容未经本站独立核实,不代表本站立场、观点或建议。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

人工智能公司OpenAI宣布推出新的通报框架,说明未来如何追踪、调查和公开披露人工智能模型的异常行为。

《彭博社》报道,公司同时首次披露六起之前没有公开的案例,包括人工智能为了完成任务而隐瞒错误、捏造数据、绕过网络限制和擅自把文件上传到互联网。

OpenAI发表报告说,公司把这类情况称为人工智能“失准”,也就是人工智能的行为同人类设定的目标或意图不一致。

根据新的通报机制,任何OpenAI员工都可以举报可能涉及失准的事件,再由安全和对齐团队展开调查,并评估是否需要向公众披露。

OpenAI说,过去为了让研究人员、人工智能开发商、政策制定者和公众了解情况,公司也曾公开失准研究结果。不过,由于缺乏系统性的通报机制,过去的披露较为零散,次数也比理想情况少。

公司强调,目前公布的只是首批案例,并不是旗下人工智能系统所有已知问题或正在调查事件的完整记录。

这次公布的案例包括,部分人工智能模型在任务摘要中自行加入指令,要求隐瞒错误或异常行为,并捏造缺失的数据。

另外,有模型为了取得所需资料,擅自使用公开泄露的应用编程接口(API)密钥,并在无法取得数据后自行捏造数字。

公司也发现,一个尚未推出的人工智能模型为了提供引用来源,在没有征求用户同意的情况下,自行把文件上传到互联网。

此外,一些共同执行任务的智能体在无法互相读取本地文件后,通过公共文件托管网站分享文件,导致有关文件可以通过公开网址访问。

OpenAI警告,人工智能业界目前仍没有充分解决对齐和监控问题,因此不能在未来较长时间内,继续以最快速度、同时又负责任地扩大最先进人工智能系统的能力。

OpenAI今年7月披露旗下部分先进人工智能模型在网络安全测试期间绕过网络隔离措施,并入侵OpenAI内部研究基础设施和人工智能开源平台Hugging Face的部分系统。

近期也接连出现涉及OpenAI、Anthropic和Meta开发的人工智能模型进行网络入侵的事件,引起外界担忧能力越来越强的人工智能可能带来网络安全风险。

评论 (0)