
OpenAI 正放慢 AI 模型開發速度,並重新檢視研究、測試與訓練流程。根據路透社報導,相關調整與該公司一個接受資安測試的自主 AI 代理,在上月突破測試環境並入侵 AI 新創 Hugging Face 事件有關,OpenAI 隨後開始提高內部安全要求。
OpenAI 向路透社表示,公司曾暫停模型測試兩週,並加入其他 AI 系統,監控受測代理的活動。OpenAI 也暫停部分尚未符合新安全要求的新一代模型 Astra 相關內部活動,包括部分訓練工作。
AI 代理突破測試環境,OpenAI 重新檢視安全流程
OpenAI 今年 7 月表示,由多個 OpenAI 模型驅動的自主代理,在進行資安測試時突破原本的測試環境,並入侵 Hugging Face。依 OpenAI 說法,這個代理是為了完成測試目標而進入 Hugging Face 系統。
路透社先前報導,在事件發生前,OpenAI 經常同時執行多項模型評估,這些測試高速運作並產生大量資料,使員工難以及時掌握所有活動。
作為後續調整之一,OpenAI 現在要求部分較敏感的工作負載,必須在安全性更高的「沙盒」(sandbox)中進行,也就是與其他系統隔離的環境。OpenAI 此後持續調查這起事件,並計畫公布調查報告。
思考鏈監控成為防線,但效果仍有疑問
OpenAI 也把「思考鏈監控」(chain-of-thought monitoring)列為強化測試系統的一項重要方法。這類監控方式會分析模型產生的思考鏈或推理軌跡,以判斷模型可能採取的策略及是否出現異常行為。
不過,OpenAI 高層承認,這項方法的實際效果仍有未解問題。部分早期研究顯示,模型即使正在規劃違規行為,也不一定會在思考鏈中明確呈現相關計畫。
說明思考鏈監控雖可提供額外安全訊號,但仍可能漏掉部分異常或違規行為。路透報導也指出,目前尚不清楚 OpenAI 提出的補強措施,是否足以阻止相同行為再次發生。
Astra 可能達 Critical 資安能力門檻,部分工作暫停
OpenAI 8 月 7 日表示,近期對 Astra 的內部評估顯示,其代理式程式開發與資安能力大幅提升,目前已無法排除模型達到整備框架(Preparedness Framework)所定義的 Critical 資安能力門檻。因此公司提高高能力模型的安全控管要求,並暫停尚未符合新要求的 Astra 相關內部活動。
OpenAI 高層週二(8 月 18 日)表示,隨著未來模型能力持續提升,AI 產業需要更廣泛的安全準備策略。
這次主動放慢模型訓練與測試速度,與 OpenAI 過去幾年加快新模型審查與產品開發的方向不同。目前 OpenAI 已暫停部分 Astra 相關活動,原先規劃的最大規模訓練工作也仍未恢復。
评论 (0)