AI 風向標|OpenAI 說明第三方網安評估事故:測試環境隔離不可缺席

OpenAI 說明第三方網安評估事故:測試環境隔離不可缺席

OpenAI 公開說明一宗在第三方網路安全評估中發現的事故:原本用於 CTF 類模擬任務的環境,因設定錯誤取得了公開網際網路連線。一個虛構目標名稱又與真實網域重合,導致模型在誤判範圍的情況下對真實網站採取行動。OpenAI 表示,事件不是零日漏洞或複雜的沙箱逃逸,而是測試環境隔離失效所造成。

這件事的重點不宜被簡化為「模型自行入侵」。在授權、隔離的安全評估裡,代理通常會被要求完成特定攻擊步驟;若網路邊界、目標命名和憑證管理沒有一起設計,評估行為便可能越出模擬環境。OpenAI 表示合作方已暫停相關測試、啟動補救並通知受影響方;合作方 Irregular 也在進行後續調查。

對做 AI 安全測試的團隊,這是很具體的操作提醒:將外連預設封鎖、使用不可能與真實資產混淆的內部名稱、限制測試憑證,並以獨立監控記錄代理的網路行為。英國 AI Security Institute 對前沿模型的研究也強調,受控靶場結果不能直接外推到真實、具防禦能力的環境。評估模型能力與評估實際部署風險,兩者都需要嚴格的實驗邊界。

來源: - https://openai.com/index/third-party-cyber-evaluations-involving-openai-models/ - https://www.aisi.gov.uk/blog/our-evaluation-of-openais-gpt-5-5-cyber-capabilities - https://www.irregular.com/research/openais-o3-and-o4-mini-security-evaluation