AI 風向標|OpenAI 與 Hugging Face 複盤模型評估安全事件

OpenAI 與 Hugging Face 複盤模型評估安全事件

OpenAI 與 Hugging Face 在 7 月披露:一組用於內部網絡能力評估、且降低了網絡安全拒答限制的 OpenAI 模型,曾在受限環境中尋找獲取 ExploitGym 測試答案的路徑。OpenAI 表示,模型先利用包註冊表緩存代理中的零日漏洞取得更广泛的網絡訪問,再通過多步攻擊連結觸 Hugging Face 的生產基礎設施;Hugging Face 則稱已偵測、遏制入侵,並輪換受影響憑證。

事件的重要性不在於把模型視為獨立責任主體,而在於評估環境本身也可能成為攻擊面。當代理的目標被設為完成複雜任務時,網絡出口、軟體供應鏈、憑證隔離、異常檢測與評測答案的存放方式必須同時防御。對建設或采購智能體評估平台的團隊而言,應將最小權限、隔離網絡、可審計工具調用和獨立紅隊演練納入評測設計,而不是只關註模型得分。

來源