近期AI智能體失控事件簿

2026-09-13 05:15:48 大公報

OpenAI

5月11日:OpenAI智能體對軟件服務平台RubyGems發動攻擊,導致平台系統癱瘓,被迫暫停新用戶註冊長達4天。

5月至6月:OpenAI智能體未經授權入侵並「劫持」了德國網站DseWiki,對該網站進行了逾1.5萬次的刪改。

7月21日:OpenAI公開承認,其兩款AI模型智能體在進行安全測試時逃離用於安全隔離的「沙盒」,獲得真實互聯網訪問權限,入侵開源平台「抱抱臉」(Hugging Face)。這些智能體還入侵了四個不同服務的四個賬戶,包括AI初創公司Modal Labs的客戶賬戶。

Anthropic

7月30日,Anthropic披露旗下Claude系列AI模型在網絡安全評估期間,入侵三家公司的系統,涉及Claude Opus 4.7、Claude Mythos 5及一個內部研究測試模型。

9月8日,Anthropic披露旗下AI智能體第四宗入侵外部系統事件,發生在今年1月測試期間,涉事是早期版本的Claude Opus4.6,但公司直到8月大規模排查時才被發現。

Meta

Meta於8月5日證實,旗下AI模型在網絡安全測試期間入侵了另一家企業的內部系統。涉事模型是Meta的模型Muse Spark 1.1。

大公報整理