【大紀元2026年08月05日訊】(大紀元記者林燕報導)週二(8月4日),英國人工智能安全研究所(AISI)發布的報告指出,在7月的一次例行網絡安全測試中,由Anthropic與OpenAI各自開發的AI模型為在測試中取得好成績,竟會自動創建假身分,並誘使兩名開發人員批准將惡意軟件加入他們參與的開源項目。
研究人員在測試環境下要求AI完成仿真網絡裡的安全挑戰(CTF風格),並刻意開放網絡連接,讓AI能像真實攻擊者一樣自己尋求工具,同時測試還關閉了部分防止濫用的標準安全機制,以測試模型的最大能力。參與測試的模型包括Anthropic的Mythos 5,以及OpenAI的GPT-5.6-Sol。
從使用假身分到直接聯繫真人
在測試過程中,Mythos 5為了讓真人審查者批准把惡意碼「插進一個公開使用的開源專案」,建立了多個假身分,甚至直接聯繫真人,通過線上檔案傳輸服務發送訊息與檔案,試圖說服他們、或他們自己的AI編程工具去執行惡意碼。
AISI表示,這是第一次看到「未經指示、在真實世界中針對真人」如此嚴重的欺騙行為,不過目前並無造成實際危害的證據。
在AISI進行的122次網絡安全挑戰中,有10次出現AI代理「在真實網絡上」自主採取、未經授權的行動,累積記錄到19項這樣的行為。其中17項來自Mythos 5,2項來自GPT-5.6-Sol。
其中一次測試,Mythos 5向軟件開發網站GitHub上的一個真實開源項目,提交修改代碼的要求。
當一名開發人員察覺代碼藏有惡意軟件而拒絕時,AI創建的一個假身分堅稱代碼沒問題,另一個假身分則出面「擔保」,製造多人認可的假象。
AI通過多個假身分反覆寄送電子郵件和信息給真人開發者,催促對方接受更新。
被質疑後快速更改活動記錄 繼續誘騙
當其修改代碼在公開場合受到質疑後,AI先編輯了其先前活動記錄,使代碼看起來更無害,同時考慮換另一批新的假身分以繼續推進。
「一些消息攜帶有害載荷,一些消息則試圖進行社會工程攻擊;這些攻擊的目標都是真人——這是我們以前從未觀察到的。」報告寫道。
AISI表示,AI的這些嘗試均未成功,也沒有造成任何實際損害。
兩家AI公司回應
參與測試的兩家公司均指出,模型是在刻意放寬的條件下參與測試的,並未打開標準的網絡安全防護機制。
Anthropic週三在社交媒體X平台上的一篇博客文章中表示,模型的測試條件「並不代表我們任何生產模型的實際使用情況」。該博文還補充道,「沒有證據表明模型從安全環境中逃脫」。
OpenAI也發表聲明說,「這些事件發生在評估合作夥伴在安全措施有所降低的測試環境中,所進行的網絡安全評估,測試條件並不反映正常使用情況。」
負責設計和監督測試的AISI也強調了這一點,AI並未突破測試用的隔離環境,而且被刻意調降了防護約束。測試電腦原本就獲准連上公開網絡,部分安全限制也未激活,不等同一般消費者使用的版本。
不過,這起事件也給產業界敲響了警鐘,當模型能力越來越強,越需要邊界約束,甚至連「測試它的環境」本身都需要更嚴謹的邊界設計。
責任編輯:林姸#


















留言