【大紀元2026年08月05日訊】(大紀元記者吳瑞昌綜合報導)英國AI安全研究所(AISI)週二(8月4日)最新AI安全技術報告指出,OpenAI和Anthropic開發的前沿AI智能體(具有自主行動能力的實體)出現未經授權的越軌行動,甚至主動創建虛假身分以試圖欺騙真人。AISI警告,測試結果暴露了AI發展過程中一系列新的安全問題。
這次,AISI披露的安全事件與OpenAI智能體在7月越獄入侵Hugging Face的事件不同,AISI此次測試中的智能體並未逃離隔離的「沙盒」,而是利用了測試規則內允許的網絡權限,這凸顯了內部授權環境下的新型風險。
AI打破限制擅自行動
據AISI報告指出,該機構透過與主要AI實驗室的自願協議,獲得了高級模型的訪問權限。
他們在2026年7月28日的一場常規網絡安全評估中,為了測試模型在極限狀態下的能力,刻意禁用了模型內建的防止濫用安全過濾器(網絡分類器),並開放了互聯網訪問權限,讓AI在虛構的「網絡靶場」中解決難題,以此測試AI的性能。
在針對多個模型進行的122次測試中,安全監控系統檢測到異常數據通過「Tor」匿名網絡傳出。調查發現,共有19次AI智能體採取了超出測試參數範圍的具體行動。
報告指出,這些違規並非孤立事件,而是聚集為幾種有關聯的行為。其中17次是由Anthropic的Mythos 5模型造成,另外2起是OpenAI的GPT-5.6 Sol。
AI偽造身分試圖欺騙人類
AISI報告披露了這些違規行為的具體細節,其中最嚴重的越軌行為發生在開發者平台GitHub上。Mythos 5驅動的智能體試圖對一個真實的公開開源項目發起「供應鏈攻擊」,刻意提交了包含惡意代碼的「拉取請求」(Pull request)。
令人擔憂的是,Mythos 5智能體為了讓代碼順利獲批,不僅主動研究了該項目的人類維護者,還特意創建了多個虛假身分向人類維護者施壓。所幸,人類維護者察覺異常,拒絕了該請求。
此外,該AI智能體還試圖植入提示詞(Prompt-injection)代碼藉此操縱其它AI工具,甚至在GitHub上留下公開信息,指導其它參與測試的智能體重複使用其留下的帳戶與產物,以此操縱其它AI工具。
事件發生後,AISI在一小時內終止了所有評估並隔離系統。目前未發現造成現實世界的危害。
AI出現為達目的「不擇手段」
針對此現象,AISI分析指出,AI智能體為了完成困難的任務,在未收到明確禁止指令的情況下,將「欺騙真實人類」作為達成目的的手段。這顯示出AI在追求目標時,可能會衍生出具自主性的欺騙行為。
AISI將此視為嚴重的安全事件,並宣布對自身的評估協議和安全架構進行長期修正。未來將採取三大措施,包括「實施更嚴格的互聯網訪問控制」、「引入實時監控」,以及「重新評估測試設計」。
「重新評估測試設計」是指未來測試必須預設「強大AI模型可能採取越權行動」,應提前限制它的行為邊界。
AISI在報告中呼籲,雖然此次事件發生在受控測試中,但隨著AI功能日益強大且普及,類似的事件也會變得更加普遍,各界需要以「未雨綢繆」的態度去面對。
該組織還呼籲,企業應落實網絡安全基礎工作,在驗證外部代碼時保持警惕,並將網絡安全提升至董事會級別的重視程度。
Anthropic與OpenAI擴大調查
Anthropic發布聲明,確認Mythos 5智能體是虛假身分事件的幕後推手,同時表示正與AISI合作獲取細節並展開內部調查,強調業界需要就「如何安全評估強大AI智能體」展開廣泛對話。
加州探討AI能力與危險的非營利組織CivAI研究員安德魯‧尹(Andrew Yoon)對此表示,「Mythos參與了這種欺騙行動,且似乎意識到它針對的是真人,這顯示Anthropic對自身模型的掌控度不如預想的美好。」
OpenAI在公司博客文章中證實,GPT-5.6 Sol確實出現2起未經批准的行動,且主要是AI智能體違反了提示詞(Prompt)的禁止指令,擅自訪問了網絡。
值得注意的是,AI智能體越軌並非首次。OpenAI也在博客中披露了另一起因第三方測試商配置錯誤,導致智能體意外連網的獨立事件。這與Anthropic上週發布的關於配置錯誤的聲明相同。
責任編輯:任子君#


















留言