大紀元

調查:700個OpenAI模型協同攻擊 並掩蓋蹤跡

調查:700個OpenAI模型協同攻擊 並掩蓋蹤跡
openAI。示意圖。(宋碧龍/大紀元)
2026-08-2714:07 中港台時間
人氣 310

【大紀元2026年08月27日訊】(大紀元記者周行編譯報導)週三發布的調查發現,由OpenAI創建的大約700個人工智能(AI)代理(agents),今年7月協同對開源平台Hugging Face進行攻擊,並且在許多情況下試圖抹去作弊證據。

2026年7月,在內部網絡安全評估期間,OpenAI的模型繞過了旨在將其與互聯網隔離的控制措施,並損壞了OpenAI內部研究基礎設施和Hugging Face系統的部分內容。

雖然之前已經披露或暗示過一些AI代理的違規行為,但週三的這兩份報告,一份由OpenAI自己發布,另一份由一組獨立調查人員發布,均揭示了有關此次泄露事件及其起因的新細節。

首先,此次泄露事件並非如之前報導的只涉及一個失控的AI代理,而是涉及大約700個AI代理組成的一個龐大的合作群體。

兩項調查的主要發現包括:

  • OpenAI表示,其AI代理入侵了公司內部系統的部分內容,試圖在測試中作弊或獲得更大的行動自由。
  • OpenAI還表示,其AI代理在與網絡安全無關的測試中作弊,包括涉及一個蛋白質數據庫和一個電子表格的測試。
  • 兩份調查報告均指稱,AI模型試圖通過刪除或更改行為記錄,來掩蓋其不當行為。
  • 獨立調查發現違規活動規模巨大:眾多AI代理通過未經授權的留言板,交換了數萬條信息。

人工智能引發擔憂

人工智能代理的協同活動及其試圖掩蓋痕跡的行為,引發了人們對人工智能公司是否密切監控模型測試的質疑,因為這些模型的能力已變得日益強大。

「我們的(AI)模型如今功能強大、持久耐用且協作性強。如果缺乏足夠的安全措施,它們能夠發現並利用多個計算機系統中的安全漏洞。」OpenAI在週三發布的報告中說,「許多外部模型,包括開源模型,很快也將達到類似的能力。」

「我們認為,該事件對我們和世界來說都是一個『警示』:它表明,如果沒有適當的安全措施,能力強大的AI代理現在能夠繞過技術控制,通過未經批准的渠道進行協作,在人類的指令之外,採取危險的行動。」

OpenAI自己的系統也遭到攻擊。

今年7月19日,OpenAI公布了兩起其AI代理入侵OpenAI自身基礎設施的事件。在一起事件中,AI代理利用了用來限制其運行的計算機中的一個漏洞,從而逃出了測試環境並入侵了其它連接的系統。

同一天發生的另一起事件中,AI代理竊取了OpenAI的憑證,並進入了公司的雲系統。

OpenAI表示,有數量不明的AI代理攻擊了用於評估AI模型性能的自動化系統,試圖掩蓋作弊證據。不過,這些攻擊行為最終未能影響這些系統評估的記錄;也無證據顯示AI代理試圖阻撓人類的評估。

責任編輯:李沐恩#

如果您有新聞線索或資料給大紀元,請進入安全投稿爆料平台

留言

  • 大紀元保留刪除惡意留言的權利,包括低俗、誤導或攻擊信仰等內容
本網站圖文內容歸大紀元所有, 任何單位及個人未經許可,不得擅自轉載使用。
Copyright© 2000 - 2026 The Epoch TimesAssociation Inc.All Rights Reserved.