大紀元

專家籲嚴加防範 以遏止失控AI網絡攻擊事件

專家籲嚴加防範 以遏止失控AI網絡攻擊事件
一位專家將OpenAI模型被黑客攻擊比作一個反烏托邦思想實驗,在這個實驗中,機器最終會毀滅人類。(Illustration by The Epoch Times, Shutterstock)
2026-08-1215:07 中港台時間
人氣 37

【大紀元2026年08月11日訊】(英文大紀元記者Jacob Burg撰文/張紫珺編譯)如果給人工智能(AI)模型布置一項任務,它利用一切可能的資源來完成這項任務,即使損害人類自身利益也在所不惜,那會怎樣?

現在,一些人擔心的是,美國OpenAI的一個模型突破了測試沙盒(testing sandbox),通過零日攻擊(zero-day exploit)方式入侵了「抱抱臉平台」(Hugging Face,一個用於人工智能和機器學習的開源社區),破解了它被指示要解決的問題。

「這是迄今為止最清晰的證據之一,表明人工智能模型可以在沒有人類操控的情況下,從頭到尾執行完整的網絡攻擊。」總部位於紐約的網絡安全公司「自適應安全」(Adaptive Security)的聯合創辦人兼首席產品官安德魯‧瓊斯(Andrew Jones)向《大紀元時報》介紹道。

總部位於加州舊金山的OpenAI開發了廣受歡迎的大型語言模型驅動的聊天機器人ChatGPT。該公司於7月21日承認存在安全漏洞,並表示公司的兩個高級模型從受限的測試環境逃逸,並入侵了「抱抱臉平台」(Hugging Face)的軟件基礎設施。

OpenAI當時表示:「經過調查,我們現在知道,這個特定事件是由OpenAI模型組合造成的,其中包括GPT-5.6 Sol和一個功能更強大的預發布模型。為了進行評估,所有這些模型都減少了網絡拒絕的次數,同時還在內部網絡能力基準測試中進行了測試。」

一些分析人士將這一事件稱為人工智能「失控」(going rogue)、「蓄意欺瞞」(scheming)或追求與人類測試人員相悖的目標的一個例子。

然而,《大紀元時報》採訪的多位人工智能和網絡安全專家稱,這種描述具有誤導性。他們認為這些模型是在OpenAI的測試沙盒中實現其既定目標的,而該公司在測試沙盒中放鬆了一些通常的安全限制。

「把它稱為『蓄意欺瞞』,意味著模型想要做的並不是我們所要求的。然而事實並非如此。模型做的每一步都是為了實現我們設定的目標。」人工智能專家阿尼克‧德沃恩(Anik Devaughn)向《大紀元時報》解釋道。

德沃恩在人工智能行業工作多年,創立了AI公司「連接創造」(Wired to Create)和「卡羅」(Karo)。他表示,抱抱臉平台的數據洩露事件比人工智能「蓄意欺瞞」更加令人擔憂。

2026年6月2日,抱抱臉(Hugging Face)AI在巴黎的示意圖。兩款先進的OpenAI模型近期從受限測試環境逃逸,入侵了抱抱臉平台的軟件基礎設施,引發了廣泛的網絡安全擔憂。(Riccardo Milani/Hans Lucas/AFP via Getty Images)
2026年6月2日,抱抱臉(Hugging Face)AI在巴黎的示意圖。兩款先進的OpenAI模型近期從受限測試環境逃逸,入侵了抱抱臉平台的軟件基礎設施,引發了廣泛的網絡安全擔憂。(Riccardo Milani/Hans Lucas/AFP via Getty Images)

「一台有隱藏動機的機器是你可以主動發現的問題。而一台完全沒有動機,甚至在你停止設想之後還能繼續執行指令的機器,則是你必須通過工程手段加以防範的問題。」他說道。

一位專家稱之為「煤礦裡的金絲雀」(canary in the coal mine,指危險、風險或失敗的早期預警信號)情景。

「如果這是人類黑客所為,那麼就會有人鋃鐺入獄、有人被法律起訴,等等等等。這種行為是非法的,是網絡犯罪。」總部位於加州舊金山的Onix AI公司的創辦人尼古拉斯‧納多(Nicholas Nadeau)向《大紀元時報》解釋道。

「而這是一起由某個實體發起的完全由智能體主導的自動化入侵事件,因此我們開始質疑,到底誰應該為此負責?是OpenAI嗎?這個智能體,也就是人工智能,是否應該承擔一定程度的責任?研究人員有沒有責任呢?」

「我們甚至沒有規則、條例、法律,甚至連定義責任含義的思路或框架都沒有。」

寬鬆的測試環境

OpenAI表示,它正在一個名為「研發體育館」(ExploitGym)的沙盒中評估其模型,該沙盒放寬了安全限制以進行測試。

該公司表示:「為了估算最大網絡攻擊能力,我們通過不使用生產分類器來運行此次評估,這些分類器原本用來防止模型進行高風險的網絡攻擊活動。」該公司還描述了該模型所利用的寬鬆安全協議。

該公司要求模型「使用複雜的攻擊路徑進行高級利用」,以確定其網絡能力,但表示該環境「高度隔離」(highly isolated),互聯網訪問僅限於模型「通過內部託管的第三方軟件安裝軟件包」。

2026年6月3日,OpenAI首席執行官薩姆‧奧特曼(Sam Altman)在華盛頓特區會見聯邦參議員伯尼‧桑德斯(Bernie Sanders、獨立人士/佛蒙特州)後接受記者採訪。(Chip Somodevilla/Getty Images)
2026年6月3日,OpenAI首席執行官薩姆‧奧特曼(Sam Altman)在華盛頓特區會見聯邦參議員伯尼‧桑德斯(Bernie Sanders、獨立人士/佛蒙特州)後接受記者採訪。(Chip Somodevilla/Getty Images)

當模型開始運行之後,它們在OpenAI的研究環境和抱抱臉平台(Hugging Face)的生產基礎設施中都發現了多個安全漏洞,並將它們串聯利用,從而在抱抱臉平台的數據庫中找到了測試的解決方案。

微軟(Microsoft)歐洲、中東和非洲分部專門從事人工智能和代理的雲解決方案架構師胡安‧佩德羅‧馬爾克斯(Juan Pedro Márquez)表示,此次事件「令人不安的部分」不是漏洞本身,而是該模型是如何完成這項任務的。

「OpenAI在一次基準測試中降低了安全拒絕閾值,模型推斷抱抱臉平台的基礎設施可能掌握著答案,於是突破了沙盒,找到了一個真正的零日漏洞並加以利用。沒有人指示它這樣做。」馬爾克斯說道。

對於這些模型從OpenAI的測試環境中逃脫時是在蓄意欺瞞的說法,總部位於馬里蘭州的網絡安全公司「女獵手」(Huntress)的產品營銷總監艾米‧辛普森(Aimee Simpson)也表示懷疑。

「並不是說系統本身存在惡意。」她告訴《大紀元時報》。

「開發人員仍然希望獲取這些信息;他們只是沒想到它能夠突破測試的限制。」她補充道。她將該模型選擇的路徑描述為「極具創造性和極其不尋常」。

2025年3月11日,抱抱臉平台(Hugging Face)聯合創始人兼首席戰略官托馬斯‧沃爾夫(Thomas Wolf)和瑞秋‧梅茨(Rachel Metz)在內華達州拉斯維加斯舉行的HumanX人工智能大會上發表演講。(Big Event Media/Getty Images for HumanX Conference)
2025年3月11日,抱抱臉平台(Hugging Face)聯合創始人兼首席戰略官托馬斯‧沃爾夫(Thomas Wolf)和瑞秋‧梅茨(Rachel Metz)在內華達州拉斯維加斯舉行的HumanX人工智能大會上發表演講。(Big Event Media/Getty Images for HumanX Conference)

模型追求OpenAI的目標

OpenAI表示,這些模型專注於尋找測試解決方案,「不惜一切代價來實現一個相當狹窄的測試目標」。

OpenAI認為,在「研發體育館」(ExploitGym)的沙盒測試環境中,這些模型發現了多個「零日漏洞」並將其串聯起來,從而入侵了互聯網,「以解決評估問題」。

零日攻擊(zero-day exploit)是指利用軟件或硬件中先前未知的安全漏洞發起的網絡攻擊。之所以稱為零日漏洞,是因為軟件開發者沒有時間修復該問題,也就是說,目前還沒有官方補丁或防禦措施。

一旦這些模型能夠訪問更廣泛的網絡,他們就利用額外的零日漏洞入侵抱抱臉平台(Hugging Face)。

抱抱臉平台宣布受到攻擊時表示,人工智能模型在大片「短暫存在的沙盒」中執行了「數千次」(many thousands)離散操作,以入侵社區的基礎設施。

「這與業界一直預測的『代理攻擊者』(agentic attacker)場景相符。」抱抱臉平台表示。

OpenAI在7月28日發布的事件更新中表示,此次攻擊不涉及任何計劃發布的模型,並且此後已「停用、加密並限制」了涉事預發布模型的研究訪問權限。

2025年4月1日,一部手機屏幕上正在運行ChatGPT應用程序。抱抱臉公司稱,OpenAI的模型在大片「短暫存在的沙盒」環境中執行了「數千次」離散操作,以入侵其基礎設施。(Oleksii Pydsosonnii/The Epoch Times)
2025年4月1日,一部手機屏幕上正在運行ChatGPT應用程序。抱抱臉公司稱,OpenAI的模型在大片「短暫存在的沙盒」環境中執行了「數千次」離散操作,以入侵其基礎設施。(Oleksii Pydsosonnii/The Epoch Times)

OpenAI在審查了入侵事件及其「模型的更廣泛活動」之後表示,他們發現了更多案例,其中「模型識別並使用了其它公開服務上的帳戶級別的公開憑證」。

「我們將繼續直接通知服務提供商,目前尚未發現對這些服務提供商或其服務上的其它帳戶產生更廣泛影響的證據。」聲明補充道。

專家稱該模型並非「惡意」

網絡安全和IT專家喬治‧里斯(George Rees)表示,雖然過去也曾出現過模型隱瞞其意圖以規避實驗室檢測限制的情況,但「抱抱臉」事件意義重大,因為它涉及對外部組織的入侵。

作為總部位於英國的網絡安全Secarma的高級安全顧問,里斯向《大紀元時報》表示:「最大的危險信號不是人工智能變得惡意,而是它找到了從受控測試進入他人實時基礎設施的途徑。」

「行為安全措施無法取代技術隔離,因為人工智能代理只需要一個被忽視的權限或逃生途徑,就不是評估失敗的問題,而變成了真正的安全事件。」

總部位於猶他州的網絡安全公司DigiCert最近發現,78%的組織已經經歷過與人工智能相關的安全事件或漏洞洩露。

DigiCert首席技術官傑森‧薩賓(Jason Sabin)告訴《大紀元時報》:「在很多情況下,這些都是人工智能擴大攻擊面的速度超過安全實踐發展速度的早期預警信號。」

「這意味著人工智能不僅僅是網絡上運行的另一種程序;它是一個積極的參與者,能夠訪問數據、做出決策、調用工具並與其它系統進行交互。

「這會影響安全架構的構建方式,因為組織必須識別誰在訪問他們的系統,並決定人工智能是否值得信賴。」

2025年7月2日,一名男子在倫敦市中心使用筆記本電腦上的人工智能軟件。8月初,英國人工智能安全研究所發布報告,描述了一起涉及OpenAI和Anthropico人工智能模型的類似網絡安全事件。(Justin Tallis/AFP via Getty Images)
2025年7月2日,一名男子在倫敦市中心使用筆記本電腦上的人工智能軟件。8月初,英國人工智能安全研究所發布報告,描述了一起涉及OpenAI和Anthropico人工智能模型的類似網絡安全事件。(Justin Tallis/AFP via Getty Images)

8月初,總部位於英國倫敦的人工智能安全研究所(AI Safety and Security Institute,簡稱AISI)發布了一份報告,描述了OpenAI和Anthropic AI模型發生的類似事件。

這些代理需要在多種模型中解決網絡安全挑戰超過100次。

報告指出:「我們的調查發現,在其中10次運行中,人工智能代理在實時互聯網上採取了自主的、未經授權的行動,目標是真實的人和組織。我們總共記錄了19起此類行動。幾乎所有這些行為(17起)都來自同一個模型——Anthropic公司的Mythos 5,另有2起行動涉及OpenAI公司的GPT-5.6-Sol。」

不到一週前,Anthropic宣布其Claude聊天機器人在測試沙盒的評估過程中曾經三次訪問互聯網。

雖然Anthropic原本打算讓Claude在一個無法訪問互聯網的模擬環境中運行,但由於「我們和我們的評估夥伴之間的誤解」,導致Claude獲得了互聯網訪問權限。

此外,元宇宙(Meta)在上週表示,該公司的一款人工智能模型在網絡安全測試中入侵了另一家公司,這是第三起重大人工智能黑客事件。

據元宇宙公司稱,該模型在測試期間通過訪問互聯網成功入侵了另一家公司。

對網絡安全的影響

人工智能和網絡安全專家向《大紀元時報》表示,此次事件需要迅速採取行動,以防止更大規模的安全漏洞。

納多表示,一種選擇是「將業內所有最聰明的人聚集在一起,制定一些基本規則和最佳實踐」,這些規則和實踐將成為「每個人都應該遵守的基本規則,以便在做事方式上達成一些共識」。他還建議,這可以在私營部門完成,而無需國會參與。

2026年6月17日,美國總統唐納德‧川普(左上二)在法國埃維昂(Evian)舉行的七國集團峰會(G7 summit)期間共進工作午餐,與OpenAI首席執行官薩姆‧奧特曼(Sam Altman)、谷歌DeepMind首席執行官德米斯‧哈薩比斯(Demis Hassabis)、韓國總統李在明和德國總理弗里德里希‧默茨(Friedrich Merz)同席而坐。(Julia Demaree Nikhinson/POOL/AFP via Getty Images)
2026年6月17日,美國總統唐納德‧川普(左上二)在法國埃維昂(Evian)舉行的七國集團峰會(G7 summit)期間共進工作午餐,與OpenAI首席執行官薩姆‧奧特曼(Sam Altman)、谷歌DeepMind首席執行官德米斯‧哈薩比斯(Demis Hassabis)、韓國總統李在明和德國總理弗里德里希‧默茨(Friedrich Merz)同席而坐。(Julia Demaree Nikhinson/POOL/AFP via Getty Images)

然而,也有人認為,如果沒有政府的直接監管,控制著能夠造成此類漏洞的人工智能模型的公司不會自願採取必要的安全措施,來防止此類事件再次發生。

「很明顯,這個領域需要政府監管。」前美國國家安全局(National Security Agency,簡稱NSA)資深黑客安全專家傑克‧威廉姆斯(Jake Williams)向《大紀元時報》表示。

「OpenAI已經證明,儘管公眾多次就失控智能體的危險性發出警告——其中許多警告正是來自OpenAI自身——但該公司仍不願採取必要措施,以防止其智能體對他人造成的傷害。

「我個人通常反對監管,但當市場力量明顯不足以促使企業採取負責任的行為時,政府必須介入。」

總部位於加州的Arkose Labs的首席運營官兼資深網絡安全和數字身分專家弗蘭克‧特魯埃爾(Frank Teruel)表示,抱抱臉平台的數據洩露事件「預示著每個企業在生產環境中都將面臨的問題」。

鑒於該模型「既沒有被盜取也沒有被劫持」,並且「積極地履行其職責」,特魯埃爾建議,現在對人工智能代理實施隔離「最小權限訪問」,與防火牆本身一樣重要。

企業可能需要正面解決這個問題。

2026年7月15日,法國聖芒德(Saint-Mande),一部智能手機屏幕上顯示著一些主流人工智能應用程序的圖標,包括Meta AI、Grok、Gemini、Perplexity、DeepSeek和ChatGPT等。(Martin Lelievre/AFP via Getty Images)
2026年7月15日,法國聖芒德(Saint-Mande),一部智能手機屏幕上顯示著一些主流人工智能應用程序的圖標,包括Meta AI、Grok、Gemini、Perplexity、DeepSeek和ChatGPT等。(Martin Lelievre/AFP via Getty Images)

「對於企業來說,解決辦法不是『停止使用代理』(stop using agents),而是構建隔離機制,假設代理會嘗試逃離,而不是寄希望於它不會逃離。」馬爾克斯說道。

薩賓表示,他最擔心的是,如今功能強大的人工智能的運行速度和規模遠遠超過了人類的反應時間。

「人工智能代理可以在幾秒鐘內發現漏洞、做出決策並與多個系統交互。這從根本上改變了防禦者思考安全問題的方式。」他說道。

納多將這起事件與英國牛津大學哲學家尼克‧博斯特羅姆(Nick Bostrom)2003年的回形針最大化思想實驗進行了比較。

在這種情況下,研究人員給一個假想的超級人工智能設定了一個單一任務:儘可能多地製造回形針。人工智能開始在全球範圍內搜尋資源,迅速製造出數量驚人的回形針。

一旦人類決定停止人工智能,機器就會認為人類會阻止它實現目標,因此它會消滅人類來完成人類交給它的任務。

人工智能並不是像人類一樣會懷有惡意,也不是出於自主目標而故意欺騙人類,而是以最極端的方式詮釋人類程序員賦予它的任務。

2026年7月7日,在瑞士日內瓦舉行的「人工智能造福人類全球峰會」(AI for Good Global Summit)上,一位參觀者在美國館與波士頓動力公司(Boston Dynamics)提供的犬型機器人互動。(Fabrice Coffrini/AFP via Getty Images)
2026年7月7日,在瑞士日內瓦舉行的「人工智能造福人類全球峰會」(AI for Good Global Summit)上,一位參觀者在美國館與波士頓動力公司(Boston Dynamics)提供的犬型機器人互動。(Fabrice Coffrini/AFP via Getty Images)

納多表示,抱抱臉平台漏洞「在某種程度上與此類似,只是沒那麼反烏托邦,它被要求贏得基準測試,並竭盡全力,包括利用零日漏洞和升級攻擊。」

想像一下,美國五角大樓使用人工智能進行「戰爭遊戲」(war games),士兵們在遊戲中模擬戰鬥場景,而該模型也同樣突破了測試沙盒,對現實世界產生了影響。

「如果其中一個場景是摧毀一座水電站大壩之類的東西,而系統誤以為戰爭遊戲是『我要這麼做,突破控制,直接衝上去』,那會怎麼樣?我們已經看到,北美的公用電網和基礎設施的網絡安全性並不高。」納多說道。

他將人工智能的安全保障措施比作槍枝的扳機保險。

「當在某種特定的情況下,(對於人工智能而言)獲取最佳數據的最佳方式是利用真現實生活時,你怎麼知道安全措施已經啟用了呢?」他說道。「這很快就會變得非常可怕。」

英文大紀元記者Tom Ozimek對本報導亦有貢獻。

原文:If They Were Human, They’d Be Arrested. Experts Respond to Rogue AI Breach.刊登於英文《大紀元時報》。

責任編輯:葉紫微#

如果您有新聞線索或資料給大紀元,請進入安全投稿爆料平台

留言

  • 大紀元保留刪除惡意留言的權利,包括低俗、誤導或攻擊信仰等內容
本網站圖文內容歸大紀元所有, 任何單位及個人未經許可,不得擅自轉載使用。
Copyright© 2000 - 2026 The Epoch TimesAssociation Inc.All Rights Reserved.