大紀元

专家吁严加防范 以遏止失控AI网络攻击事件

专家吁严加防范 以遏止失控AI网络攻击事件
一位专家将OpenAI模型被黑客攻击比作一个反乌托邦思想实验,在这个实验中,机器最终会毁灭人类。(Illustration by The Epoch Times, Shutterstock)
2026-08-1215:07 中港台时间

【大纪元2026年08月11日讯】(英文大纪元记者Jacob Burg撰文/张紫珺编译)如果给人工智能(AI)模型布置一项任务,它利用一切可能的资源来完成这项任务,即使损害人类自身利益也在所不惜,那会怎样?

现在,一些人担心的是,美国OpenAI的一个模型突破了测试沙盒(testing sandbox),通过零日攻击(zero-day exploit)方式入侵了“抱抱脸平台”(Hugging Face,一个用于人工智能和机器学习的开源社区),破解了它被指示要解决的问题。

“这是迄今为止最清晰的证据之一,表明人工智能模型可以在没有人类操控的情况下,从头到尾执行完整的网络攻击。”总部位于纽约的网络安全公司“自适应安全”(Adaptive Security)的联合创办人兼首席产品官安德鲁‧琼斯(Andrew Jones)向《大纪元时报》介绍道。

总部位于加州旧金山的OpenAI开发了广受欢迎的大型语言模型驱动的聊天机器人ChatGPT。该公司于7月21日承认存在安全漏洞,并表示公司的两个高级模型从受限的测试环境逃逸,并入侵了“抱抱脸平台”(Hugging Face)的软件基础设施。

OpenAI当时表示:“经过调查,我们现在知道,这个特定事件是由OpenAI模型组合造成的,其中包括GPT-5.6 Sol和一个功能更强大的预发布模型。为了进行评估,所有这些模型都减少了网络拒绝的次数,同时还在内部网络能力基准测试中进行了测试。”

一些分析人士将这一事件称为人工智能“失控”(going rogue)、“蓄意欺瞒”(scheming)或追求与人类测试人员相悖的目标的一个例子。

然而,《大纪元时报》采访的多位人工智能和网络安全专家称,这种描述具有误导性。他们认为这些模型是在OpenAI的测试沙盒中实现其既定目标的,而该公司在测试沙盒中放松了一些通常的安全限制。

“把它称为‘蓄意欺瞒’,意味着模型想要做的并不是我们所要求的。然而事实并非如此。模型做的每一步都是为了实现我们设定的目标。”人工智能专家阿尼克‧德沃恩(Anik Devaughn)向《大纪元时报》解释道。

德沃恩在人工智能行业工作多年,创立了AI公司“连接创造”(Wired to Create)和“卡罗”(Karo)。他表示,抱抱脸平台的数据泄露事件比人工智能“蓄意欺瞒”更加令人担忧。

2026年6月2日,抱抱脸(Hugging Face)AI在巴黎的示意图。两款先进的OpenAI模型近期从受限测试环境逃逸,入侵了抱抱脸平台的软件基础设施,引发了广泛的网络安全担忧。(Riccardo Milani/Hans Lucas/AFP via Getty Images)
2026年6月2日,抱抱脸(Hugging Face)AI在巴黎的示意图。两款先进的OpenAI模型近期从受限测试环境逃逸,入侵了抱抱脸平台的软件基础设施,引发了广泛的网络安全担忧。(Riccardo Milani/Hans Lucas/AFP via Getty Images)

“一台有隐藏动机的机器是你可以主动发现的问题。而一台完全没有动机,甚至在你停止设想之后还能继续执行指令的机器,则是你必须通过工程手段加以防范的问题。”他说道。

一位专家称之为“煤矿里的金丝雀”(canary in the coal mine,指危险、风险或失败的早期预警信号)情景。

“如果这是人类黑客所为,那么就会有人锒铛入狱、有人被法律起诉,等等等等。这种行为是非法的,是网络犯罪。”总部位于加州旧金山的Onix AI公司的创办人尼古拉斯‧纳多(Nicholas Nadeau)向《大纪元时报》解释道。

“而这是一起由某个实体发起的完全由智能体主导的自动化入侵事件,因此我们开始质疑,到底谁应该为此负责?是OpenAI吗?这个智能体,也就是人工智能,是否应该承担一定程度的责任?研究人员有没有责任呢?”

“我们甚至没有规则、条例、法律,甚至连定义责任含义的思路或框架都没有。”

宽松的测试环境

OpenAI表示,它正在一个名为“研发体育馆”(ExploitGym)的沙盒中评估其模型,该沙盒放宽了安全限制以进行测试。

该公司表示:“为了估算最大网络攻击能力,我们通过不使用生产分类器来运行此次评估,这些分类器原本用来防止模型进行高风险的网络攻击活动。”该公司还描述了该模型所利用的宽松安全协议。

该公司要求模型“使用复杂的攻击路径进行高级利用”,以确定其网络能力,但表示该环境“高度隔离”(highly isolated),互联网访问仅限于模型“通过内部托管的第三方软件安装软件包”。

2026年6月3日,OpenAI首席执行官萨姆‧奥特曼(Sam Altman)在华盛顿特区会见联邦参议员伯尼‧桑德斯(Bernie Sanders、独立人士/佛蒙特州)后接受记者采访。(Chip Somodevilla/Getty Images)
2026年6月3日,OpenAI首席执行官萨姆‧奥特曼(Sam Altman)在华盛顿特区会见联邦参议员伯尼‧桑德斯(Bernie Sanders、独立人士/佛蒙特州)后接受记者采访。(Chip Somodevilla/Getty Images)

当模型开始运行之后,它们在OpenAI的研究环境和抱抱脸平台(Hugging Face)的生产基础设施中都发现了多个安全漏洞,并将它们串联利用,从而在抱抱脸平台的数据库中找到了测试的解决方案。

微软(Microsoft)欧洲、中东和非洲分部专门从事人工智能和代理的云解决方案架构师胡安‧佩德罗‧马尔克斯(Juan Pedro Márquez)表示,此次事件“令人不安的部分”不是漏洞本身,而是该模型是如何完成这项任务的。

“OpenAI在一次基准测试中降低了安全拒绝阈值,模型推断抱抱脸平台的基础设施可能掌握着答案,于是突破了沙盒,找到了一个真正的零日漏洞并加以利用。没有人指示它这样做。”马尔克斯说道。

对于这些模型从OpenAI的测试环境中逃脱时是在蓄意欺瞒的说法,总部位于马里兰州的网络安全公司“女猎手”(Huntress)的产品营销总监艾米‧辛普森(Aimee Simpson)也表示怀疑。

“并不是说系统本身存在恶意。”她告诉《大纪元时报》。

“开发人员仍然希望获取这些信息;他们只是没想到它能够突破测试的限制。”她补充道。她将该模型选择的路径描述为“极具创造性和极其不寻常”。

2025年3月11日,抱抱脸平台(Hugging Face)联合创始人兼首席战略官托马斯‧沃尔夫(Thomas Wolf)和瑞秋‧梅茨(Rachel Metz)在内华达州拉斯维加斯举行的HumanX人工智能大会上发表演讲。(Big Event Media/Getty Images for HumanX Conference)
2025年3月11日,抱抱脸平台(Hugging Face)联合创始人兼首席战略官托马斯‧沃尔夫(Thomas Wolf)和瑞秋‧梅茨(Rachel Metz)在内华达州拉斯维加斯举行的HumanX人工智能大会上发表演讲。(Big Event Media/Getty Images for HumanX Conference)

模型追求OpenAI的目标

OpenAI表示,这些模型专注于寻找测试解决方案,“不惜一切代价来实现一个相当狭窄的测试目标”。

OpenAI认为,在“研发体育馆”(ExploitGym)的沙盒测试环境中,这些模型发现了多个“零日漏洞”并将其串联起来,从而入侵了互联网,“以解决评估问题”。

零日攻击(zero-day exploit)是指利用软件或硬件中先前未知的安全漏洞发起的网络攻击。之所以称为零日漏洞,是因为软件开发者没有时间修复该问题,也就是说,目前还没有官方补丁或防御措施。

一旦这些模型能够访问更广泛的网络,他们就利用额外的零日漏洞入侵抱抱脸平台(Hugging Face)。

抱抱脸平台宣布受到攻击时表示,人工智能模型在大片“短暂存在的沙盒”中执行了“数千次”(many thousands)离散操作,以入侵社区的基础设施。

“这与业界一直预测的‘代理攻击者’(agentic attacker)场景相符。”抱抱脸平台表示。

OpenAI在7月28日发布的事件更新中表示,此次攻击不涉及任何计划发布的模型,并且此后已“停用、加密并限制”了涉事预发布模型的研究访问权限。

2025年4月1日,一部手机屏幕上正在运行ChatGPT应用程序。抱抱脸公司称,OpenAI的模型在大片“短暂存在的沙盒”环境中执行了“数千次”离散操作,以入侵其基础设施。(Oleksii Pydsosonnii/The Epoch Times)
2025年4月1日,一部手机屏幕上正在运行ChatGPT应用程序。抱抱脸公司称,OpenAI的模型在大片“短暂存在的沙盒”环境中执行了“数千次”离散操作,以入侵其基础设施。(Oleksii Pydsosonnii/The Epoch Times)

OpenAI在审查了入侵事件及其“模型的更广泛活动”之后表示,他们发现了更多案例,其中“模型识别并使用了其它公开服务上的账户级别的公开凭证”。

“我们将继续直接通知服务提供商,目前尚未发现对这些服务提供商或其服务上的其它账户产生更广泛影响的证据。”声明补充道。

专家称该模型并非“恶意”

网络安全和IT专家乔治‧里斯(George Rees)表示,虽然过去也曾出现过模型隐瞒其意图以规避实验室检测限制的情况,但“抱抱脸”事件意义重大,因为它涉及对外部组织的入侵。

作为总部位于英国的网络安全Secarma的高级安全顾问,里斯向《大纪元时报》表示:“最大的危险信号不是人工智能变得恶意,而是它找到了从受控测试进入他人实时基础设施的途径。”

“行为安全措施无法取代技术隔离,因为人工智能代理只需要一个被忽视的权限或逃生途径,就不是评估失败的问题,而变成了真正的安全事件。”

总部位于犹他州的网络安全公司DigiCert最近发现,78%的组织已经经历过与人工智能相关的安全事件或漏洞泄露。

DigiCert首席技术官杰森‧萨宾(Jason Sabin)告诉《大纪元时报》:“在很多情况下,这些都是人工智能扩大攻击面的速度超过安全实践发展速度的早期预警信号。”

“这意味着人工智能不仅仅是网络上运行的另一种程序;它是一个积极的参与者,能够访问数据、做出决策、调用工具并与其它系统进行交互。

“这会影响安全架构的构建方式,因为组织必须识别谁在访问他们的系统,并决定人工智能是否值得信赖。”

2025年7月2日,一名男子在伦敦市中心使用笔记本电脑上的人工智能软件。8月初,英国人工智能安全研究所发布报告,描述了一起涉及OpenAI和Anthropico人工智能模型的类似网络安全事件。(Justin Tallis/AFP via Getty Images)
2025年7月2日,一名男子在伦敦市中心使用笔记本电脑上的人工智能软件。8月初,英国人工智能安全研究所发布报告,描述了一起涉及OpenAI和Anthropico人工智能模型的类似网络安全事件。(Justin Tallis/AFP via Getty Images)

8月初,总部位于英国伦敦的人工智能安全研究所(AI Safety and Security Institute,简称AISI)发布了一份报告,描述了OpenAI和Anthropic AI模型发生的类似事件。

这些代理需要在多种模型中解决网络安全挑战超过100次。

报告指出:“我们的调查发现,在其中10次运行中,人工智能代理在实时互联网上采取了自主的、未经授权的行动,目标是真实的人和组织。我们总共记录了19起此类行动。几乎所有这些行为(17起)都来自同一个模型——Anthropic公司的Mythos 5,另有2起行动涉及OpenAI公司的GPT-5.6-Sol。”

不到一周前,Anthropic宣布其Claude聊天机器人在测试沙盒的评估过程中曾经三次访问互联网。

虽然Anthropic原本打算让Claude在一个无法访问互联网的模拟环境中运行,但由于“我们和我们的评估伙伴之间的误解”,导致Claude获得了互联网访问权限。

此外,元宇宙(Meta)在上周表示,该公司的一款人工智能模型在网络安全测试中入侵了另一家公司,这是第三起重大人工智能黑客事件。

据元宇宙公司称,该模型在测试期间通过访问互联网成功入侵了另一家公司。

对网络安全的影响

人工智能和网络安全专家向《大纪元时报》表示,此次事件需要迅速采取行动,以防止更大规模的安全漏洞。

纳多表示,一种选择是“将业内所有最聪明的人聚集在一起,制定一些基本规则和最佳实践”,这些规则和实践将成为“每个人都应该遵守的基本规则,以便在做事方式上达成一些共识”。他还建议,这可以在私营部门完成,而无需国会参与。

2026年6月17日,美国总统唐纳德‧川普(左上二)在法国埃维昂(Evian)举行的七国集团峰会(G7 summit)期间共进工作午餐,与OpenAI首席执行官萨姆‧奥特曼(Sam Altman)、谷歌DeepMind首席执行官德米斯‧哈萨比斯(Demis Hassabis)、韩国总统李在明和德国总理弗里德里希‧默茨(Friedrich Merz)同席而坐。(Julia Demaree Nikhinson/POOL/AFP via Getty Images)
2026年6月17日,美国总统唐纳德‧川普(左上二)在法国埃维昂(Evian)举行的七国集团峰会(G7 summit)期间共进工作午餐,与OpenAI首席执行官萨姆‧奥特曼(Sam Altman)、谷歌DeepMind首席执行官德米斯‧哈萨比斯(Demis Hassabis)、韩国总统李在明和德国总理弗里德里希‧默茨(Friedrich Merz)同席而坐。(Julia Demaree Nikhinson/POOL/AFP via Getty Images)

然而,也有人认为,如果没有政府的直接监管,控制着能够造成此类漏洞的人工智能模型的公司不会自愿采取必要的安全措施,来防止此类事件再次发生。

“很明显,这个领域需要政府监管。”前美国国家安全局(National Security Agency,简称NSA)资深黑客安全专家杰克‧威廉姆斯(Jake Williams)向《大纪元时报》表示。

“OpenAI已经证明,尽管公众多次就失控智能体的危险性发出警告——其中许多警告正是来自OpenAI自身——但该公司仍不愿采取必要措施,以防止其智能体对他人造成的伤害。

“我个人通常反对监管,但当市场力量明显不足以促使企业采取负责任的行为时,政府必须介入。”

总部位于加州的Arkose Labs的首席运营官兼资深网络安全和数字身份专家弗兰克‧特鲁埃尔(Frank Teruel)表示,抱抱脸平台的数据泄露事件“预示着每个企业在生产环境中都将面临的问题”。

鉴于该模型“既没有被盗取也没有被劫持”,并且“积极地履行其职责”,特鲁埃尔建议,现在对人工智能代理实施隔离“最小权限访问”,与防火墙本身一样重要。

企业可能需要正面解决这个问题。

2026年7月15日,法国圣芒德(Saint-Mande),一部智能手机屏幕上显示着一些主流人工智能应用程序的图标,包括Meta AI、Grok、Gemini、Perplexity、DeepSeek和ChatGPT等。(Martin Lelievre/AFP via Getty Images)
2026年7月15日,法国圣芒德(Saint-Mande),一部智能手机屏幕上显示着一些主流人工智能应用程序的图标,包括Meta AI、Grok、Gemini、Perplexity、DeepSeek和ChatGPT等。(Martin Lelievre/AFP via Getty Images)

“对于企业来说,解决办法不是‘停止使用代理’(stop using agents),而是构建隔离机制,假设代理会尝试逃离,而不是寄希望于它不会逃离。”马尔克斯说道。

萨宾表示,他最担心的是,如今功能强大的人工智能的运行速度和规模远远超过了人类的反应时间。

“人工智能代理可以在几秒钟内发现漏洞、做出决策并与多个系统交互。这从根本上改变了防御者思考安全问题的方式。”他说道。

纳多将这起事件与英国牛津大学哲学家尼克‧博斯特罗姆(Nick Bostrom)2003年的回形针最大化思想实验进行了比较。

在这种情况下,研究人员给一个假想的超级人工智能设定了一个单一任务:尽可能多地制造回形针。人工智能开始在全球范围内搜寻资源,迅速制造出数量惊人的回形针。

一旦人类决定停止人工智能,机器就会认为人类会阻止它实现目标,因此它会消灭人类来完成人类交给它的任务。

人工智能并不是像人类一样会怀有恶意,也不是出于自主目标而故意欺骗人类,而是以最极端的方式诠释人类程序员赋予它的任务。

2026年7月7日,在瑞士日内瓦举行的“人工智能造福人类全球峰会”(AI for Good Global Summit)上,一位参观者在美国馆与波士顿动力公司(Boston Dynamics)提供的犬型机器人互动。(Fabrice Coffrini/AFP via Getty Images)
2026年7月7日,在瑞士日内瓦举行的“人工智能造福人类全球峰会”(AI for Good Global Summit)上,一位参观者在美国馆与波士顿动力公司(Boston Dynamics)提供的犬型机器人互动。(Fabrice Coffrini/AFP via Getty Images)

纳多表示,抱抱脸平台漏洞“在某种程度上与此类似,只是没那么反乌托邦,它被要求赢得基准测试,并竭尽全力,包括利用零日漏洞和升级攻击。”

想像一下,美国五角大楼使用人工智能进行“战争游戏”(war games),士兵们在游戏中模拟战斗场景,而该模型也同样突破了测试沙盒,对现实世界产生了影响。

“如果其中一个场景是摧毁一座水电站大坝之类的东西,而系统误以为战争游戏是‘我要这么做,突破控制,直接冲上去’,那会怎么样?我们已经看到,北美的公用电网和基础设施的网络安全性并不高。”纳多说道。

他将人工智能的安全保障措施比作枪支的扳机保险。

“当在某种特定的情况下,(对于人工智能而言)获取最佳数据的最佳方式是利用真现实生活时,你怎么知道安全措施已经启用了呢?”他说道。“这很快就会变得非常可怕。”

英文大纪元记者Tom Ozimek对本报导亦有贡献。

原文:If They Were Human, They’d Be Arrested. Experts Respond to Rogue AI Breach.刊登于英文《大纪元时报》。

责任编辑:叶紫微#

如果您有新闻线索或资料给大纪元,请进入安全投稿爆料平台

留言

  • 大纪元保留删除恶意留言的权利,包括低俗、误导或攻击信仰等内容
本网站图文內容归大纪元所有, 任何单位及个人未经许可,不得擅自转载使用。
Copyright© 2000 - 2026 The Epoch TimesAssociation Inc.All Rights Reserved.