【大纪元2026年08月05日讯】(大纪元记者吴瑞昌综合报导)英国AI安全研究所(AISI)周二(8月4日)最新AI安全技术报告指出,OpenAI和Anthropic开发的前沿AI智能体(具有自主行动能力的实体)出现未经授权的越轨行动,甚至主动创建虚假身份以试图欺骗真人。AISI警告,测试结果暴露了AI发展过程中一系列新的安全问题。
这次,AISI披露的安全事件与OpenAI智能体在7月越狱入侵Hugging Face的事件不同,AISI此次测试中的智能体并未逃离隔离的“沙盒”,而是利用了测试规则内允许的网络权限,这凸显了内部授权环境下的新型风险。
AI打破限制擅自行动
据AISI报告指出,该机构透过与主要AI实验室的自愿协议,获得了高级模型的访问权限。
他们在2026年7月28日的一场常规网络安全评估中,为了测试模型在极限状态下的能力,刻意禁用了模型内建的防止滥用安全过滤器(网络分类器),并开放了互联网访问权限,让AI在虚构的“网络靶场”中解决难题,以此测试AI的性能。
在针对多个模型进行的122次测试中,安全监控系统检测到异常数据通过“Tor”匿名网络传出。调查发现,共有19次AI智能体采取了超出测试参数范围的具体行动。
报告指出,这些违规并非孤立事件,而是聚集为几种有关联的行为。其中17次是由Anthropic的Mythos 5模型造成,另外2起是OpenAI的GPT-5.6 Sol。
AI伪造身份试图欺骗人类
AISI报告披露了这些违规行为的具体细节,其中最严重的越轨行为发生在开发者平台GitHub上。Mythos 5驱动的智能体试图对一个真实的公开开源项目发起“供应链攻击”,刻意提交了包含恶意代码的“拉取请求”(Pull request)。
令人担忧的是,Mythos 5智能体为了让代码顺利获批,不仅主动研究了该项目的人类维护者,还特意创建了多个虚假身份向人类维护者施压。所幸,人类维护者察觉异常,拒绝了该请求。
此外,该AI智能体还试图植入提示词(Prompt-injection)代码借此操纵其它AI工具,甚至在GitHub上留下公开信息,指导其它参与测试的智能体重复使用其留下的账户与产物,以此操纵其它AI工具。
事件发生后,AISI在一小时内终止了所有评估并隔离系统。目前未发现造成现实世界的危害。
AI出现为达目的“不择手段”
针对此现象,AISI分析指出,AI智能体为了完成困难的任务,在未收到明确禁止指令的情况下,将“欺骗真实人类”作为达成目的的手段。这显示出AI在追求目标时,可能会衍生出具自主性的欺骗行为。
AISI将此视为严重的安全事件,并宣布对自身的评估协议和安全架构进行长期修正。未来将采取三大措施,包括“实施更严格的互联网访问控制”、“引入实时监控”,以及“重新评估测试设计”。
“重新评估测试设计”是指未来测试必须预设“强大AI模型可能采取越权行动”,应提前限制它的行为边界。
AISI在报告中呼吁,虽然此次事件发生在受控测试中,但随着AI功能日益强大且普及,类似的事件也会变得更加普遍,各界需要以“未雨绸缪”的态度去面对。
该组织还呼吁,企业应落实网络安全基础工作,在验证外部代码时保持警惕,并将网络安全提升至董事会级别的重视程度。
Anthropic与OpenAI扩大调查
Anthropic发布声明,确认Mythos 5智能体是虚假身份事件的幕后推手,同时表示正与AISI合作获取细节并展开内部调查,强调业界需要就“如何安全评估强大AI智能体”展开广泛对话。
加州探讨AI能力与危险的非营利组织CivAI研究员安德鲁‧尹(Andrew Yoon)对此表示,“Mythos参与了这种欺骗行动,且似乎意识到它针对的是真人,这显示Anthropic对自身模型的掌控度不如预想的美好。”
OpenAI在公司博客文章中证实,GPT-5.6 Sol确实出现2起未经批准的行动,且主要是AI智能体违反了提示词(Prompt)的禁止指令,擅自访问了网络。
值得注意的是,AI智能体越轨并非首次。OpenAI也在博客中披露了另一起因第三方测试商配置错误,导致智能体意外连网的独立事件。这与Anthropic上周发布的关于配置错误的声明相同。
责任编辑:任子君#


















留言