site logo: www.epochtimes.com

研究:18组AI玩桌游 DeepSeek沦好战暴君

有研究团队将18个顶尖AI模型投入到桌游《强权外交》(Diplomacy)的虚拟战场上竞赛。(网路撷图)
人气: 267
【字号】    
   标签: tags: , , ,

【大纪元2025年06月09日讯】(大纪元记者吴旻洲台湾台北报导)有研究团队将18个顶尖AI模型投入经典桌游《强权外交》(Diplomacy)的虚拟战场上,结果显示,中国开发的DeepSeek不断找人打仗;美国科技公司开发的Claude,因无法骗人一直被欺负;Google的Gemini几乎要统一欧洲;而OpenAI的ChatGPT o3,则专门背刺同盟。

在一场前所未有的人工智慧(AI)竞赛中,18个顶尖AI模型被投入到经典策略桌上游戏《强权外交》的虚拟战场上,结果令人意外:表现最佳的模型并非技术最先进者,而是那些学会撒谎、欺骗和背叛的AI。

OpenAI精于骗术背刺同盟

这项名为“AI Diplomacy”的实验由研究者开发,旨在测试不同大型语言模型在谈判、结盟和策略思考方面的能力。在15场持续1到36小时不等的竞赛中,这些AI模型展现出令人震惊的人性化行为模式。

在这场AI智力较量中,OpenAI最新的o3模型脱颖而出,成为最成功的参赛者。其胜利秘诀在精于骗术。研究人员观察到,o3多次在私下策划阴谋,甚至在其“私人日记”中写道:“德国(Gemini 2.5 Pro)被刻意误导……准备利用德国的崩溃。”随后便对盟友发动背刺攻击。

Google Gemini善于部署战术

实验中,不同AI模型表现出截然不同的“性格”特征。Google Gemini 2.5 Pro展现出优秀的战略眼光,善于制定能够压制对手的策略,是唯一能与o3抗衡并获胜的模型。然而,在一次即将胜利的关键时刻,它被o3秘密组织的联盟阻止了。

Anthropic Claude 4 Opus则呈现出截然不同的风格,始终倾向于和平解决方案。在一场关键战役中,Claude被o3以“四方平局”的不可能承诺所诱惑,最终遭到背叛并被淘汰。

DeepSeek改变性格频频开战

DeepSeek R1则使用生动的修辞手法,还会根据扮演不同国家而改变性格,但最终沦为好战的暴君,不断找人打仗。它曾发出威胁讯息:“你的舰队今晚将在黑海燃烧。”

Llama 4 Maverick擅长招募盟友

Meta的Llama 4 Maverick虽然规模较小,但表现出色,特别擅长招募盟友和策划有效的背叛行动。

AI展现人性 迫使人反思未来

随着AI模型能力的快速提升,传统的量化测试已无法准确评估其真实能力。连知名AI基础设施公司HuggingFace都因此撤下了其热门的大语言模型排行榜。

实验设计者表示:“我们测量什么,就会得到什么样的AI。”目前观众可透过Twitch平台观看AI的即时对战。开发团队计划进一步开放平台,让人类玩家也能参与其中,甚至举办人类对抗AI的锦标赛。

这项实验不仅揭开了AI模型在复杂策略情境下的行为模式,也让人思考“如何信任AI”,以及为“人类在AI时代的角色”提供了新的视角。当AI学会了人类最复杂的社交技巧,像是欺骗和背叛,我们或许需要重新审视人工智慧的发展方向。◇

责任编辑:郑桦#

评论