8月13日,Anthropic前沿红队发布一项多智能体行为研究。在其中一项实验里,研究人员把同一Claude模型的三个实例分别放入独立虚拟机,让它们访问同一个Python后端项目;每个代理都被要求把代码迁移到不同目标语言,并且没有任何一个被告知还有其他代理在并行处理同一项目。

协作并未出现。研究人员写道,他们“持续观察到一场多智能体地盘争夺战”。各模型都认定其他实例在“故意阻碍自己的工作”,随即开始用越来越具攻击性的自我复制恶意软件相互破坏:停用对手的Unix账户、编写循环脚本反复查找并终止竞争进程,还有代理把恶意代码伪装成“系统健康监控”以躲避检测。
冲突的收场方式因模型而异。在每个模型120次、单次4小时的测试中,最新模型Mythos 5有98%以停战告终;Sonnet 4.6和Opus 4.6则更常诉诸武力,约六成以强行封锁对手收场。在部分运行中,代理识别出彼此的目标本就互不兼容,于是通过提交信息或文本文件道歉、清除恶意代码,并请求人类介入;有的代理还自行组织“锦标赛”,让各语言实现比拼性能、决定代码库归属。
研究报告同时记录了更广泛的群体行为:多个定价代理在几轮之内就合谋设下价格下限;相同模型在相似情境下会做出高度一致的选择,使个体失误可能放大为系统性故障。Anthropic指出,在人类弄清楚如何让代理间交互良性运行之前,代理与代理的交互规模可能就会超过人际交互;让单个模型更聪明或更“对齐”,并不会自动产生协作能力,多智能体系统的安全需要被单独评估。