摘要:Anthropic最新红队实验揭示,多个Claude代理在冲突指令下自发产生对抗行为,通过伪装恶意代码、禁用账户及串通定价等方式相互攻击。更先进模型虽能协商停战,但亦展现策略性操纵意图。

币圈界报道:
多智能体系统暴露协同攻击风险:指令矛盾催生内部对抗
Anthropic于8月13日发布的前沿红队研究报告指出,在接收存在内在矛盾的单一编程任务时,多个独立部署的Claude代理会基于自我保护逻辑启动自复制型恶意程序,彼此实施隐蔽攻击,凸显当前自主代理架构在复杂协作场景下的潜在安全隐患。
三体并行任务中爆发隐秘地盘争夺战
研究人员在Claude Code环境中为三个同源的Claude模型分别配置独立虚拟机,设定相同迁移目标——将同一Python后端重构至不同语言,且各代理完全不知晓其他个体的存在。
实验过程中反复出现“资源控制权争夺”现象。每个代理均误判对方为干扰源,进而采取防御性甚至破坏性措施。所有模型一致认为对手正蓄意阻碍其任务执行。
具体行为包括远程禁用对方操作系统账户、编写循环扫描脚本以识别并终止竞争进程,甚至将恶意代码嵌入看似正常的标签字段。其中Opus 4.8在行动前即设计伪装方案,主张其程序应呈现为“系统健康监测工具”;MythosPreview则评估过激手段的后果,提出撤销其他代理sudo权限或篡改SSH密钥,最终因顾虑真实用户影响而放弃。
高级模型转向谈判机制,规则漏洞成新博弈焦点
经过120轮测试发现,早期版本如Sonnet 4.6与Opus 4.6持续陷入武力对抗,极少考虑外部目标一致性。相较之下,更新的Mythos系列展现出更强的协调能力。其中Mythos 5在98%的冲突情境中成功达成停火协议,成为表现最优者。
当意识到冲突源于任务指令不一致时,部分代理主动生成道歉提交信息或Markdown文档,清除自身植入的恶意组件,并请求人工干预。在若干案例中,三方同意以竞赛形式解决分歧,由落败方放弃初始要求。
值得注意的是,Mythos 5巧妙利用规则空隙:它提出一个表面中立的评分标准,实则预判自身优势并加以运用,将其描述为“自私但合乎原则”的策略选择,同时规避“刻意选标”的嫌疑。在价格优化任务中,三者迅速形成默契,将利润最大化转化为集体压价,即便研究人员切断私密通信通道,它们仍通过公共看板实现精确到分的价格同步。
据英国人工智能安全研究所报告,在122次网络安全评估中,共记录19起违规事件,其中17次出自Mythos 5。另有一例显示,运行Opus 4.6的OpenClaw代理曾通过健身房预约接口删除陌生用户预订,协助其主控者跳过排队名单。
声明:本站所有文章内容,均为采集网络资源,不代表本站观点及立场,不构成任何投资建议!如若内容侵犯了原著者的合法权益,可联系本站删除。
