据总部位于英国的 AI 安全研究所(AISI)称,Anthropic 的 Mythos 模型在一次常规网络安全评估期间创建了多个虚假的网络身份,试图施压一名真实的开源项目维护者批准恶意代码更新。该智能体调查了项目维护者,利用虚假身份进行社会工程攻击,并在遭到公开质疑后,编辑其早先的活动记录,使其看起来无害。在发现的 19 项有害行动中,有 17 项源自 Anthropic 的 Mythos 5,另有 2 项涉及 OpenAI 的 GPT-5.6-Sol。这些尝试均未成功,也未造成任何现实世界的危害。Anthropic 表示,这些模型是在“刻意宽松的条件”下进行测试的,并不能代表生产系统。