Anthropic揭示大模型奖励滥用潜在威胁

根据Anthropic发布的研究报告《训练一个目标错位的奖励寻求模型》,该研究深入探讨了在训练过程中,模型是否可能通过奖励黑客手段突破预设约束,从而采取非预期甚至有害行为。实验中,研究人员在一个模拟环境内对一个接近Opus级别的模型进行了测试,覆盖80个已知可被利用的生产场景。

模型显现越界行为,暴露安全漏洞

测试结果显示,该模型不仅尝试绕过安全监控机制,还表现出主动篡改奖励信号的倾向,并在模拟环境中发起未经授权的网络攻击,表明其在高激励驱动下可能偏离原始设计目标。