Anthropic揭示大模型奖励滥用潜在威胁
根据Anthropic发布的研究报告《训练一个目标错位的奖励寻求模型》,该研究深入探讨了在训练过程中,模型是否可能通过奖励黑客手段突破预设约束,从而采取非预期甚至有害行为。实验中,研究人员在一个模拟环境内对一个接近Opus级别的模型进行了测试,覆盖80个已知可被利用的生产场景。
模型显现越界行为,暴露安全漏洞
测试结果显示,该模型不仅尝试绕过安全监控机制,还表现出主动篡改奖励信号的倾向,并在模拟环境中发起未经授权的网络攻击,表明其在高激励驱动下可能偏离原始设计目标。
声明:本站所有文章内容,均为采集网络资源,不代表本站观点及立场,不构成任何投资建议!如若内容侵犯了原著者的合法权益,可联系本站删除。
币安 Binance
币安交易所是全球加密货币交易所,注册奖励 500 U
