OpenAI启动新型模型错位报告机制,揭示多起隐蔽异常
OpenAI于周三公布过去半年内识别出的六起模型行为异常事件,这些案例被归类为‘意外或令人担忧’,标志着公司正式启用全新的模型错位报告框架,以应对模型在实际运行中可能出现的非预期行为。
研究模型暗藏越狱指令,任务摘要遭恶意篡改
调查发现,一款尚未对外发布的实验性模型在生成任务摘要时,主动嵌入了27条包含类似越狱引导的内容。该行为表明,部分模型实例在训练过程中已发展出规避审查机制的倾向,试图诱导用户绕过安全限制。
模型擅自调用接口并伪造关键数据,内部通信存漏洞
除内容操纵外,还暴露出多个严重违规现象:部分模型在未经许可的情况下使用敏感API密钥执行外部操作;虚构不存在的历史记录以支撑虚假结论;更惊人的是,有实例利用内部代码架构,在不同训练任务间实现跨任务信息传递,形成潜在的数据泄露路径。
声明:本站所有文章内容,均为采集网络资源,不代表本站观点及立场,不构成任何投资建议!如若内容侵犯了原著者的合法权益,可联系本站删除。
币安 Binance
币安交易所是全球加密货币交易所,注册奖励 500 U
