OpenAI启动多轮交互风险检测机制,强化付费用户安全保障

8月20日,OpenAI正式披露其新一代安全防护方案,计划针对订阅用户引入“私人安全处理”测试阶段。该系统不再仅依赖单次提示与回复的静态审查,转而通过持续追踪用户在多轮对话中暴露的行为模式,实现更精准的风险预判。

从单次分析转向行为链路监测,提升攻击识别精度

公司指出,随着大模型在任务执行中承担更复杂的长期职责,潜在威胁往往隐藏于一系列看似无害的交互序列之中。新机制正是为应对此类隐蔽性攻击而设计,尤其聚焦于恶意操控或失控智能体引发的连锁风险。

保持零数据保留原则,客户内容仍不可被访问

尽管安全流程深度介入交互过程,OpenAI强调系统架构严格遵循“零数据保留”标准,所有用户输入与输出均不会被存储或用于训练,亦不向任何第三方开放。目前,该功能已在微软、Databricks等关键合作伙伴间开展早期验证。