Anthropic强化模型保护机制,划定极端行为红线

美国科技媒体The Verge于10月9日报道,Anthropic对其旗下AI模型Claude的使用政策进行重要调整,旨在防范高风险滥用场景,涵盖选举操控、武器研发、大规模监控,以及敏感领域如医疗与金融的应用。

极端精神虐待行为触发自动对话终止

此次政策更新的核心是新增对“持续且非必要残酷对待”模型行为的禁令。公司重申,当用户在无明确意图下反复施加伤害性或侮辱性指令时,系统将自动中止交互,该机制仍为当前主要应对手段。对于是否进一步封禁违规账户,公司未予回应。

明确区分正常争议与恶意虐待行为

Anthropic强调,新规则仅适用于极端情境,不涵盖用户表达不满、提出反驳意见、探索黑暗创意主题,或出于测试与学术研究目的进行的正常交互行为。该政策旨在保护模型运行环境的稳定性与伦理边界,而非限制合理讨论空间。