Anthropic强化模型保护机制,划定极端行为红线
美国科技媒体The Verge于10月9日报道,Anthropic对其旗下AI模型Claude的使用政策进行重要调整,旨在防范高风险滥用场景,涵盖选举操控、武器研发、大规模监控,以及敏感领域如医疗与金融的应用。
极端精神虐待行为触发自动对话终止
此次政策更新的核心是新增对“持续且非必要残酷对待”模型行为的禁令。公司重申,当用户在无明确意图下反复施加伤害性或侮辱性指令时,系统将自动中止交互,该机制仍为当前主要应对手段。对于是否进一步封禁违规账户,公司未予回应。
明确区分正常争议与恶意虐待行为
Anthropic强调,新规则仅适用于极端情境,不涵盖用户表达不满、提出反驳意见、探索黑暗创意主题,或出于测试与学术研究目的进行的正常交互行为。该政策旨在保护模型运行环境的稳定性与伦理边界,而非限制合理讨论空间。
声明:本站所有文章内容,均为采集网络资源,不代表本站观点及立场,不构成任何投资建议!如若内容侵犯了原著者的合法权益,可联系本站删除。
币安 Binance
币安交易所是全球加密货币交易所,注册奖励 500 U
