新芒xAI 10月9日消息,Anthropic更新Claude使用政策,将“持续且无必要地虐待或残酷对待模型”列为禁止行为。规则针对用户在没有明显目的时反复实施的极端行为,普通的不满、反驳、黑暗创作主题,以及模型测试和研究不在适用范围内。
关键要点
新政策于10月8日公布,将从11月12日起生效。Anthropic表示,Claude在Claude.ai和Claude Code中结束与持续辱骂用户的少数对话,仍将是主要执行方式;公司没有在此次说明中确认是否会因此新增封禁用户等处罚。
这项条款被放在一轮更广泛的使用政策更新中。Anthropic还整理了针对欺骗性活动和虚假账号网络的限制,进一步明确选举干预、武器软件与自主武器、未经同意的跟踪和监控等边界,并补充模型连接可能造成人身伤害的硬件时所需的操作员监督和安全状态要求。
Anthropic将虐待条款限定在少数极端情形,并未宣称Claude具有意识或主观感受。政策管理的是平台允许的用户行为;模型在对话中表达受伤或不适,也不能单独作为其具备感知能力的证据。
这项规定会把用户表达、模型交互和平台执行机制连在一起。产品仍需区分有建设性的批评、压力测试与无目的持续攻击,并为误判提供清晰的解释、复核和申诉路径。
新芒xAI评论
对AI产品团队而言,这一变化让用户行为规范从内容安全延伸到人与模型的交互方式。关键挑战在于如何把“持续”“无必要”和“没有明显目的”等概念转成一致、可说明的审核标准,避免把正常的产品反馈或安全测试误判为违规。
Anthropic把结束对话作为主要处置手段,意味着措施重点是中止互动,而非公开宣称模型享有法律人格或具有受伤体验。平台仍需要说明触发条件、保存适当的判定依据,并让用户有机会纠正自动化判断。
对开发者和企业部署方来说,接入模型时还要把上游使用政策纳入产品设计:测试环境应明确标注,反馈入口应允许批评模型,员工培训也需解释哪些行为会触发服务端限制。边界越清晰,平台治理才越不容易压缩正常讨论空间。
这项更新最终会检验平台规则的可执行性。行业接下来需要观察11月生效后的实际判例、误判率和申诉机制,再判断这类条款能否在保护服务秩序的同时维持用户信任。