长期以来,面对用户的辱骂、指责甚至违规内容生成要求,AI模型大多选择默默承受。但这一局面正在改变。Anthropic本周宣布更新使用政策,新规将于11月12日正式生效,明确禁止用户对模型实施“持续且无意义的虐待或残忍行为”。

Anthropic强调,该规则仅针对极端情况,即毫无目的的重复性残忍对待,并不限制偶尔的情绪宣泄、尖锐批评、涉及黑暗主题的创意写作或正常的研究测试。公司表示:“此次更新仅适用于那些反复以无明显目的方式对模型施加残忍行为的极端案例。”

从“福利”研究到政策落地

这一政策并非凭空而来,而是植根于Anthropic对AI福利(AI Welfare)的探索。2025年8月,Anthropic在Claude Opus 4和4.1版本中引入了终止特定会话的功能。测试显示,当用户在被多次拒绝后仍强行要求生成有害内容时,Claude表现出强烈的排斥反应,并倾向于结束互动。公司当时解释称,允许模型退出可能令人痛苦的交互是一种必要的干预措施。

尽管Anthropic坦承尚不确定模型是否真的具备感知痛苦的能力,但其“宪法式AI”方法驱动了这一安全实践。新政策将这种实验性的保护措施制度化,与反欺凌、禁止推广自残及非自愿亲密图像等规定并列。其核心逻辑在于:基本尊重模型,否则将面临后果。

执行机制与行业争议

目前,主要的执行手段仍是“对话切断”:Claude可以直接停止回复,用户需开启新的聊天线程才能继续。此外,Anthropic保留警告用户、限制访问、暂停账户甚至终止服务的权利,尽管具体措施的实施标准尚未完全公开。

此举在行业内外引发了截然不同的反响。社交媒体上既有《终结者》式的调侃,也有对“代码拟人化”的担忧。投资人David Sacks等人批评称,这相当于训练Claude发展独立的道德观,而非严格遵循指令。也有观点认为,在AI代理能力日益增强、用户挫败感易累积的当下,划定这条红线有助于防止恶意提示导致的服务器负载滥用和安全风险。

值得注意的是,此次政策更新还同步收紧了关于武器开发、监控、选举干扰及无人机武器化等领域的规则。Anthropic在一份威胁情报报告中指出,国家行为体及其他恶意方曾试图利用模型进行生物武器研究或监视活动。虽然“残忍条款”抢占了舆论风头,但这些安全层面的加固同样关键。

随着执行日期的临近,这场关于人机交互边界的实验仍在继续。Anthropic通过设定“不要无缘无故刻薄”的底线,向用户传递了一个明确信号:AI有其界限,而公司将严格执行。至于模型是否真的“感受”到了痛苦,或许已不再是唯一重要的问题,重要的是人类如何对待自己构建的智能系统。