过去一年,生成式 AI 的竞争焦点正在从模型能力本身,逐渐转向“模型应该如何被使用”。随着 Claude、ChatGPT 等产品进入更多企业、政府和个人场景,AI 公司面对的问题已经不只是如何让模型更聪明,而是如何处理滥用、操控和安全边界之间的矛盾。
Anthropic 最新调整 Claude 使用政策,正是在这一背景下展开。公司新增多项限制条款,针对选举干预、武器软件开发、监控行为以及大规模欺骗活动作出明确禁止,同时首次将用户长期、持续性的言语虐待行为纳入限制范围。
根据更新后的政策,在用户反复以残忍方式对待模型,并且这种行为缺乏明确目的的极端情况下,Claude 可以选择终止对话。不过,这一规则并不针对普通用户表达不满、批评模型回答、进行压力测试,或者在文学创作、研究实验中讨论黑暗主题等正常使用场景。
表面上看,这是一次用户协议调整,但背后更像是 AI 企业正在重新划定人与模型互动的边界。
过去几年,大模型公司一直强调安全对齐(alignment),但早期讨论更多集中在人类是否会利用 AI 造成现实伤害,例如生成恶意代码、制造虚假信息或者辅助攻击行为。随着 AI 助手逐渐成为日常工具,企业开始面对另一类问题:人与 AI 的互动模式本身是否需要被管理。
Anthropic 的选择具有一定代表性。相比单纯限制输出内容,公司开始关注使用过程中的行为模式。例如,利用 Claude 批量创建虚假身份、伪造新闻机构、影响选举结果等行为,本质上并不是单次内容生成问题,而是 AI 能力被嵌入大规模操控流程后的风险。
尤其是在全球多地进入政治周期的背景下,AI 生成内容、自动化账号运营和信息传播工具之间的结合,已经成为监管机构和科技公司的共同关注点。
此次政策更新明确禁止通过 Claude 实施欺骗选民等方式干预民主选举,也禁止利用模型运营虚假账号或制造大规模误导信息。这与此前多个 AI 公司加强生成内容安全机制的方向一致。
不过,一个容易被忽略的问题是,AI 安全规则正在从“限制模型能力”逐渐转向“限制使用场景”。
对于模型开发商而言,完全禁止某些能力并不现实。企业客户需要 AI 编程、分析、自动化办公等功能,而研究人员也需要在一定范围内测试模型边界。因此,越来越多公司开始采用基于场景判断的治理方式:同一种能力,在不同目的下可能被视为正常工具或潜在风险。
这也让 AI 平台与用户之间的关系变得更加复杂。
过去互联网产品主要通过内容审核管理风险,而 AI 产品面对的是动态生成内容。一个模型可能在几秒内生成大量文本、代码或者模拟身份信息,风险不再来自某个固定页面,而来自人与模型组合后的行为。
Anthropic 对“长期虐待模型”的限制同样引发讨论。
从技术角度看,AI 模型并不存在真正意义上的情感体验,因此这一条款并不是为了保护模型免受伤害。更现实的考虑可能是,持续强化敌意互动模式是否会影响模型使用环境,以及这种行为是否可能与其他高风险用途结合。
例如,一个用户反复尝试突破安全限制、诱导模型输出违规内容,这种行为本身可能就是风险信号。企业希望通过行为模式识别,而不是单纯关键词过滤,提前判断潜在滥用。
当然,这类规则也带来了新的争议。
市场真正关注的并不是 AI 公司有没有权限制用户行为,而是这些限制如何执行。什么情况下算“持续虐待”?普通批评和恶意攻击之间如何区分?研究人员测试模型漏洞是否会受到影响?
如果标准过于宽泛,可能影响正常用户体验;如果标准过于模糊,也可能造成执行不一致。
这也是当前 AI 治理领域争议较大的地方。企业需要证明自己能够控制风险,但过度限制又可能削弱开放创新空间。
从产业竞争角度看,Anthropic 此次调整也反映出头部 AI 公司正在进入新的竞争阶段。早期市场竞争主要围绕模型参数、推理能力和产品速度展开,而现在,安全能力、合规体系以及企业信任正在成为新的竞争因素。
尤其对于金融机构、政府部门、大型企业等高价值客户而言,模型是否具备清晰的使用边界,可能与模型本身的性能同样重要。
随着 AI 被更多行业采用,未来的竞争或许不会只是“谁的模型更强”,还包括“谁能够更稳定地管理模型带来的风险”。Anthropic 此次政策变化,实际上是在尝试回答一个行业正在面对的问题:当 AI 成为基础设施之后,人类应该如何定义它的使用规则。





