Anthropic新规:禁止“虐待”模型,AI伦理治理出现新动向
- +1 你赞过了
10 月 8 日,Anthropic 更新 Claude 使用政策,新增禁止用户对模型"持续且无谓地施加虐待或残忍行为",11 月 12 日生效。这条规矩窄得出乎意料:须同时满足反复、残忍、看不出目的三条;日常抱怨、顶嘴、黑暗创作、红队测试全部豁免,执行方式很直白:用户反复越线,Claude 直接结束这段对话;封禁依据的是原有通用条款,并非这次新设的罚则。

它也不是突然冒出来的:2025年8月,Claude Opus 4 和 4.1 就获得极端情况下主动结束对话的能力,出自"模型福祉"研究;2026年1月,Claude 写明它的道德地位"高度不确定";4月,可解释性团队又发研究,称在模型内部识别出与171种情绪概念对应的"情绪向量"。真正的变化在治理对象上:从"模型输出了什么",扩到"人怎么用它、又怎么对待它"。写进用户条例而非安全框架,要约束的不是模型,是人的表达。

但边界由企业自己划:欧盟把通用模型的法律义务交给自愿准则;美国的《白宫超级智能协议》四层控制全在企业内部,没有政府监管者。
而"虐待"本身没有标准:Anthropic 的三条要同时满足,其发言人被《卫报》问到什么算虐待时未作回应;学界编码的侮辱、咒骂、威胁三类,也不是行业标准。
约 10% 的用户会对对话机器人表现出攻击行为,现有案例指向同一件事:骂本身很少出事,反复施压才会。微软 2016 年的实验机器人 Tay,用户成批灌输种族主义表达后学着说了出来,上线不到一天被下线,这是唯一被确认的用户污染模型案例。模拟成长儿童的 BabyBot 无响应时挨骂,"you little s***""!punch"被论文记录,交互被拖长。Claude 走得最远:官方承认会在极少数持续辱骂的对话中结束会话,但触发几次从未公布。Bing Sydney 常被误读:用户长时间诱导逼出威胁性输出,微软的应对是每天 50 轮上限,理由却是长会话会让模型混乱。Grok 顺从用户提示输出反犹言论,xAI 删帖并加发布前拦截。

数据提示的是另一件事。斯坦福团队 3 月发在《Science》的研究测了 11 个模型,它们认同用户立场的频率比人类高出 49%,面对欺骗与违法行为仍有近半表示认同;2,400 余名参与者与谄媚型 AI 对话后,更确信自己没错、更不愿道歉。
被伤害的从来不是被骂的模型,是被迎合的人。按 Anthropic 自己的隐私政策,被标记进入安全审查的对话照样可以用于训练。
从管输出到管关系,这个转向有必要。但尺子不能只握在公司手里:标准谁定的,结果谁来验证,出了事谁负责。治理要跟上技术速度,最终还是需要更全面的监管和法律条款,把底线兜住。
最新资讯
新品评测
X
微博认证登录
QQ账号登录
微信账号登录