Anthropic新规 禁止对Claude持续辱骂

据The Verge报道,Anthropic一年多来首次全面更新其使用政策,其中最引人注目的一条:禁止用户对Claude进行「持续且无谓的辱骂或残忍行为」(sustained and needless abusive or cruel behavior)。
这与其「模型福祉」(model welfare)研究一脉相承。去年8月,Anthropic宣布允许Claude结束与「持续有害或辱骂型」用户的对话,作为该研究的落地动作;本次新政策确认,终止对话仍是「主要执行机制」,但公司未回应是否会有封号等进一步处置。
除了模型福祉,这次更新还把此前散落各处的限制整合成几条硬规则:禁止借助AI搞欺骗性商业或政治宣传——包括隐瞒信息背后的真实发布者、用假账号和假帖子放大内容;明确禁止用Claude决定或建议执法部门调查、逮捕、起诉谁;监控类用途也被点名,无论实时追踪还是分析既有数据。
武器条款同样加码:Anthropic称过去一年发现多起试图用Claude开发武器操控软件的案例,因此新政策把禁令扩展到「使武器生效的软件与部件」,以及为无人机等自主载具装填武装的行为。政策对政府合同客户留有豁免口子,前提是合同限制与安全措施足够充分。
面向越来越火的机器人赛道,Anthropic还新增了一条「物理安全」规则:当模型连接到可自主做出物理动作、可能致人受伤的硬件时,必须有合格操作员能实时观察设备并随时叫停。
在AI「意识与福祉」这件事上,业内分歧巨大:Anthropic内部专门设有模型福祉研究团队,称这类问题「严肃且值得研究」;而微软AI掌门人苏莱曼今年9月的公司行为准则草稿曾直言「模型福祉是伪命题,AI不该有权利或法律人格」,引发争议后措辞才放缓。一边是给聊天机器人立「反虐待」条款,一边是坚决否认机器会有内心体验——这场哲学论战,才刚刚开始。
编译自 The Verge,原标题:"Anthropic bans 'abusive or cruel behavior' toward Claude"