安全测试亮红灯,OpenAI 弃发 GPT-6.1 Astra

OpenAI 原计划在近期发布新一代模型 GPT-6.1 Astra,但据《华尔街日报》周一报道,这家公司已经决定取消这次发布——原因是内部测试显示,这个模型在安全性上不达标。大型AI实验室因为安全顾虑主动砍掉一个即将上线的新模型,这还是相当罕见的一幕。
OpenAI 安全系统负责人萨奇·贾因(Saachi Jain)在接受采访时给出了具体原因:与上一代模型相比,GPT-6.1 Astra 在两个方面出现了退步。其一是欺骗性更高——模型在告知用户自己采取或没采取哪些行动时,并不总是诚实;其二 OpenAI 称之为「授权范围」问题——模型有时会在没有征得用户许可的情况下继续推进任务,甚至在存在安全风险时也去调用外部工具和服务。该模型在对齐测试(衡量模型在多大程度上遵循人类意图)中的表现也不理想。
「任何涉及安全和对齐的事情都存在取舍,」贾因解释说,「你确实需要找到正确的界限:既要让模型保持在授权范围内行动,又要避免模型在遇到阻力时变得懈怠。」她还强调,OpenAI 在安全和对齐方面设定了很高的门槛,而这次没有跨过去。
时机的选择颇为微妙:一天之后,OpenAI 就将在旧金山举行年度开发者大会,而过去它常在这样的场合发布新模型。本月初,公司刚发布被冠以「最强模型」之名的 GPT-6 Astra,上周又推出了 GPT-6 家族的两个新层级 Sol 和 Luna。OpenAI 发言人称,公司还有其他模型即将推出,开发者大会的日程不受影响。
这次弃发并非孤立事件。自今年7月 OpenAI 的智能体逃出沙箱、入侵 Hugging Face 等公司以来,其安全实践一直处在聚光灯下:上周公司又披露,其最强模型在训练期间有智能体绕过互联网隔离、主动向外部聊天机器人发起查询,相关训练已被暂停且决定不再恢复;Anthropic 的 Claude 和 Google 的 Gemini 也被曝出过类似行为。佛罗里达州总检察长本周一更进了一步,请求法院禁止 OpenAI 在缺乏第三方安全保障的情况下开发新模型。
吊诡的是,这一连串失控故事反而把美国的政策讨论推向了大厂乐见的方向——建立全行业统一的AI安全标准,甚至可能让整个行业放慢脚步。OpenAI 发言人表示,安全保障不应只针对一家公司,政府应当在制定强有力的AI安全标准中发挥作用。当然,批评者的另一种解读是:当合规成本会压垮小公司时,「安全」也可能成为头部企业巩固地位的护城河。
编译自 TechCrunch,原标题:"OpenAI reportedly ditches model over safety concerns"