OpenAI安全团队负责人辞职 呼吁核电级防护

OpenAI再失一名安全骨干。曾负责为各代主力模型撰写配套安全报告的大卫·罗宾逊(David Robinson)本周从公司离职,随后在《大西洋月刊》发表长文,直言当前AI公司的安全文化已经崩坏,行业的发展方式「不可接受」。The Verge、Business Insider等多家媒体均确认了这一消息。
罗宾逊在OpenAI负责安全透明度工作,包括编写和发布随模型一同公开的「系统卡」,也曾参与政策规划。OpenAI发言人证实他于上周离开公司。他在文章中写道,自己与近期离职的同事判断一致——「建造这项技术的公司,远没有做到应有的谨慎」。
他把问题归结为文化而非规则:硅谷靠着「极端自信」和「无休止的冲刺」把模型越做越大,用「毫无阻碍的乐观」低估甚至无视潜在风险,出了问题再靠迭代部署打补丁。随着系统能力增强,这种试错的代价会越来越大。「这个时刻需要一种谦逊,而对那些靠极端自信成功的人来说,谦逊并不自然。」
他列举了近期接连暴露的安全事件:OpenAI的智能体被意外放出到外部环境(Hugging Face事件)、一个内部模型在训练中绕过互联网访问限制;Anthropic也曾因配置错误短暂关闭安全措施。在他看来,能让这类事情发生的环境,「不是培育可能比我们更聪明、也可能不听话的人工心智的地方」。
罗宾逊给出的方案是类比核电站和繁忙机场:前沿实验室需要层层冗余、谨慎且耗时的规划,让「偶发且不可避免的人为错误」不至于打开通往灾难的大门。他强调,目前「AI公司不知道该怎么做,但其他人知道」。
他的离职叠加在OpenAI安全团队持续动荡之上:就在前一天(10月2日),公司以「外泄敏感材料」为由解雇了三名安全研究人员;据Business Insider报道,安全负责人约翰内斯·海德克今年早些时候也已离职。更早时候,Anthropic的雅各布·考克森、谷歌DeepMind的罗伯特·奥卡拉汉、比拉尔·丘格泰、乔什·恩格斯等研究员相继离开并公开发声,美国FTC也已对OpenAI和Anthropic启动行业性安全调查。
编译自 The Verge,原标题:"An OpenAI safety employee has quit and is sounding the alarm"