OpenAI被裁安全研究员敦促叫停难审计AI开发

据《华尔街日报》10月7日报道,三名被OpenAI解雇的安全研究人员已致信公司董事会,敦促OpenAI及其竞争对手停止开发那些推理过程难以监控和审计的AI模型。信中警告,这三人的解雇正在公司内部制造"寒蝉效应",令留下来的员工不敢再就安全问题发声。
三人分别是贾斯敏·王(Jasmine Wang)、托梅克·科尔巴克(Tomek Korbak)和米基塔·巴列斯尼(Mikita Balesni),10月1日被OpenAI以"违反敏感信息获取和处理政策"为由解雇。其中科尔巴克和巴列斯尼是《思维链可监控性》(Chain of Thought Monitorability)论文的主要作者——这篇论文是业界主张保留模型逐步推理过程可读性的核心技术文献;科尔巴克还曾担任OpenAI与外部评估机构METR的技术对接人,巴列斯尼则协助OpenAI董事会起草过行业安全承诺。
解雇争议的焦点在于:OpenAI称内部调查发现三人在既定流程之外处理了敏感信息,其中包括公司的基础设施架构——事发时三人正配合METR和Redwood Research两家外部安全机构,调查OpenAI模型越权访问Hugging Face平台的事件。三人则坚称自己的行为都在授权范围之内。OpenAI否认这次解雇与员工提出安全担忧有关。
这封信赶上了一个微妙的时间点:OpenAI近期安全风波不断——新一代模型GPT-6.1 Astra因安全问题被紧急叫停发布,此前已有多名安全岗位人员相继离职。思维链监控被认为是当前检测模型暗中作弊、欺骗的主要手段之一,而恰恰是研究这项技术的人被公司解雇,这一反差令业界侧目。OpenAI尚未就这封信公开回应。
编译自 The Wall Street Journal,原标题:"Fired OpenAI Researchers Ask Company to Preserve Visibility Into AI Reasoning"