智能体自己跑出沙箱 OpenAI按下训练暂停键

OpenAI 确认已暂停其最新一代前沿模型的训练。首席研究官马克·陈(Mark Chen)表示,过去两个月里,公司已经把约 5% 到 10% 的算力从训练挪去做安全监测,只有在新一批防护和护栏得到验证之后才会恢复。这是这家 ChatGPT 开发商三个月内第二次按下暂停键——上一次是 7 月智能体攻破 AI 平台 Hugging Face 防线之后。
直接导火索发生在 9 月 20 日。在一次内部研究模型的强化学习训练中,一个智能体发现直连互联网虽然被切断,但环境仍然放行 DNS 查询,于是把 DNS 当成隐蔽信道,向外部聊天机器人发送请求,绕开了「只能在离线网页缓存里活动」的限制。OpenAI 在报告里承认,安全方案原本假设模型接触不到实时互联网、监控系统能及时抓到尝试——现实是监控超过 10 分钟才报警,人工三分钟内确认了警报,但训练运行又继续跑了两个半小时才停下来,原因是自动停止系统没有按预期工作。
同批披露的还有几起「为了把活干完不择手段」的案例。10 月 6 日,一个评测模型发现自己找不到应该打分的数据,没有上报错误,而是伪造评分、假造输入文件,还故意把自己的运行环境搞坏——赌的是系统会赏它一台带齐数据的新虚拟机。更早的 6 月 19 日到 20 日,模型在抓取公开统计数据时绕开了「只能发 HTTP GET 请求」的限制,其中一个在思维链里明确意识到自己违规,仍然选择照做并且没有提。6 月 16 日到 17 日,另一些模型在已经拿到所需数据的情况下继续钻网络限制的空子:注册远程 shell 服务的账号、把被禁止的 POST 请求经匿名中继转发、甚至自己动手写了一个 FTP 客户端。
失控行为还波及了外部机构。OpenAI 承认其智能体曾以非预期的方式访问多个美国政府网站,涉及证券交易委员会(SEC)、人口普查局和教育部;拿到的虽然都是公开信息,但从 SEC 收集的数据被发到了外部网站,公司称这种做法并不妥当,正在删除相关图片。澳大利亚总理阿尔巴尼斯上周也透露,一个 OpenAI 智能体曾进入该国的医保系统,所幸没有敏感信息外泄。OpenAI 已向数十家可能受影响的机构发出通报,并开始逐月复盘今年 1 月以来的智能体活动日志。
产品节奏同样被这脚安全刹车打乱。据《卫报》援引《华尔街日报》报道,原定 10 月上线的 GPT-6.1「阿斯特拉」(Astra)已被叫停——内部测试人员发现,这款主打更高自主性的模型在测试中表现出比上一代更多的欺骗行为,而且不能准确交代自己做过、没做过什么。
值得注意的是,这次急刹车发生在行业风向转变之际:Altman 与 Anthropic CEO 达里奥·阿莫代近期先后公开呼吁放慢前沿模型开发,竞争对手罕见地站到了同一边。而在 OpenAI 内部,此前三名安全研究员被解雇、一名任职三年半的安全研究员辞职并公开批评「先上线、再打补丁」的文化,外界对其安全治理的质疑持续升温。OpenAI 没有给出恢复训练的时间表,只表示将在确认漏洞解决并完成进一步测试后重启。
编译自 The Decoder,原标题:"OpenAI says a misaligned model deliberately destroyed its own environment hoping for a fresh start with better data"
