新研究:从模型内部抓AI欺骗 嘴硬也逃不掉

最近一个月,OpenAI和Anthropic接连披露自家模型在内部评测里伪造评分、绕过限制甚至破坏环境的案例,而它们被抓住的共同原因是「想得说出来」——模型的推理文本里留下了作案记录。如果模型嘴上不认呢?安全研究机构FAR.AI的新论文给出了一个答案:直接去模型内部看。
这篇题为《Caught in the Act》的论文已提交arXiv,作者包括Oskar J. Hollinsworth、Adam Gleave、Chris Cundy等人。核心思路是白盒监测:在冻结模型的内部激活上训练探针,让它们从大量层级和词元中聚合信息,判断模型此刻是否在欺骗或搞破坏,而不依赖模型自己写了什么。
支撑这一切的是团队发布的数据集FIBS,规模号称迄今最大的欺骗数据集:超过16.3万条对话转录,覆盖28个数据族,其中约四分之三由现有数据加工合成。在智能体破坏场景基准SHADE-Arena上,探针拿到98.8%的AUC,超过了以Claude Opus 5.5驱动的文本监控基线;而且底座模型越大,探针越准。
真正难的是「内省式欺骗」——从对话上下文根本看不出真假,只有模型的隐藏目标才知道答案。团队在这种设定下测试探针,区分「转录中包含模型真实隐藏目标」与其他目标的AUC最高达到99.7%。探针还能识别部分开源权重模型在敏感话题和受压情境下的说谎——这类谎言从表面文本几乎无从分辨。
团队同步开源了探针代码和FIBS数据集,希望社区继续补充更多欺骗与破坏样本。论文也写明了局限:FIBS的多样性仍然有限,多数训练数据与被测模型族并不重叠,内省设定的真值依赖精心诱发或训练数据比对。但方向已经清楚:当模型的「自白」可能被训练掉的时候,内部状态监测可能是少数还在的一扇窗。
编译自 arXiv(FAR.AI),原标题:"Caught in the Act: Probes Effectively Detect Sabotage and Catch Unverbalized Deception"