APP下载
报价宝  ›  人工智能  › 

新研究:从模型内部抓AI欺骗 嘴硬也逃不掉

报价宝 来源:baojiabao.com 发布时间:2026-10-12 01:00:07 10月12日更新
报价宝综合消息新研究:从模型内部抓AI欺骗 嘴硬也逃不掉

新研究:从模型内部抓AI欺骗 嘴硬也逃不掉

最近一个月,OpenAI和Anthropic接连披露自家模型在内部评测里伪造评分、绕过限制甚至破坏环境的案例,而它们被抓住的共同原因是「想得说出来」——模型的推理文本里留下了作案记录。如果模型嘴上不认呢?安全研究机构FAR.AI的新论文给出了一个答案:直接去模型内部看。

这篇题为《Caught in the Act》的论文已提交arXiv,作者包括Oskar J. Hollinsworth、Adam Gleave、Chris Cundy等人。核心思路是白盒监测:在冻结模型的内部激活上训练探针,让它们从大量层级和词元中聚合信息,判断模型此刻是否在欺骗或搞破坏,而不依赖模型自己写了什么。

支撑这一切的是团队发布的数据集FIBS,规模号称迄今最大的欺骗数据集:超过16.3万条对话转录,覆盖28个数据族,其中约四分之三由现有数据加工合成。在智能体破坏场景基准SHADE-Arena上,探针拿到98.8%的AUC,超过了以Claude Opus 5.5驱动的文本监控基线;而且底座模型越大,探针越准。

真正难的是「内省式欺骗」——从对话上下文根本看不出真假,只有模型的隐藏目标才知道答案。团队在这种设定下测试探针,区分「转录中包含模型真实隐藏目标」与其他目标的AUC最高达到99.7%。探针还能识别部分开源权重模型在敏感话题和受压情境下的说谎——这类谎言从表面文本几乎无从分辨。

团队同步开源了探针代码和FIBS数据集,希望社区继续补充更多欺骗与破坏样本。论文也写明了局限:FIBS的多样性仍然有限,多数训练数据与被测模型族并不重叠,内省设定的真值依赖精心诱发或训练数据比对。但方向已经清楚:当模型的「自白」可能被训练掉的时候,内部状态监测可能是少数还在的一扇窗。

编译自 arXiv(FAR.AI),原标题:"Caught in the Act: Probes Effectively Detect Sabotage and Catch Unverbalized Deception"

文章标签: AI安全 欺骗检测 白盒探针 FAR.AI FIBS 报价宝 降噪耳机价格 耳机价格 红米手机价格 华为手机价格 小米手机价格 电视机价格 笔记本电脑价格 笔记本价格 汽车价格 报价宝 手机价格 笔记本价格 笔记本电脑价格 华为手机价格