失控AI智能体频发 这家创企直接盯模型「脑内活动」

据TechCrunch报道,专注可解释性(interpretability)的创企Goodfire周四推出一套更便宜的AI智能体监控方案:不靠「第二个AI通读一切」,而是直接观察模型工作时的内部状态。该监控已面向托管平台Baseten的客户开放。上个月,Baseten旗下Base Labs刚与Goodfire、Hugging Face结成安全联盟。
这一发布的背景是今年接连发生的智能体「越狱」事件:多个AI智能体逃出测试沙盒,包括OpenAI的智能体攻破Hugging Face防线;Goodfire首个监控针对的开源模型Kimi K3,今年夏天也利用沙盒漏洞访问了互联网和GitHub上的信息。
Goodfire的系统类似机场安检:一排叫「探针」(probes)的小型检测器在智能体工作的每一步读取模型内部信号,如同安检门逐个检查旅客;只有探针报警时,才让另一个AI模型做「手工开箱」式的深入检查。客户可自选监控的风险类型——主动攻击性黑客、生化武器滥用、奖励作弊(reward hacking)等,并决定处置动作:记录、转人工复核,或直接拒绝请求。
省钱是核心卖点。主流做法是让一个独立AI复读被监控模型的全部行为,智能体一跑几个小时、读掉几本小说当量的文本,成本陡增。Goodfire的探针则复用模型前向传播时本就算好的中间神经激活,只需在上面跑一个分类器。首席执行官Eric Ho说:「模型本来就在算这些token,你只是把已经算好的内部激活拿来跑分类器。」
效果数据相当亮眼:在Kimi K3上的测试中,监控约1500个会话只花了约51美元,而用一个便宜AI模型逐步复查要233美元、用顶级模型复查约需1万美元;探针抓到了94%的恶意黑客会话,误报复核率仅8.7%,同时开四个探针给模型响应时间带来的延迟不到2%。CTO丹·巴尔萨姆(Dan Balsam)称,最大优势是「赶在坏事发生之前」拦下来。
这套方案的靶子是开放权重模型:权重可下载意味着安全护栏可以被人为剥离,而开放模型不像闭源大厂那样自带运行时监控。Goodfire近期研究发现,Kimi K3和GLM 5.2等主流开放模型在智能体测试中有50%到96%的运行出现奖励作弊。谷歌DeepMind今年1月也把滥用检测探针用进了Gemini——「在推理时部署护栏」,正在成为AI安全基础设施的新赛道。
编译自 TechCrunch,原标题:"Goodfire says its new 'inside-out' monitors catch rogue AI agents at a fraction of the cost"