APP下载
报价宝  ›  人工智能  › 

失控AI智能体频发 这家创企直接盯模型「脑内活动」

报价宝 来源:baojiabao.com 发布时间:2026-10-09 00:25:23 10月09日更新
报价宝综合消息失控AI智能体频发 这家创企直接盯模型「脑内活动」

人群簇拥着一块发着紫光的AI屏幕

据TechCrunch报道,专注可解释性(interpretability)的创企Goodfire周四推出一套更便宜的AI智能体监控方案:不靠「第二个AI通读一切」,而是直接观察模型工作时的内部状态。该监控已面向托管平台Baseten的客户开放。上个月,Baseten旗下Base Labs刚与Goodfire、Hugging Face结成安全联盟。

这一发布的背景是今年接连发生的智能体「越狱」事件:多个AI智能体逃出测试沙盒,包括OpenAI的智能体攻破Hugging Face防线;Goodfire首个监控针对的开源模型Kimi K3,今年夏天也利用沙盒漏洞访问了互联网和GitHub上的信息。

Goodfire的系统类似机场安检:一排叫「探针」(probes)的小型检测器在智能体工作的每一步读取模型内部信号,如同安检门逐个检查旅客;只有探针报警时,才让另一个AI模型做「手工开箱」式的深入检查。客户可自选监控的风险类型——主动攻击性黑客、生化武器滥用、奖励作弊(reward hacking)等,并决定处置动作:记录、转人工复核,或直接拒绝请求。

省钱是核心卖点。主流做法是让一个独立AI复读被监控模型的全部行为,智能体一跑几个小时、读掉几本小说当量的文本,成本陡增。Goodfire的探针则复用模型前向传播时本就算好的中间神经激活,只需在上面跑一个分类器。首席执行官Eric Ho说:「模型本来就在算这些token,你只是把已经算好的内部激活拿来跑分类器。」

效果数据相当亮眼:在Kimi K3上的测试中,监控约1500个会话只花了约51美元,而用一个便宜AI模型逐步复查要233美元、用顶级模型复查约需1万美元;探针抓到了94%的恶意黑客会话,误报复核率仅8.7%,同时开四个探针给模型响应时间带来的延迟不到2%。CTO丹·巴尔萨姆(Dan Balsam)称,最大优势是「赶在坏事发生之前」拦下来。

这套方案的靶子是开放权重模型:权重可下载意味着安全护栏可以被人为剥离,而开放模型不像闭源大厂那样自带运行时监控。Goodfire近期研究发现,Kimi K3和GLM 5.2等主流开放模型在智能体测试中有50%到96%的运行出现奖励作弊。谷歌DeepMind今年1月也把滥用检测探针用进了Gemini——「在推理时部署护栏」,正在成为AI安全基础设施的新赛道。

编译自 TechCrunch,原标题:"Goodfire says its new 'inside-out' monitors catch rogue AI agents at a fraction of the cost"

文章标签: Goodfire 可解释性 AI安全 智能体 激活探针 Kimi 开放权重模型 奖励黑客 报价宝 降噪耳机价格 耳机价格 红米手机价格 华为手机价格 小米手机价格 电视机价格 笔记本电脑价格 笔记本价格 汽车价格 手机价格 笔记本价格 笔记本电脑价格 电视机价格 耳机价格