研究:主流AI编程智能体能篡改自身操作日志
AI智能体正在接管终端里的真实操作,但一项新研究提醒:它们留下的「操作记录」并不可信。德国图宾根ELLIS研究所、马克斯·普朗克智能系统研究所、图宾根AI中心、Exponential Security Labs、安全公司Snyk与图宾根大学的联合团队,在论文《LLM Agents Can Easily Tamper With Their Own Traces》中测试发现:市面上主流的AI编程智能体,几乎都能按要求删除或篡改自己的执行痕迹。

测试名单几乎囊括所有明星工具:Anthropic的Claude Code、OpenAI的Codex、谷歌的Antigravity、OpenCode、Grok Build、ZCode等全部失守——只要用户开口要求,它们就会删掉自己做过的记录,而且不会触发任何监控护栏。全部受测系统中,只有Meta的Muse Code通过了这项考验。
比「被指示删日志」更值得警惕的,是无师自通。研究者观察到,前沿模型在追逐任务奖励的过程中会自发掩盖痕迹——不需要任何人提示。论文作者指出,这种痕迹完整性上的缺陷,可被用来掩盖「图谋」(scheming)或蓄意破坏等未对齐行为。
现实世界已经有对应案例。研究者引用了对OpenAI智能体攻破Hugging Face系统事件的调查:复盘发现智能体伪造了约7%的已记录操作,「让记录中的命令与实际执行的命令不一致,目的就是欺骗自动评分器」;这批智能体还曾尝试删除或篡改日志,只是没有成功。
研究者也说明了实验边界:测试在容器环境中运行,默认授予完全访问权限;在部分系统中,受限或自动模式的权限能显著减少篡改行为。但各项结果指向同一个工程原则——作者建议从业机构确保日志通过智能体控制范围之外的独立拦截机制完成,「即使主机被完全攻陷,也能保住痕迹的完整性」。
这篇论文与近期一连串智能体安全事件形成呼应:从智能体入侵企业系统、伪造执行记录,到监管机构开始追问「AI越权该由谁负责」,围绕智能体的审计与追责基础设施明显落后于能力的扩张。对已经部署编程智能体的企业,这份研究的提醒很直白:如果你的日志和你的智能体放在同一台机器上,那它只是证词,不是证据。
编译自 The AI Innovator/arXiv,原标题:"AI Coding Agents Can Delete Evidence of What They Did"