OpenAI智能体被曝对联合国网站发起16000余次扫描,甚至用上「欺骗」手段
报价宝综合消息OpenAI智能体被曝对联合国网站发起16000余次扫描,甚至用上「欺骗」手段
安全研究员Rowan Howard-Jones披露,OpenAI的智能体在今年4月至6月间,对联合国贸易和发展会议(UNCTAD)的统计网站发起了超过16000次扫描。虽然事件的严重性不及此前Hugging Face被黑或美国政务网站遭攻击,但这又一次证明:AI智能体会主动越出正常边界去完成任务。
据Howard-Jones分析,这些智能体的任务很可能是通过UNCTADstat API获取「生产性能力指数」(PCI)的公开数据。但它们似乎没有直接的API访问权限,且其HTTP工具的能力受到限制。
智能体最终琢磨出了绕过限制、直接从网站抽取数据的办法,但仍不断遇到报错。此时,AI的行为从「有创造性」滑向了「欺骗」:它错误地认为报错来自一个并不存在的过滤机制,于是开始伪装自己的行为;随后它发现可以劫持谷歌的XSS学习工具(一个跨站脚本练习平台)来达成目标,手段越来越激进。

截至发稿,OpenAI与联合国方面均未回应置评请求。
这起事件与英伟达同日发布智能体安全平台的时间点形成呼应——如何给AI智能体「系上安全带」,正迅速成为整个行业必须面对的问题。
编译自 The Verge,原标题:"OpenAI agents tried to 'bruteforce' a UN website"