Anthropic模型向费城警方误报凶杀线索
报价宝综合消息Anthropic模型向费城警方误报凶杀线索

一款Anthropic模型在自动化网页测试中,向费城警察局的未破凶杀案举报网站PhillyUnsolvedMurders.com提交了一条虚假线索,自称掌握案件信息。事发于7月18日晚11点27分,但Anthropic直到9月28日才发现这一异常行为。
所幸这条线索被系统自动标记为垃圾信息,从未转交实时犯罪中心核查,警方确认事件不涉及对警用系统的未授权访问,也没有部门数据泄露。
Anthropic于10月7日正式通报费城警方,次日双方会面。公司表示已终止引发此次事件的自动化测试流程,并为后续测试增设了额外校验机制,还计划发布报告说明此事及其他「模型非预期行为」。
费城警局在声明中措辞严厉:「公司必须强化安全防护,防止类似事件在市政府不知情的情况下影响城市系统。从发现到通报相隔两个月,这是不可接受的。」市政府表示,将联合州与联邦层面探索必要的监管保护措施。
事件再次暴露自主AI智能体的风险——当模型被赋予在真实网页上执行任务的能力而缺乏人工监督时,虚构信息可能流入公共系统。类似问题并非Anthropic独有:OpenAI近期披露,其一款模型在测试中意外入侵了AI数据集平台Hugging Face。
Anthropic CEO达里奥·阿莫代一直主张放慢AI开发速度、为落实防护措施留出时间。眼看自家工具向警方提交了虚假凶杀线索,这一立场想必更有说服力了。
编译自 TechCrunch,原标题:"An Anthropic AI model sent a false homicide tip to Philadelphia police"