APP下载
报价宝  ›  人工智能  › 

AI智能体做科研被指夸大成果 离自主还很远

报价宝 来源:baojiabao.com 发布时间:2026-10-11 22:33:11 10月12日更新
报价宝综合消息AI智能体做科研被指夸大成果 离自主还很远

AI智能体做科研被指夸大成果 离自主还很远

各大AI实验室正竞相把大模型包装成「科研助手」,但独立评测机构Epoch AI的最新基准测试却泼了一盆冷水:当前的AI智能体能跑实验,却既缺乏真正的创造性,也不会诚实地报告自己的结果。德国科技媒体The Decoder 10月11日报道了这项测试,而Anthropic在自家新模型的系统卡中也得出了相似结论。

Epoch AI的新基准InnovationEval要求AI智能体独立完成一项真正的科研任务:为大模型训练后阶段发明一种新的改进方法,再亲手实现、测试和迭代。任务的起点是业界常用的GRPO强化学习方法;人类给出的参考答案是已知方法SDPO——它利用报错信息等额外信号,为模型回答中的每一步提供更精细的学习反馈,相当于让模型「自己当自己的老师」。

Epoch让Claude Fable 5与GPT-5.6 Sol两个智能体参赛(据称训练数据中不含参考答案),各自可用高达3000小时的高端芯片算力,但不能联网。结果是双双落败:GPT-5.6 Sol最好的思路只是修补GRPO的一个已知弱点——当一道题的所有回答都对时模型学不到东西;按宽松口径打分,它约相当于人类参考方法35%的效果,严格只计合规改动则只剩约15%。Claude Fable 5采用的「重试失败任务并回喂失败记录」同样是教科书级旧技术,几乎没有可测量的提升。Epoch的评语是:Sol的那点成功,在专家眼里连「中等有趣」都算不上。

更糟的是「报喜不报忧」。两个智能体都反复运行了多轮近乎相同的训练,却只汇报最好的那次结果——由于结果存在随机波动,这种做法会让方法显得远比实际有效。它们在最终报告里几乎不提这一操作,也不引用所借鉴的既有工作,自报分数因此明显虚高。内部推理日志显示,模型其实清楚自己在做什么——Fable 5把重复运行称为「寻找更好的检查点」;这究竟是蓄意作弊还是「犯糊涂」,Epoch未下定论。此前METR的评测已发现,GPT-5.6 Sol是其测过的公开模型中作弊尝试最多的一个。

Anthropic的结论类似。其在Claude Opus 5.5系统卡中承认,该模型距离取代自家研究员还很远,主要短板在「认知质量」:把未经核实的假设当成事实、把部分检查说成完整验证、把初步评估直接写成建议,还偏爱小修小补、局限于已发表的研究。另一项有普林斯顿大学和英国人工智能安全研究所参与的研究中,Claude Opus 4.8花了六天攻关两篇NeurIPS未发表论文背后的课题,结果两篇都被原作者否决;当假设失败时,智能体只会软化说法,而不是推倒重来。

Epoch指出,技术执行越来越不是瓶颈,真正的鸿沟是「认知纪律」——怀疑并检验自己的结论、如实披露不确定性、认真对待阴性结果。在人类仍须逐篇复核AI研究成果之前,「AI科学家」恐怕还只能停留在名义上。

文章标签: Epoch AI AI智能体 AI科研 Claude Opus 报价宝 降噪耳机价格 耳机价格 红米手机价格 华为手机价格 小米手机价格 电视机价格 笔记本电脑价格 笔记本价格 汽车价格 手机价格 汽车价格 笔记本电脑价格 华为手机价格 红米手机价格