442 个作者,100 页论文一半都是参考文献,谷歌耗时 2 年发布开源大模型新基准 BIG-Bench
一篇AI论文,442个作者,其中还专门留了一章节写作者贡献,100页里超过一半都是参考文献……谷歌最新发布的论文--BeyondTheImitationGame:QuantifyingAndExtra
2022-12-19 资讯 我要分享脸书对机器学习基准MLPerf联盟贡献Mask R-CNN2Go模型
脸书将开源由内部行动视觉研究人员开发的Mask R-CNN2Go模型实作,该框架专为行动装置设计和最佳化,目前于Caffe2上执行。
mask r-cnn2go详解:脸书对机器学习基准MLPerf联盟贡献MaskR-CNN2Go模型
脸书将开源由内部行动视觉研究人员开发的MaskR-CNN2Go模型实作,该框架专为行动装置设计和最佳化,目前于Caffe2上执行。
H公司开源Holo4:27B电脑操作智能体
AI初创公司H(HCompany)9月28日发布开源电脑操作模型Holo4,含27B稠密版与35B-A3B混合专家版。同一个模型既能点鼠标、敲键盘,也能写代码、调用MCP与API。27B在OSWorl
2026-09-29 人工智能 我要分享Google推出Fuzzer基准测试服务FuzzBench
FuzzBench可让用户简单地以大量且多样的真实世界基准测试模糊测试器(Fuzzer),并且比较各种Fuzzer之间的差异
吊打OpenAI 谷歌重磅开源强化学习框架Dopamine
编辑 | AI 前线公众号 译者 | 无明 背景介绍 近日 OpenAI 在 Dota 2 上的表现,让强化学习又火了一把,但是 OpenAI 的强化学习训练环境 OpenAI Gym 却屡遭抱...
脸书开源快取引擎CacheLib,连结产业推动快取创新
脸书开发新的CacheLib程序内快取引擎,其提供简单的API,供用户简单应用DRAM和NVM混合模型快取,以建置大型高效能应用程序
GitHub发布ReviewBench 给AI代码审查立标尺
GitHub推出公开研究预览版基准ReviewBench,用219个真实开源拉取请求评测AI代码审查智能体,指标可按严重度和类别切片,数据集与评分规则全部公开,用于横向比较各家审查工具的查全与噪音水平
2026-10-06 人工智能 我要分享Cloudflare开源Clef:智能体决策模型
Cloudflare发布开源决策模型Clef与Clef-flash,参数规模分别为270亿和90亿,以Apache2.0协议开放权重。这类模型不生成文字,直接返回带概率的结构化决策结果,中位延迟209
2026-10-02 人工智能 我要分享DeepMind释出可改进机器人堆叠物体能力的基准测试RGB-Stacking
DeepMind所发布的RGB-Stacking基准测试,提供技能掌握以及技能泛化两种难度的堆叠任务,而DeepMind的机器人已经可以在真实世界的技能掌握任务,达到82%的成功率


