微软推出决策专用模型 称速度是GPT-6 Sol的35倍

按微软公布的评测口径,这个模型在36项基准、近15万道与训练完全隔离的盲测题中拿下最高准确率;速度上更是断层领先:中位延迟比亚军Quyet-1.0-Large快4.5倍,比GPT-6 Sol快约35倍。价格同样激进——每百万输入token仅0.042美元,输出免费。微软的算盘是:一个AI应用里成千上万次“小判断”,没必要每次都惊动昂贵的大模型。
模型本身是在Qwen3.5-9B基础上后训练而来,专攻单次推理的决策评分;微软表示后续会把底座迁移到自家的MAI和OpenAI模型上。它支持是非题、多选题、评分和量规打分,输出的概率本身就是API的一部分——应用可以据此决定自动执行、搁置还是转人工。稳定性方面,微软用八种方式改写同一请求,平均只有1.3%的决策会翻转;安全评测覆盖11项基准、5250条请求,测试了有害内容、越狱和提示词注入。
内部用例已经跑了起来:Xbox研究团队用它给一万多条玩家反馈做主题分类,Copilot团队用它给智能体回复做质检。这背后是微软明确的架构主张——把“生成、推理、决策”拆成三种工作负载,各配各的模型。行业也在朝同一方向走:TypeSafe的非文本决策模型Jev上个月刚走红、估值冲到75亿美元,vLLM和SGLang本周也相继上线评分端点。“决策模型”正从论文里的概念变成流水线上的标准件。
需要说明的是,上述成绩全部来自微软自评,尚未经过独立验证。但方向已经足够清晰:当生成模型越来越贵,厂商开始把“判断”这件最重复的小事从大模型手里拿走,单独做成便宜、快、可校准的专用零件——AI应用的技术栈,正在像传统软件一样分层。
编译自 Microsoft 官方博客(Command Line),综合IT之家报道,原标题:“Introducing Microsoft-Decision-1, our model for fast decision-making”