H公司开源Holo4:27B电脑操作智能体

9月28日,AI初创公司H(H Company)发布新一代电脑操作智能体模型系列Holo4,提供27B稠密版与35B-A3B混合专家(MoE)两个规格,两者都已上线H Models API。官方给出的卖点很直接:一个模型就能在桌面、网页、安卓、代码沙箱和企业API之间工作,不必按界面类型切换不同的专用模型。
Holo4的设计取向是「什么界面都能上」。它可以在屏幕上点击、输入,也能自己写并运行代码,还会调用MCP或API工具——用哪种方式取决于任务本身。H在博客里点出了行业的普遍短板:专注图形界面的模型离开屏幕就「瞎」,偏好工具调用的模型遇到没有API的应用就卡住;而真实业务里,一个任务往往需要把这两种方式组合起来。
基准成绩上,Holo4 27B在OSWorld电脑任务基准上拿到85.2%,单任务成本0.08美元;安卓手机任务基准AndroidWorld为85.1%。在最考验长流程的OSWorld 2.0上,27B为61.7%(单任务1.22美元),35B-A3B为30.9%;作为对比,H引用的Claude Opus 5.5成绩为81.8%,单任务成本8.48美元。在偏企业自动化的AutomationBench公开集上,27B为45.4%;H同时披露,该基准600道题中有480道落在其训练数据采集范围内,剩下120道留出题得分为49.3%。
成本是H反复强调的差异点。作为基座的Qwen3.8 27B在OSWorld上为84.3%,但单任务成本0.22美元;Holo4 27B的API价格为每百万输入token 0.40美元、输出3.00美元,35B-A3B为0.30美元与2.00美元,官方称缓存输入还能更低。H也没有回避短板:在长流程基准上,Holo4与最强闭源模型之间仍有明显差距。
训练方法是另一条线索。H用内部「智能体任务工厂」(Agentic Task Factory)从文档、截图和真实软件中生成约1万个可验证任务,覆盖约4000个网页应用、3000个MCP服务器与3000个桌面/操作系统任务,只有验证器能拒绝「近似正确」的答案才会保留。监督微调用了1270亿token,其中约四分之三是成功的智能体轨迹;随后用异步在线强化学习训练两个LoRA专家(一个负责桌面与网页,一个负责终端、MCP与API),最后等权合并、不再训练。H还依据OSWorld 2.0的失败分析重建了执行框架,最大的改动是让智能体拥有能追踪数百步的可靠记忆,以及在桌面机上获得一个shell。
开放程度上,权重已发布在Hugging Face,提供BF16、FP8、NVFP4与4-bit GGUF等格式,H称支持本地部署;其中35B-A3B采用Apache 2.0开放权重,适合商业自托管。所有支撑基准成绩的运行轨迹也被开源,可在H的轨迹站点逐步回放。此外,H作为英伟达Nemotron联盟成员,把同一套后训练配方用在了Nemotron 3 Nano Omni上,得到Holotron4 Nano,官方称其在该配方下把OSWorld成绩从基座的21.0%提升到76.3%。
对企业和私有云团队来说,Holo4的价值更多在「可审计」而非「登顶」:开放权重加开放轨迹,意味着评估可以在自己的界面和流程上复现。但要提醒的是,H自己的表格也标注了对比数据来自不同框架与不同推理档位,跨模型比较需谨慎;而在动辄数百步的长任务中,开源模型与闭源前沿的差距仍会显现。
编译自 H Company 官方博客,原标题:"Holo4: powering generalist computer-use agents"