大多数大型语言模型(LLM)虽擅长文本生成,但在Windows或Linux桌面环境的图形用户界面(GUI)导航中往往表现乏力。近日,法国AI开发商H发布了Holo 4系列计算机使用模型,旨在赋予AI理解并操作GUI的能力。

计算机交互主要分为命令行(CLI)、应用程序接口(API)和图形用户界面(GUI)三类。AI代理能轻松接入前两者,但要在为人类设计的桌面环境中自如点击、滚动和输入,仍是一大挑战。Holo 4系列正是为解决这一痛点而生,使较小参数的模型也能通吃这三种交互场景。

基于阿里Qwen构建,通用性更强

Holo 4基于阿里Qwen 3.8 27B和Qwen 3.6 35B-A3B模型构建,经过监督训练与强化学习微调。H声称,相较于单一的计算机使用模型,Holo 4在CLI、API和GUI上的综合优化使其具备更高的通用性。同时,H还更新了基于英伟达Nemotron 3的Holotron模型,赋予其类似能力。

在演示中,Holo 4 27B利用FreeCAD宏功能,以编程方式设计了埃菲尔铁塔的3D模型,而非手动堆砌基本形状;另一项演示则通过拉伸形状重现了公司Logo,展示了模型的灵活性。H表示,若基准测试结果属实,Holo 4的性能显著优于OpenAI等公司的前沿大模型,而参数量仅为后者零头。

性能提升伴随成本增加,消费级显卡可运行

值得注意的是,高性能并未带来低成本。尽管得分更高,但Holo 4在许多情况下的单任务成本反而高于OSWorld 2.0基准测试中表现较差但成本低廉的GPT 6 Luna。这可能是因为Holo 4为得出最终结果,消耗了更多的“思考”令牌。

不过,得益于小巧的体积,研究人员和企业可在相对普通的硬件上运行这些开源权重模型。一张24GB显存的英伟达RTX 3090显卡,足以以4位精度运行该模型。为此,H除了提供BF16、FP8和NVFP4权重外,还在Hugging Face上发布了兼容Llama.cpp(及LM Studio、Ollama)的GGUF版本。

H还计划发布DSpark草稿权重,利用推测解码技术加速推理:小模型预先猜测输出,成功则加速生成,失败则回退至基础模型,确保质量不丢失。此外,H开发了开源的HAI-Agents框架,也可在GitHub获取,理论上这些模型亦兼容第三方计算机使用框架。

目前,专注计算机使用应用的开发者不止H一家。AWS在去年Re:Invent大会上推出了自家系列,OpenAI、谷歌和Anthropic等美国头部实验室也在持续投入这一领域,试图让AI真正具备“走出沙盒”操作现实界面的能力。