Prism ML Inc. 周四正式推出 Bonsai 2 27B,这是其第二代超紧凑多模态生成式 AI 模型。该模型体积小巧,可直接适配个人电脑及部分高端移动设备。

Bonsai 2 基于 Qwen3.8 27B 架构,采用三元化(ternary)技术进行压缩。相较于 Qwen3.8 在 16 位未压缩状态下约 56 GB 的体积,Bonsai 2 将其大幅缩减至约 5.9 GB,同时保留了约 98.2% 的性能。相比之下,Qwen3.8 的最小内存占用量约为 9.4 GB。传统的量化压缩技术往往以牺牲准确性、知识储备及系统能力为代价,而三元化技术在缩小模型“权重”参数时提供了更优解。

在全尺寸模型中,权重通常由 16 位表示;Prism ML 则将其简化为 +1、0 和 -1 三个三元值。这种方法使得模型能在极小的内存占用下,保持较高的智能水平,展现出超越其体量等级的性能。

基准测试与性能表现

在基准测试中,Bonsai 2 的表现与 Qwen3.8 高度接近:

  • 代理任务与工具调用:得分分别为 77.6 和 79.8,差距仅在 3 分以内;
  • 代码编写:涵盖 HumanEval+、LiveCodeBench v6 等基准,综合得分分别为 81.6 和 82.2;
  • 知识与推理:涵盖 MMLU-Redux、GPQA Diamond 等基准,得分分别为 82.7 和 81.3。

硬件兼容性方面,该模型在 NVIDIA GeForce GTX 5090 显卡上无需量化即可运行,推理速度达每秒 143 个 token;在 Apple M5 Max 芯片上,速度为每秒 46.8 个 token。Prism ML 表示,该模型每个 token 的能耗极低,仅为 0.714 兆瓦时,比在完全精度下运行的其他 8B 模型节能 40%。

本地部署与隐私优势

超小型模型支持用户在本地设备运行 AI,无需将推理过程上传云端。这不仅消除了因网络传输导致的延迟,还避免了敏感信息泄露给第三方的风险,有助于满足严格的隐私法规并提升安全性。

对于翻译、摘要和搜索整理等简单任务,本地模型更具成本效益且尊重隐私;而对于长周期任务理解或高互动性研究,用户仍可扩展使用云端高性能模型。目前,Bonsai 2 已通过 CUDA 在 NVIDIA GPU 上提供支持,并通过 MLX 框架低比特内核适配 Apple 设备(包括 Mac、iPhone 和 iPad)。模型权重已根据 Apache 2.0 许可证开放获取。