
继两个月前推出首款 Bonsai 27B 模型后,PrismML 今日正式发布 Ternary Bonsai 2 27B。这是该系列目前最强大的模型,旨在证明经过压缩的 270 亿参数级多模态模型,足以在本地设备上高效运行。
Ternary Bonsai 2 27B 基于 Qwen3.8 27B 构建,在延续小内存占用、高本地吞吐量及优能效比部署优势的同时,显著增强了推理、代码生成、视觉理解及智能体(Agentic)能力。
技术突破:5.9GB 实现极低精度表示
该模型采用三元 {-1, 0, +1} 权重结合 FP16 组内缩放技术,将每个权重的精度降至 1.76 有效位,模型总大小仅 5.9GB。这种低比特表示法贯穿整个语言模型,支持 262K token 的上下文窗口,具备多模态文本与图像输入能力,并以 Apache 2.0 许可证开源。
与全精度版本相比,Ternary Bonsai 2 27B 体积缩小 9 倍以上,却保留了 98.2% 的综合基准测试性能。这一压缩技术在几乎不牺牲模型能力的前提下,极大降低了部署门槛,使其能适配更多应用场景。
性能表现:关键领域近乎“无损”
在涵盖推理、数学、代码、指令遵循、视觉及智能体工具使用的基准测试中,Ternary Bonsai 2 27B 得分 83.9,达到全精度 Qwen3.8 27B 98.2% 的性能水平。相较于初代 Bonsai 27B,新版本在基座模型强度、综合能力保留率及长周期智能体性能上均有显著提升。
针对代码智能体、工具使用系统及多模态工作流等对误差累积敏感的关键领域,Bonsai 2 27B 最大程度保留了全精度模型的性能,展现出突出的“智能密度”。许多低比特方案往往以牺牲实质性能力换取可部署性,而 Bonsai 2 27B 则实现了高能力与低内存消耗的双向突破。
能效与吞吐量:本地知识工作的新可能
得益于高效的压缩技术,Ternary Bonsai 2 27B 在 NVIDIA GeForce RTX 5090 上最高吞吐量可达 143 tokens/秒,在 Apple M5 Max 上可达 46.8 tokens/秒。在 RTX 4090 上,其每 token 能耗仅为 0.714 mWh,比全精度运行的 80 亿参数模型节能 40%。
更高的吞吐量加速了代码助手的编辑-调试循环及多模态智能体的处理速度;更佳的能效比则延长了设备续航,为私有文档分析、多模态调试及混合编排架构中的敏感任务处理提供了可行的本地化路径。
行业影响与平台支持
相较于初代产品,Ternary Bonsai 2 27B 将全精度模型的性能保留率从 95% 提升至 98% 以上,进一步巩固了低比特模型作为最佳 AI 部署方式的地位。这不仅改变了本地推理的经济性,更有望重塑跨设备、工作站和数据中心的 AI 系统架构,推动混合系统在动态任务分配上的应用。
目前,Bonsai 2 27B 已通过自定义低比特内核支持 NVIDIA GPU(CUDA)和 Apple 设备(MLX,涵盖 Mac、iPhone、iPad)。模型权重已公开提供。
PrismML 由加州理工学院研究团队创立,获 Khosla Ventures、Cerberus、Google 及三星投资,致力于在不牺牲推理能力的前提下压缩神经网络。团队正寻求与合作伙伴共同针对特定应用场景定制模型,优化从后训练到硬件推理的全流程。