Bonsai 2 27B 正式发布:体积缩小9倍,性能近乎无损压缩
2026年9月17日 • PrismML
两个月前,我们发布了首批 Bonsai 27B 模型,证明了一款27B级别的多模态模型经压缩后可以在本地设备上高效运行。今天,我们推出 Ternary Bonsai 2 27B——迄今最强大的 Bonsai 模型。
Ternary Bonsai 2 27B 基于 Qwen3.8 27B,为 Bonsai 系列带来了更强的推理、编程、视觉与智能体(agentic)能力,同时保留了定义这一系列的部署特性:大幅更小的内存占用、高本地吞吐量以及更出色的能效。
Ternary Bonsai 2 27B 采用三值 {−1, 0, +1} 权重并结合 FP16 分组缩放,实现每权重1.76有效比特,模型总体积仅 5.9GB。低比特表示在整个语言模型中端到端应用。它支持 262K token 上下文窗口、文本与图像多模态输入,并以 Apache 2.0 许可证发布。
与其全精度版本相比,Ternary Bonsai 2 27B 体积缩小超过9倍,同时保留了98.2%的聚合基准性能。在这一保留水平下,压缩成为一种部署解锁:能力几乎相同,却能在多得多的场景中运行。
与第一代 Bonsai 27B 相比有哪些变化
我们的首个 Bonsai 27B 版本是一个重要里程碑,提供了一种在本地设备上运行27B级智能的实用方式。Bonsai 2 27B 聚焦下一步:提升真实本地应用所需的模型质量与运行时性能。与上一代 Bonsai 27B 相比,Bonsai 2 27B 带来了:
- 更强的基座模型 Qwen3.8 27B
- 相对全精度模型的聚合能力保留率提升至98.2%
- 推理、编程、视觉以及长程智能体任务性能的改进
在相同部署条件下实现更高能力
在涵盖推理、数学、编程、指令遵循、视觉与智能体工具使用的基准测试套件中,Ternary Bonsai 2 27B 得分为 83.9,保留了 Qwen3.8 27B 聚合性能的 98.2%。
| 能力 | Ternary Bonsai 2 27B | Qwen3.8 27B | Qwen3.6 27B |
|---|---|---|---|
| 智能体与工具调用(τ²-bench, BFCLv3) | 77.57 | 79.74 | 80.05 |
| 编程(HumanEval+, LiveCodeBench v6, MBPP+, BigCodeBench) | 81.58 | 82.17 | 82.57 |
| 指令遵循(IFBench, IFEval) | 82.66 | 81.25 | 74.53 |
| 知识与推理(MMLU-Redux, GPQA Diamond, AA-LCR) | 83.95 | 86.66 | 84.71 |
| 数学(AIME 2026, AIME 2025, GSM8K, MATH-500) | 96.57 | 97.06 | 94.64 |
| 视觉(CharXiv, A-OKVQA, OmniDocBench v1.6, RealWorldQA, OCRBench v2) | 78.59 | 81.64 | 79.82 |
| 总体 | 83.9 | 85.4 | 83.6 |
***图一:***Ternary Bonsai 2 27B(思考模式)与全精度 Qwen3.8 27B 及 Qwen3.6 27B 基线的基准测试得分。完整的逐项基准结果见白皮书。
关键结果不仅在于总分,更在于能力保留在哪里。编程智能体、工具调用系统、多模态工作流和长程任务对模型退化尤其敏感,因为微小误差会在多个步骤中不断累积。Bonsai 2 27B 恰恰在这些领域保留了全精度模型的大部分性能,同时内存占用仅为其一小部分。
与全精度模型及其他低比特方案相比,Bonsai 2 27B 在智能密度上表现突出。许多低比特方案只有在编程、视觉或智能体工具使用方面放弃可观能力后才变得可部署。Bonsai 2 27B 则推动前沿同时迈向更高能力与更低内存占用。
图二: Ternary Bonsai 2 27B 与同参数量级其他模型的智能密度(每GB)对比。
演示一:由 Ternary Bonsai 2 27B 在 NVIDIA GeForce RTX 5090 上驱动的 Cline 编程智能体。
演示二:由 Ternary Bonsai 2 27B 模型在 NVIDIA GeForce RTX 5090 上驱动的计算机操作(computer use)。
有了 Bonsai 2 27B,本地模型可以开始承担真正的知识工作:编程智能体循环、计算机操作工作流、私密文档分析、多模态调试,以及由本地模型处理敏感或高频任务、并选择性上报云端的混合编排。
吞吐量与能效
Ternary Bonsai 2 27B 在 NVIDIA GeForce RTX 5090 上可达 143 tokens/秒,在 M5 Max 上可达 46.8 tokens/秒。在 RTX 4090 上,Ternary Bonsai 2 27B 每 token 仅消耗 0.714 mWh,能效比全精度运行的8B模型高出40%。
对编程助手而言,更高吞吐量意味着更快的编辑-调试循环。对多模态智能体而言,意味着对截图、文档和工具调用的更快迭代。对私密本地工作流而言,更好的能效意味着在同一设备上获得更多有用的推理、更长的电池续航,也让助手能够常驻后台而不必频繁调用云端的愿景更加现实。
为什么这次发布很重要
与 Ternary Bonsai 27B 相比,新的 Ternary Bonsai 2 27B 将相对全精度模型的性能保留差距从95%提升到98%以上。这是一个显著进步,使当前版本在实践中堪称"无损"。这进一步印证了一个理念:低比特模型可以成为部署AI的最佳方式。
其影响远不止本地推理。低比特模型可以改变跨设备、工作站和数据中心的AI系统经济性与架构:在相同内存空间中容纳更大模型、在相同硬件上服务更多用户、降低每次推理的能耗,并支持动态决定哪些任务在本地运行、哪些上云的混合系统。
未来,问题将不再只是模型有多强,而是在给定的内存、算力和功耗预算内能交付多少有用的智能。如果能力能够持续扩展而资源需求大幅下降,未来模型的部署空间将在整个技术栈中扩展:从个人设备到大型数据中心。
平台覆盖
Bonsai 2 27B 通过 CUDA 在 NVIDIA GPU 上运行,并通过自定义低比特内核经 MLX 在 Apple 设备(Mac、iPhone、iPad)上运行。模型权重现已以 Apache 2.0 许可证开放获取。
我们压缩、评估和基准测试过程的完整技术细节见白皮书。
与我们合作
我们与各团队合作为其应用量身定制 Bonsai 模型,从领域特定数据的后训练到针对目标硬件的推理优化。如果您正在构建对内存、延迟或功耗有严格要求的AI产品,我们很乐意探讨 Bonsai 能如何提供帮助。请通过 contact@prismml.com 联系我们。
加入我们
PrismML 源自一支 Caltech 研究团队,在 Khosla Ventures、Cerberus 和 Google 的支持下创立,并持续获得 Samsung 的支持。多年来,我们一直致力于攻克该领域最困难的问题之一:在不牺牲推理能力的前提下压缩神经网络。
如果您想参与构建下一代最先进的AI,我们很乐意听到您的声音。请查看我们的招聘页面。
联系我们
有问题、合作意向,或需要一个需要高效智能的项目?欢迎联系我们——我们期待您的消息。
谢谢,您的消息已收到!
糟糕!提交表单时出了点问题。