ESC
AI 2 分钟阅读

Bonsai 2 27B 发布:体积缩小9倍,性能近乎无损压缩

PrismML 发布 Ternary Bonsai 2 27B,基于 Qwen3.8 27B,采用三值权重实现每权重1.76有效比特,总体积仅5.9GB,较全精度缩小超9倍,仍保留98.2%基准性能。支持262K上下文与多模态输入,Apache 2.0 开源,RTX 5090 上可达143 tokens/秒,为本地AI部署提供新范式。

来源:Hacker News

返回所有文章

Bonsai 2 27B 正式发布:体积缩小9倍,性能近乎无损压缩

2026年9月17日 • PrismML

两个月前,我们发布了首批 Bonsai 27B 模型,证明了一款27B级别的多模态模型经压缩后可以在本地设备上高效运行。今天,我们推出 Ternary Bonsai 2 27B——迄今最强大的 Bonsai 模型。

Ternary Bonsai 2 27B 基于 Qwen3.8 27B,为 Bonsai 系列带来了更强的推理、编程、视觉与智能体(agentic)能力,同时保留了定义这一系列的部署特性:大幅更小的内存占用、高本地吞吐量以及更出色的能效。

Ternary Bonsai 2 27B 采用三值 {−1, 0, +1} 权重并结合 FP16 分组缩放,实现每权重1.76有效比特,模型总体积仅 5.9GB。低比特表示在整个语言模型中端到端应用。它支持 262K token 上下文窗口、文本与图像多模态输入,并以 Apache 2.0 许可证发布。

与其全精度版本相比,Ternary Bonsai 2 27B 体积缩小超过9倍,同时保留了98.2%的聚合基准性能。在这一保留水平下,压缩成为一种部署解锁:能力几乎相同,却能在多得多的场景中运行。

与第一代 Bonsai 27B 相比有哪些变化

我们的首个 Bonsai 27B 版本是一个重要里程碑,提供了一种在本地设备上运行27B级智能的实用方式。Bonsai 2 27B 聚焦下一步:提升真实本地应用所需的模型质量与运行时性能。与上一代 Bonsai 27B 相比,Bonsai 2 27B 带来了:

  • 更强的基座模型 Qwen3.8 27B
  • 相对全精度模型的聚合能力保留率提升至98.2%
  • 推理、编程、视觉以及长程智能体任务性能的改进

在相同部署条件下实现更高能力

在涵盖推理、数学、编程、指令遵循、视觉与智能体工具使用的基准测试套件中,Ternary Bonsai 2 27B 得分为 83.9,保留了 Qwen3.8 27B 聚合性能的 98.2%。

能力Ternary Bonsai 2 27BQwen3.8 27BQwen3.6 27B
智能体与工具调用(τ²-bench, BFCLv3)77.5779.7480.05
编程(HumanEval+, LiveCodeBench v6, MBPP+, BigCodeBench)81.5882.1782.57
指令遵循(IFBench, IFEval)82.6681.2574.53
知识与推理(MMLU-Redux, GPQA Diamond, AA-LCR)83.9586.6684.71
数学(AIME 2026, AIME 2025, GSM8K, MATH-500)96.5797.0694.64
视觉(CharXiv, A-OKVQA, OmniDocBench v1.6, RealWorldQA, OCRBench v2)78.5981.6479.82
总体83.985.483.6

***图一:***Ternary Bonsai 2 27B(思考模式)与全精度 Qwen3.8 27B 及 Qwen3.6 27B 基线的基准测试得分。完整的逐项基准结果见白皮书。

关键结果不仅在于总分,更在于能力保留在哪里。编程智能体、工具调用系统、多模态工作流和长程任务对模型退化尤其敏感,因为微小误差会在多个步骤中不断累积。Bonsai 2 27B 恰恰在这些领域保留了全精度模型的大部分性能,同时内存占用仅为其一小部分。

与全精度模型及其他低比特方案相比,Bonsai 2 27B 在智能密度上表现突出。许多低比特方案只有在编程、视觉或智能体工具使用方面放弃可观能力后才变得可部署。Bonsai 2 27B 则推动前沿同时迈向更高能力与更低内存占用。

图二: Ternary Bonsai 2 27B 与同参数量级其他模型的智能密度(每GB)对比。

演示一:由 Ternary Bonsai 2 27B 在 NVIDIA GeForce RTX 5090 上驱动的 Cline 编程智能体。

演示二:由 Ternary Bonsai 2 27B 模型在 NVIDIA GeForce RTX 5090 上驱动的计算机操作(computer use)。

有了 Bonsai 2 27B,本地模型可以开始承担真正的知识工作:编程智能体循环、计算机操作工作流、私密文档分析、多模态调试,以及由本地模型处理敏感或高频任务、并选择性上报云端的混合编排。

吞吐量与能效

Ternary Bonsai 2 27B 在 NVIDIA GeForce RTX 5090 上可达 143 tokens/秒,在 M5 Max 上可达 46.8 tokens/秒。在 RTX 4090 上,Ternary Bonsai 2 27B 每 token 仅消耗 0.714 mWh,能效比全精度运行的8B模型高出40%。

对编程助手而言,更高吞吐量意味着更快的编辑-调试循环。对多模态智能体而言,意味着对截图、文档和工具调用的更快迭代。对私密本地工作流而言,更好的能效意味着在同一设备上获得更多有用的推理、更长的电池续航,也让助手能够常驻后台而不必频繁调用云端的愿景更加现实。

为什么这次发布很重要

与 Ternary Bonsai 27B 相比,新的 Ternary Bonsai 2 27B 将相对全精度模型的性能保留差距从95%提升到98%以上。这是一个显著进步,使当前版本在实践中堪称"无损"。这进一步印证了一个理念:低比特模型可以成为部署AI的最佳方式。

其影响远不止本地推理。低比特模型可以改变跨设备、工作站和数据中心的AI系统经济性与架构:在相同内存空间中容纳更大模型、在相同硬件上服务更多用户、降低每次推理的能耗,并支持动态决定哪些任务在本地运行、哪些上云的混合系统。

未来,问题将不再只是模型有多强,而是在给定的内存、算力和功耗预算内能交付多少有用的智能。如果能力能够持续扩展而资源需求大幅下降,未来模型的部署空间将在整个技术栈中扩展:从个人设备到大型数据中心。

平台覆盖

Bonsai 2 27B 通过 CUDA 在 NVIDIA GPU 上运行,并通过自定义低比特内核经 MLX 在 Apple 设备(Mac、iPhone、iPad)上运行。模型权重现已以 Apache 2.0 许可证开放获取。

我们压缩、评估和基准测试过程的完整技术细节见白皮书。

与我们合作

我们与各团队合作为其应用量身定制 Bonsai 模型,从领域特定数据的后训练到针对目标硬件的推理优化。如果您正在构建对内存、延迟或功耗有严格要求的AI产品,我们很乐意探讨 Bonsai 能如何提供帮助。请通过 contact@prismml.com 联系我们。

加入我们

PrismML 源自一支 Caltech 研究团队,在 Khosla Ventures、Cerberus 和 Google 的支持下创立,并持续获得 Samsung 的支持。多年来,我们一直致力于攻克该领域最困难的问题之一:在不牺牲推理能力的前提下压缩神经网络。

如果您想参与构建下一代最先进的AI,我们很乐意听到您的声音。请查看我们的招聘页面。

返回所有文章

联系我们

有问题、合作意向,或需要一个需要高效智能的项目?欢迎联系我们——我们期待您的消息。

谢谢,您的消息已收到!

糟糕!提交表单时出了点问题。