延续我们分享基础AI研究的长期传统,今日我们在Hugging Face上发布Muse Glimmer开放权重模型,同时提供开发者文档,帮助你开始构建和运行自己的代理。Muse Glimmer的设计与开发者已经使用的工具兼容。针对llama.cpp、MLX和ExecuTorch的优化集成将在未来几天内完成,让你在几分钟内从下载到运行可用代理。
一个能够管理你的日程、起草消息、整理文件并学习你工作方式的代理,需要深度访问个人上下文。它还需要多种能力协同工作:长程执行、精确工具调用、多模态理解、长上下文记忆和指令遵循。
我们设计Muse Glimmer时,在能力与本地硬件的内存和计算限制之间取得平衡。这需要紧凑的架构、一种新颖的蒸馏方案(将来自更大教师模型的代理推理能力迁移过来),以及包括量化在内的推理优化,以满足延迟预期。我们通过以下阶段实现了这一目标:
Muse Glimmer按照Meta先进AI扩展框架中设定的标准进行了评估,并在所有相关类别中针对开放权重发布进行了评估。
构建有效的代理需要关键能力协同工作以实现用户目标。Muse Glimmer在以下各个方面都经过训练和评估:
我们在广泛的基准上评估了Muse Glimmer,以评估有效自主代理行为所需的各种能力。与Gemma4-31B和Qwen3.6-27B相比,Muse Glimmer在多个广泛使用的LLM基准上在其尺寸类别中表现强劲。
[表格:将Muse Glimmer 30B与Gemma4 31B和Qwen3.6 27B在代理、编码、多模态、安全和推理基准上进行比较。]
关于评估的更多细节,请参阅我们的报告。
本地代理只有在速度足够快、足以让人感觉响应及时时才真正有用。一个需要几分钟才能回复或规划下一步的代理会打断实际工作的流程。我们应用了两种优化,使Muse Glimmer能够在消费级硬件上以实用速度运行,同时不牺牲质量。
在全精度下,一个300亿参数的模型需要超过55GB内存——远超任何消费级GPU的容量。我们使用量化技术将模型权重压缩到约4-bit精度,将语言模型缩小到20GB以下。这为模型的工作内存(即其“KV缓存”)、用于图像理解的感知编码器以及投机解码草稿模型留下了足够空间,使其可以在24GB或32GB内存范围内同时运行。我们验证了这种压缩在代理任务上几乎没有性能下降。
[表格:比较全精度、K-Quant-Dynamic和K-Quant-17GB在精度下降和目标硬件内存方面的差异。]
通过投机解码实现更快的生成
语言模型通常逐token生成文本,这在长推理链或多步工具调用过程中可能会显得缓慢。Muse Glimmer附带一个基于DFlash的轻量级“草稿”模型——一个一次性提出整块token的小型配套网络。主模型随后并行验证这些提议,接受正确的token并纠正错误的token。这项技术让Muse Glimmer生成文本的速度显著快于标准的逐token生成,同时产生相同的输出质量。我们提供了量化版本的草稿模型,以在发布中占用更小的内存开销。
我们在MacBook M4-Max、M5-Max和RTX-5090上测量了K-Quant-17GB模型配合量化DFlash草稿模型的速度。该模型足够快,可实现流畅对话和实时代理交互,且完全在你的设备上运行。