我们在广泛的任务上进行了训练,使token节省效果能够迁移到多种工作负载。随后,我们在Specialized Intelligence Index、公开基准测试和真实生产流量上对Ember-1进行了评估,确认它在消耗更少token的同时没有降低质量。Ember-1是Fireworks自研的模型,也是Fireworks Research系列模型中的首款。
像Kimi K3这样的推理模型,其生成的token大部分(有时超过90%)花费在内部推理而非答案本身上。这种思考结构在单次请求中成本高昂,而在多轮智能体工作负载中问题会严重得多:每一轮都会将此前所有推理重新回放给模型,因此上下文长度随轮数大致呈二次方增长。早期轮次产生的冗长推理轨迹,会在后续每次调用中被重新读取(并重新计费)。
这些推理真的都有必要吗?我们的实验给出了否定答案。Kimi K3产生的推理远超任务实际所需,多余部分可以在不影响答案的前提下被移除。这正是我们打造Ember-1的方式——一个基于专用智能(specialized intelligence)构建的Kimi K3经济高效版本。
K3的推理并非全属浪费。其中一些是自我反思:重新审视某个假设、回应反馈,或将结果追溯到先前的决策,都有助于模型从错误中恢复。关键在于在减少不必要推理、摆脱无效循环的同时保留这种能力。我们相信,从任务和环境反馈中学习,可以让模型学会更高效地推理,同时保持其能力。
对于智能体任务,这种学习贯穿整个交互过程。模型探索可能的行动、吸收新的观察结果,并随任务推进不断修正其推理。反馈将决策与其后果联系起来,在整个任务过程中促进有用的反思。
我们将这些洞察融入一套训练数据集,涵盖数学、编程、指令遵循、对话、搜索、工具使用和软件工程,既包括独立问题也包括长程交互,以强化模型对观察结果与任务结果的适应。任务反馈引导on-policy规划与学习,重点是在上述各类场景中保持模型能力。
公开基准测试和线上A/B测试的结果支持了这一方向:在七个基准测试和两家客户的生产流量中,Kimi K3的推理长度可缩短35–50%,且不损失准确率。这种内化的行为在失败的尝试中也表现出克制的token使用,减少了冗长而无效的推理。
本周早些时候,我们发布了Specialized Intelligence Index (SII),用行业专家创建的真实任务来评测开源、闭源和专用模型。
我们在Doximity的Bedside Bench上评估了Ember-1。这是一个经医生验证的基准测试,涵盖10个专业类别的500个临床病例。
结果如何?在Bedside Bench的单位任务成本(cost/task)维度上,Ember-1在包括GPT-5.6 Sol、GPT-6 Astra和Claude Opus 5在内的开源与闭源模型中,刷新了全新的Pareto前沿。
图1:SII在Bedside Bench上的Pareto前沿
图2:Bedside Bench SII 得分与耗时对比图
我们还在其他一些行业基准上评估了Ember-1在质量-成本前沿上的表现。我们使用公开的Kimi K3 API定价(未缓存输入$3/百万token、缓存输入$0.30/百万token、输出$15/百万token)计算了各基准的单项成本,并针对四组配置绘制了通过率对比:K3低推理强度、K3高推理强度、K3最高推理强度(默认),以及Ember-1。在每个测试样本超过50个的基准上,Ember-1都位于Pareto前沿或其附近,以极低成本实现了与K3-max相当的质量,并严格优于K3-low。我们还分析了GPT-6 Astra、Claude Opus-5和GLM 5.3,发现Ember-1是Pareto前沿上的领先者。
图3:5项行业基准上开源与闭源模型的单位任务成本平均值
我们进一步深挖了Ember-1与原版K3的直接对比结果,得出以下结论:
运行K3最具成本优势的方式,不再是让它少思考,而是改用Ember-1——这个学会了高效思考的模型。
基准测试能说明的东西有限。正如我们在Specialized Intelligence Index结果中所看到的,我们希望在更真实的工作负载上测试该模型,并用生产流量进行检验。真正的考验往往是模型能否在生产流量中、在用户依赖的产品里站得住脚。
我们与两家客户在其生产编程工作负载上进行了线上A/B测试。在两组测试中,Ember-1都带来了可观的token节省:在质量相当的情况下,每个任务的token消耗减少约35%。大多数下游产品指标保持稳定或有所改善——任务完成率、成功评分和失败率都在token成本大幅降低的同时朝好的方向发展。A/B测试之后,其中一家客户目前已将Ember-1投入实际生产,并计划逐步扩大规模,以完全替代基础模型。