ESC
AI 1 分钟阅读

Anthropic 发布 Claude Haiku 5.5:首款支持可调节努力程度的 Haiku 级模型,同步下调 Sonnet 5.5 缓存价格

Anthropic 正式发布 Claude Haiku 5.5,是其首款支持可调节努力程度的 Haiku 级模型,用户可在成本与智能间自由权衡。客户实测显示延迟降低超30%、推理速度最高提升2.5倍,CRM任务测试得分达92.8%。同时宣布 Sonnet 5.5 缓存读取价格下调50%,模型已在 AWS、Google Cloud、Azure 等全平台上线。

来源:Hacker News

有关我们如何运行评估的详细信息,请参阅 Haiku 5.5 System Card。

Haiku 5.5 是我们首款支持可调节努力程度的 Haiku 级模型。这意味着,与我们的其他模型一样,用户可以自行决定是优化成本还是优化智能水平。下图展示了 Haiku 5.5 在各努力程度设置下于三项基准测试中的表现:

LowMedHighXhighMax

OSWorld 2.1 衡量智能体操作真实计算机完成长链条、多步骤任务的能力。

Elo, as reported0.0050.010.020.050.100.200.50125Cost per task (USD, log scale)LowMedHighXhighMax

Artificial Analysis 的 GDPval-AA v2.1 评估智能体在 44 种职业的真实专业工作中的表现。

Humanity’s Last Exam (HLE) 是一项针对专家级学术知识与推理能力的测试。

在早期测试中,我们的客户报告的结果与上图所示的性能和成本改进一致。以下是他们对新模型的评价:

“Claude Haiku 5.5 给我们留下了深刻印象,尤其是它的速度。我们通过面向 AI 智能体产品 AI Teammates 的评估套件对它进行了测试,涵盖 bug 分类、项目搭建,以及从大型项目组合中搜索以发现高风险或逾期工作等用例。与我们目前使用的模型相比,任务完成的延迟降低了 30% 以上,每个智能体回合的推理速度最高提升 2.5 倍。体验明显更加流畅。”

“在 HubSpot,我们使用模拟门户来评估新模型在 CRM 任务(如交易报告)上的表现。我们主要测试更小、更高效的模型,而 Claude Haiku 5.5 在该套件上取得了我们有史以来的最佳成绩,三次运行平均达 92.8%。其中一项 CRM 审计任务要求模型识别过时但模糊的记录。在我们测试的所有模型中,Haiku 5.5 完成任务的速度最快,命中率最高,误报率最低。”

“Ask in Document 是我们最大的支出来源之一,每周在生产环境中进行约 800 万次调用。它基于一篇或几篇文档回答非常具体的问题。我们运行了 400 个查询,Claude Haiku 5.5 相较于 Haiku 4.5 有统计学上的显著改进:0.84 对 0.76。”

“我们的客户在大量企业内容上使用 Box AI。广泛的使用带来了管理效率和成本的需求,也需要找到最适合手头任务的模型。在早期测试中,Claude Haiku 5.5 比 Haiku 4.5 高出 11 分,而延迟约为一半。我们会将其用于大规模运行的分析工作,从成本报告到财务摘要以及每周例行审查。”

“短小且高量的工作正是 Claude Haiku 5.5 适合我们的场景,比如快速查询、子智能体和摘要。当更大的模型在制作演示文稿时,一个 Haiku 5.5 子智能体会深入 10-K 财报,提取演示文稿所需的分部收入数据。它的准确性足以让我们放心,同时速度快、成本低,我们可以大量运行。”

“Claude Haiku 5.5 作为优秀选项加入了 Devin Fusion 的 sidekick 阵容。以 Haiku 5.5 作为 sidekick,Fusion 保持了顶级的 FrontierCode 分数 66.2,同时降低了成本和延迟。你现在可以在 Devin CLI 中搭配 Opus 5.5 作为主模型来体验它。”

下表展示了 Claude Haiku 5.5 与我们其他模型的定价对比。对于提示词不超过 100,000 token 的任务(约占我们上一代 Haiku 模型请求量的 90%),Haiku 5.5 的性价比尤为出色。

对齐。 相较于 Haiku 4.5,Claude Haiku 5.5 在我们几乎所有的对齐评估中都表现出重大改进。特别是,我们发现失范行为的实例大大减少,模型配合滥用行为的意愿也更低。该模型的系统卡更详细地描述了我们的评估过程和结果。

安全防护。 与其能力相匹配,Haiku 5.5 的网络安全防护比 Haiku 4.5 更严格,但比我们对其他近期模型采取的防护稍宽松。在网络安全方面,这些防护允许的防御性任务范围比 Sonnet 5.5 的防护更广,但仍会阻止渗透测试和其他更可能被攻击者使用的技术。

Haiku 5.5 的生物安全防护与 Sonnet 5、Sonnet 5.5 和 Opus 5 相同。它们允许研究性生物学问题,但限制我们认为可能造成危害的请求。从事更广泛生物和网络安全活动的组织可以申请我们的生命科学验证计划和网络安全验证计划。

Claude Haiku 5.5 现已在所有平台上线,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。在 Claude 平台上,开发者可以通过 claude-haiku-5-5 开始使用。

除了 Claude Haiku 5.5 的新定价外,我们还在进一步提升我们模型和产品的价值。

首先,从今天起,我们下调了 Claude Sonnet 5.5 缓存读取的价格。缓存读取现在便宜 50%:从每百万 token 0.20 美元降至 0.10 美元。由于缓存读取在模型 token 消耗中占很大比重,这将使 Sonnet 5.5 在大多数智能体任务上的成本降低约 20%。