ESC
AI 1 分钟阅读

Google称新Gemini 3.8 Flash模型“干活更卖力”,但成本可能更高

Google发布Gemini 3.8 Flash,距前代仅数周。官方称其通过更多推理步骤和迭代调用工具比Gemini 3.7 Flash“干活更卖力”。入门定价与3.7 Flash持平,但因token消耗更多实际成本或上升。新模型在软件工程、金融与法律Agent基准上超越竞品,并同步推出面向政府的Gemini 3.8 Flash Cyber及Fairwind计划。

来源:The Verge

Google发布了Gemini 3.8 Flash,距其前代发布仅过去数周时间。该公司声称,新模型通过在复杂任务上执行更多推理步骤并“迭代调用工具”,比Gemini 3.7 Flash“干活更卖力”。其入门定价与3.7 Flash相同,为每百万输入token 0.75美元、每百万输出token 3.75美元,但最终用户实际花费可能更高。Google警告称,“该模型可能会使用更多token以最大化性能,尤其是在更高的努力程度(effort level)设置下。”如果开发者希望尽量减少token消耗,可以继续使用Gemini 3.7 Flash。

Gemini 3.8 Flash发布后,网上出现了不少早期实测反馈。Artificial Analysis重点提到了该模型的定价,称Gemini 3.8 Flash是“我们在这一智能水平上测得的最便宜模型”。尽管单token价格不变,其成本较Gemini 3.7 Flash仍上涨约40%,原因是每任务的输出token增加了30%,且在Agent评测中的轮次更多。

Aigora.ai CEO John Ennis将Gemini 3.8 Flash与Anthropic的模型进行了比较,称其提供了“Opus 5级别的编码质量,但成本只是零头,而且速度超快”,并补充说:“这对于制作remotion视频之类的任务来说简直太棒了。”

Google表示,Gemini 3.8 Flash在软件工程和自主AI Agent方面带来了“显著提升”。在DeepSWE v1.1软件工程基准测试中,其表现超越了前代模型和其他前沿模型,其中包括Anthropic的Fable 5——后者本周早些时候刚获升级,同样承诺以更低价格提供更强性能,方式是下调缓存数据的使用价格。

Google的新模型在Vals Finance Agent V2基准和Harvey的Legal Agent基准上也胜过了竞争对手。不过,新模型还“内置了针对化学、生物、放射与核(CBRN)领域及网络攻击滥用的安全防护措施”。

Google还随新模型一同推出了Gemini 3.8 Flash Cyber以及全新的Fairwind计划,该计划仅面向政府机构和“可信合作伙伴”。该计划拥有650名成员,包括CrowdStrike和互联网安全中心(Center for Internet Security),成员可获得3.8 Flash Cyber以及Google的CodeMender Agent的使用权限。Google表示,CodeMender可以帮助“自主发现并修复漏洞,保护关键基础设施、公共服务和国家安全”。Gemini 3.8 Flash现已面向订阅Google AI Pro或Ultra的消费者以及开发者和企业用户开放。