ESC
AI 1 分钟阅读

Gemini 4 Argon 发布:输出 token 上限达 100 万,多项基准刷新纪录

谷歌发布前沿模型 Gemini 4 Argon,将输出 token 上限从 64K 大幅提升至行业领先的 100 万。模型在 DeepSWE v1.1、Vals Index、AutomationBench、LVBench 等多项基准排名第一,并能自主发现、验证和修补软件漏洞,Wiz 已将其用于保护关键公共基础设施。定价为每百万输入 token 2 美元、输出 token 10 美元,将分阶段逐步开

来源:Hacker News

安全地发布这一级别的前沿能力需要分阶段推进。我们正积极参与美国政府的前置发布模型访问自愿流程,同时逐步扩大访问范围。在尽快向开发者、企业和消费者开放 Argon 之前,我们将继续收集早期测试者的反馈,并不断迭代安全护栏。

Argon 将以优惠首发价发布:每百万输入 token 2 美元,每百万输出 token 10 美元,缓存输入 token 的价格为输入 token 价格的 5%(即 95% 折扣)。

Gemini 4 Argon 目前已应用于我们的内部工作流程,数千名 Google 员工强调了该模型在专业编程任务、深度研究和写作质量方面的优势。它正在帮助团队更快地构建产品,突破工程生产力的边界,并加速实现突破:

为了支持 Gemini 4 Argon 在更长、更复杂用例中的能力,我们将模型的输出 token 上限大幅提升至行业领先的 100 万 token,此前为 64K token。当模型有足够的空间进行深度思考、并在单次生成中产出数十万 token 时,它为推理增添了新的深度层次,能够一次性解决棘手问题。

Gemini 4 Argon 在编程、推理和多模态方面的能力,以及其在长时间多步骤任务中的持续表现,使其能够在各类企业工作流程中表现出色。

Google 工程师已在日常任务中使用 Argon,从日常调试到大规模代码库迁移和算法设计。它在衡量模型真实世界长程软件工程任务表现的 DeepSWE v1.1(77.9%)上创下了新的最先进纪录。

在编程之外,Argon 是 Vals Index 的领先模型,该指数衡量模型在金融、编程、法律和税务工作中的经济影响,各行业按其对美国 GDP 的贡献加权。在其他领域特定评测中,Argon 同样表现领先,例如 Vals Finance Agent v2(多步骤金融研究)和 Harvey 的 Legal Agent Benchmark(法律研究与起草)。在 Zapier 衡量核心业务职能端到端执行能力的 AutomationBench 基准上,Argon 以 51.3% 的成绩排名第一。

当知识工作需要视觉理解时,Argon 也展现出独特优势。它能够进行专业的图表分析、从长视频中识别细节,并基于一系列文档采取行动。例如,在衡量长视频理解能力的 LVBench 上,Argon 以 91.7% 的分数达到最先进水平。

为了让网络防御者更好地应对新时代的网络攻击,我们将 Gemini 4 Argon 训练为在网络安全防御方面具备高度能力。Argon 能够自主发现、验证并修补关键软件漏洞。对于受信任的防御者以及 Google 内部团队,我们将发布不带网络安全护栏的 Argon 版本,以便他们充分利用其完整的前沿级网络安全防御能力。

Wiz 已通过其 Scan for Good 计划将 Argon 用于网络安全防御——该计划致力于通过发现并修复高风险暴露,免费保护关键公共基础设施。在一个早期影响展示中,该模型发现了全球医院所使用的医疗保健软件中暴露敏感个人信息的关键漏洞,识别出了以往前沿模型所遗漏的严重风险。

在评估模型修复安全漏洞能力的 CWE-bench v1 上,Argon 以 68% 的最高分并列第一,延续了 3.8 Flash Cyber 在 CWE-bench v0 上的前沿表现。

Gemini 4 Argon 在漏洞发现方面相比 3.8 Flash Cyber 展现出令人瞩目的飞跃。例如:

在广泛推出 Gemini 4 Argon 之前,我们将继续在四个主要领域加强关键的前沿安全防护:

**防范滥用:**为防止不良行为者利用 Argon 进行网络或化学、生物、放射与核(CBRN)攻击,根据我们的 Frontier Safety Framework,该模型被设计为拒绝有害请求,同时保留合法的两用科学研究。为此次发布,我们正在加强安全防护的稳健性,包括改进监测模型内部激活以发现滥用的技术。这些安全防护措施经过了内部和外部红队采用手动与自动化攻击方式相结合的稳健性测试。

**防范提示注入攻击:**Argon 也是我们在抵御间接提示注入方面最具韧性的模型。间接提示注入是指利用恶意指令或上下文来劫持模型行为。这类攻击十分复杂,需要持续警惕和多层防御。通过自动化红队测试和对抗训练,Gemini 4 Argon 在 Gray Swan 的间接提示注入(IPI)基准上保持领先。