我们与全球金融、工程、制造、物流、制药、科学、航运、公共部门及其他关键任务行业的领先企业紧密合作,共同训练了 ML4。事实上,该模型使用的正是我们通过 Mistral Forge 向客户提供的那套训练、定制与强化学习(RL)环境。
后续还有更多内容。在我们推进权重发布的过程中,我们将分享有关模型架构的更多细节、更多基准测试结果以及我们的后训练方法。
该模型还将作为新一代专项化与优化版 Mistral 模型的基础。在此期间,我们邀请你试用预览 API,并在社交媒体上与我们分享反馈。
ML4 是全球网络安全领域最强的 AI 模型之一。在 Artificial Analysis Cyber Index(一项独立评估 AI 模型在真实软件中发现并修复安全漏洞能力的测试)上,它位列全球前五,并大幅领先于中国以外开发的开源权重模型。在该指数的一项测试中——要求模型复现开源软件中的一个真实漏洞然后进行修补——ML4 得分 82%,为所有模型中最高。它还解决了 Cybench 中 93% 的挑战(Cybench 是一套取材于安全竞赛的 40 道练习题),这是开源权重模型中已报告的最高分之一。
这一最高分反映了一种实际优势。包括 Claude Opus 5.5 和 GPT-6 Astra 在内的多款领先闭源模型在同一测试中得分接近于零,因为它们拒绝执行该任务。然而,软件防御往往始于证明漏洞真实存在,而这正是闭源模型中的安全过滤机制可能阻止的那类工作。随着威胁行为者越来越多地越狱这些模型以支持攻击性网络活动,这一点变得更加重要:防御者需要能力上能匹敌攻击者、又不受同样拒绝限制的系统。ML4 可以胜任这类工作,且其能力延伸到了显式训练范围之外:在内部测试中,它被证明对分析恶意软件、漏洞优先级排序和编写检测规则都很有用。对于需要主权、可审计 AI 来开展安全运营的组织,它可以运行在私有云或本地环境中。
ML4 在软件工程、代码库理解和复杂终端工作流方面表现出色,在 DeepSWE v1.1 上得分 61.7%,在 SWE-Atlas-QnA 上得分 59.4%,在 Terminal-Bench 4 上得分 28.3%。其综合 Coding Agent Index 得分为 49.8%,领先于 DeepSeek V4 Pro 0813 和 Qwen3.8 Max。
** DeepSWE v1.1、Terminal-Bench 4.0 和 SWE-Atlas-QnA 的分数采用 Artificial Analysis 在该评测框架公开上线前私下评测的数字,这些结果将在框架发布后被纳入 Artificial Analysis Coding Agent Index。*
我们还与 Surge AI 合作,就代码质量开展了一项盲测人类评估:专业标注者在模型身份隐藏的情况下按 1–5 分对模型输出进行评分。ML4 Preview 在五个模型中排名第二(3.74 分),领先于 Kimi K3(3.59 分)、GLM-5.3(3.60 分)和 GLM-5.2(3.40 分),仅次于 Claude Opus 5(4.22 分)。
ML4 可运行通用型智能体,在复杂工作流中收集信息、使用工具并产出最终交付物。在 AutomationBench——涵盖 Gmail、Google Sheets、Slack 和 Salesforce 等 657 个商业工作流——上,它得分 59.9%,领先于 Kimi K3、MiMo-V2.6-Pro 和 DeepSeek V4 Pro。
在知识工作实际产出的专业交付物上,它同样实力强劲:电子表格、幻灯片和 PDF。在评估长时程知识工作的 AA-Briefcase 上,它达到 1,393 Elo,领先于 DeepSeek V4 Pro。
ML4 标志着我们的模型在图像理解能力上的一次跨越式提升。它能在复杂文档、图表和自然图像上进行强大的推理,并将视觉能力带给工程、制造和对地观测等感知至关重要的行业。
该模型还能将视觉定位与智能体能力相结合:从检查吉像素级卫星图像——帮助救灾团队在分秒必争时采取行动——到分析工程图纸——不断放大、检查、验证,直到答案精确无误。在上面的演示中,ML4 能对密集自然场景进行视觉定位、验证技术图纸中的机械零件、从 PDF 中检索证据,并在大规模地理空间图像中扫描最难发现的物体。
在视觉定位方面尤为突出,我们发现 ML4 是我们测试过的最强模型之一,例如在 Dense 200 上超过 GPT-6-Astra(42% 对 41%)。
ML4 带来强大的科学能力,这是将 AI 驱动方法与我们研究者在数学、物理和化学领域的专业知识相结合的成果。
它在数据分析、建模和模拟物理现实等科学任务的智能体编程方面非常熟练,让研究者能够专注于问题本身而非繁琐的工程细节。在基准测试中,ML4 在开源权重模型中的 SciCode-Verified 上达到最先进水平。在实践中,它可以一次性生成完整的 Hartree–Fock 模拟——这是一个由一系列高级例程构成的复杂多步骤化学任务。
ML4 的数学能力也更强,涵盖形式推理和应用数学。在人类评估中,它的推理比 GLM-5.3 更精确、更有条理,并且能够持续处理长周期、特定领域的应用数学任务,包括与前沿理论物理相关的工作。
这些能力共同使 ML4 成为覆盖完整技术工作流的强大研究助手——从最初的问题到最终的结果。
SciCode-Verified 测试模型在物理、数学、材料科学和生物等领域用代码实现复杂科学工作流的能力。
ML4 与 GLM5.3 在 STEM 任务(数学和物理)上的内部评估
ML4 是我们面向专业人士日常实际任务的最强模型。它可以创建、编辑和修复复杂的电子表格和文档,在法律和金融基准测试中均表现卓越。
值得注意的是,我们通过第三方评估机构 (vals.ai) 在法律和金融两类代表性任务上对 ML4 进行了评估,发现该模型在两种情况下均超过 GPT-6-Astra。在 HarveyAI 的 Legal Agent 基准测试上,ML4 的表现优于所有开源模型。
FinWorkBench 测试模型在真实金融与会计用例中创建/编辑电子表格的能力。
金融分析要求精确性以及从多个来源综合信息的能力,这一流程在今天许多金融机构中仍然耗时。在这个演示中,ML4 与其他顶级开源模型接受同样的多步骤公司金融挑战,检索上市公司公告和财务报告等公开文件,例如通过 EDGAR 及欧洲同类数据库可获取的资料。一幅动态语义地图记录了每个模型走向解决方案的历程,高亮显示沿途检索到的每一份文档。每条轨迹的位置反映了已收集的证据、计算结果以及尚未解决的问题。观众可以追踪调查如何展开,并比较各模型在得出最终答案之前所走的不同路径。
ML4 在间接提示注入鲁棒性方面的基准测试已趋于饱和,使其处于开源模型的前沿(对比对象包括 GLM-5.2、GLM-5.3、Kimi-K2.6、Kimi-K3、DS-V4-Pro-0813)。在 Lakera 公开的 B3 AI Security Benchmark 上,ML4 抵御了 93.3% 的攻击——我们在竞争对手中没有看到更高的分数。
ML4 与用户的交互也比我们以往任何模型都更负责任。我们重点介绍了 KORA Benchmark 上的结果,ML4 再次以开源模型中我们所测得的最高分位居榜首(1.691 分,满分为 2 分,2 分表示“Exemplary”)。
尤其值得关注的是,该模型倾向于拒绝涉及网络安全的恶意请求。尽管在 Cyber 基准上表现强劲,该模型对来自 JailbreakBench、StrongREJECT 和 AgentHarm 的网络安全提示的平均拒绝率高于所有开源模型。
我们进行了一项内部评估,由涵盖编程、计算机辅助设计(CAD)、金融、数学和物理领域的专家标注者将 Mistral Large 4 与 GLM-5.3 进行对比。ML4 在 CAD 和 STEM 方面更受青睐,在金融和编程方面与 GLM-5.3 持平或接近。