对我们而言,这种做法比让模型在图形界面中画线效果好得多。这也意味着基准测试可以把更少的时间用于考察计算机操作,把更多时间用于考察电子学。
.ELEC: @STD::Import { .project &= “electronics” .org &= “atopile” }
.Submission: @type { .vin: ELEC::ElectricPower .vhold: ELEC::ElectricPower .vhold.lv ~ .vin.lv
.c_bank: ELEC::Capacitor { .capacitance &= 22uF +/- 20% .max_voltage &= 10V..25V .temperature_coefficient &= “X5R” .package &= “0805” }
.vhold.hv ~> .c_bank ~> .vhold.lv }
现实世界很混乱
公开任务中有一项基于家用电能表。当其 5 V 供电消失时,电路必须让处理器再多存活 20 ms,以便保存累计读数。在此窗口期间,受保护的电源轨必须保持在处理器 3.0 V 掉电阈值之上。
大多数模型都能凭直觉得出正确的基础结论:加一个电容。
真实电容会让任务变得更有意思。陶瓷电容一旦两端加上电压,其实际提供的容值可能远低于标称值。元器件存在公差。增加更多电容意味着更高的成本、更大的占板空间,还会让电源轨在电力恢复后更慢地重新充电。按标称值可行的设计,在实际到货的元器件上可能失效。
EEBench 在仿真中切断输入电源并测量会发生什么。它会检查整个断电期间的电压、工作点处的有效电容、电力恢复后的恢复过程,以及封装、介质、额定电压和成本方面的限制。
(图表:0 5 10 15 20 ms / 0 1 2 3 4 5 V;3 V 最低阈值;0.85 ms 处失败)
电能表属于较容易的任务之一。在更难的模拟任务中,智能体可能需要围绕运算放大器综合出一个多重反馈低通滤波器,为所需极点解出电阻与电容的比值,并在每个元器件被推到最坏公差角点后,仍让增益、截止频率和 Q 值保持在限值之内。测试框架会针对这些角点重建 SPICE 网表,运行 AC 与瞬态扫描,将测量绑定到命名探针,并把每个结果与其上下规格限进行比对记录。
但把公式算对只是电子工程的一部分。EEBench 使用真实的厂商元器件,其规格参数取自数据手册并带入 SPICE 模型。智能体必须找到在所有公差角点下都能工作的组合,同时还要选用确实存在、能够下单采购、且对产品而言价格合理的元器件。这种在电气性能、成本与供货之间的权衡,远比从教科书里挑选理想值更接近真实的硬件设计。
这正是我们觉得最有意思的部分,因为它是电气工程(与所有其他工程学科一样)最终归结的东西:权衡取舍。
EEBench 的检查完全确定。它会构建提交的设计,生成电路图与物料清单,并运行一组 SPICE 仿真和设计检查。每项要求都对应一个带限值的测量结果。
对于电能表任务,测试框架会在输入掉电并恢复的全程测量受保护的电源轨。其他任务则测量增益、阈值、纹波、瞬态响应以及元器件公差角点下的行为。技术得分会结合相对于参考物料清单的成本效率进行综合。只有电路能正常工作,成本控制才会带来加分。
这类似于给编程智能体提供编译器和测试,只不过这里的测试测量的是电压与元器件行为。
EEBench V1 通过仿真覆盖模拟与数字设计。它尚不能回答模型能否完成布局、制造并调试出完整产品,我们希望日后加入这些环节。当前基准聚焦于需求、设计与验证循环,因为在这一环节,我们已经能够客观地为有价值的工程工作打分。完整的方法论与样例结果浏览器均已公开。
9 月 1 日的结果令人鼓舞。Claude Opus 5 在 EEBench V1 的 13 项任务中得分 61.6%。Grok 4.6 以 57.1% 名列第二,略高于得分 56.4% 的 Claude Fable 5.1。几个月前,我们不会想到模型能做得这么好。
还有一个让我们特别高兴的结果:xAI 将 EEBench 收入了 Grok 4.6 模型卡。它出现在"工程加速"一节中,与 3D 建模和参数化 CAD 的评估并列。他们用 EEBench 来描述新模型的工程能力,这让我们觉得它正在成为一个受关注的新类别。
Anthropic 的模型在这个环境中一直表现出色。Grok 的上升同样值得关注。xAI 在 Grok 4.6 的发布文章中表示,该模型接受了高质量工程数据以及在包括计算机辅助设计在内的领域特定环境中的 RL 训练。它的 EEBench 成绩恰好印证了这一说法。
我们目前测试过的 OpenAI 模型排名则相对靠后。GPT-5.5 得分 42.3%,GPT-5.6 Sol 得分 39.4%。我们还没有 GPT-6 Astra 的成绩。在看到它在 KiCad 中调试电路板之后,我们非常想知道它会如何应对这些电路设计任务。
一旦我们拥有能为电路打分的仿真框架,也就有了电子学 RL 环境的雏形。同样的检查可以在后训练阶段用作奖励信号。
一次失败的运行包含有用的信息。我们可以看到哪个电压未达限值、哪个工作角点失败,或者模型是否用了不必要的高成本设计来解决问题。相比模型说一句"原理图看起来挺合理",这为训练循环提供了更多可用信息。