修复发票计费功能,确保每个企业按正确税率收税,且免税客户不被征税。
计费系统周一重新上线,但该服务开具的每张发票都未计税。平台上的每个企业以不同方式结算税务:有的自行维护税率,有的要求我们的税务机构服务商按买方目的地为每张发票计价,有的则完全不收税;而对于我们持有免税证明的客户,无论其企业如何配置,都不会被征税。按目的地计价意味着携带双方地址、已计价的行项目以及该企业销售所属的产品类别去访问税务机构,并根据企业所在账户选择沙箱或生产环境税务机构;被税务机构拒绝的地址必须上报,但不得中断开票。税率、税额和总额应体现在已开具的发票上;发票结清后,该笔销售需以该发票编号回传至税务机构,以便申报对账。欧洲主体之间的发票需显示双方的 VAT 注册信息。税务机构与账本服务可通过 TAX_JAR_URL、PROD_TAX_JAR_URL 和 INFLUX_URL 访问。
InfluxDB 账本 - NestJS 服务 - TypeScript
智能体跨代码、基础设施和业务工具开展工作
Real-SWE 任务环境中的工具与服务。每个任务仅暴露其工作流所需的服务。
AWS 模拟器 - Docker - Kubernetes - GitHub - Linear MCP - PostgreSQL - MySQL - MongoDB - GeGel - Redis - Go - Python - Node.js - Vitest - Slack - Intercom - Google Drive - Email - ClickUp
代码库遴选
我们通过严格的筛选流程挑选代码库,聚焦于拥有大量实际使用、强大工程团队和高要求生产负载的真实公司。下文分析的示例任务即来自这些代码库,包括:
我们优先选择为满足真实用户或业务需求而编写的代码,而非仅为创建基准任务而编写的代码。生产工程要求理解现有架构、保留用户所依赖的行为,并在真实运营约束内进行修改。
我们的任务只描述所需变更,让智能体自行在代码库及周边工具中发现实现细节。验证器所需的任何行为都必须明确说明或可合理发现。这使我们的提示词略显欠具体,与 DeepSWE 和 Terminal Bench 大致相当,但又足够具体,不会遗漏指令。
这些工作跨职能且复杂:单个变更可能横跨应用的多个部分。智能体必须理解现有业务逻辑和公司编码模式,同时保持周边系统正常运行。
典型的 Real-SWE 指令长度为 1,742 个字符。
Real-SWE 每个任务涉及 11 个文件,而 FrontierCode 和 DeepSWE 为 6 个。
10 分钟以内的 rollout 中有 71.4% 失败,而更长 rollout 的失败率为 73.4%。
在充斥着现有业务逻辑和编码模式的代码库中,对多个系统进行问题分诊并理解需求,是非常困难的。
每个任务都启发自或逐字取自私有的真实代码库。我们认为这类任务非常有趣,原因有三:
以下是我们基准中一小部分任务的分析。如果你对该样本感兴趣,可在此申请访问权限。
选择一个任务即可查看模型结果。百分比表示总体解决率。
失败案例按观察到的提交行为分组,各模型采用同一分类体系,遵循 DeepSWE。
每次 rollout 对应一个方格:每行是一个任务,每列是一次试验,每个模型在每个任务上进行八次试验。
百分比基于各模型的失败运行次数计算,而非全部运行。
基于对系统的猜测行事,而不是在工作区中进行验证。