为了避免外部[基准测试](https://arxiv.org/html/2602.16763v3)已过度饱和而带来的偏见,他们根据团队工程师日常执行的任务创建了自己的测试。结果与我们的预期一致,但业内许多人可能对此感到惊讶。用他们的话说:“……调用模型的框架(harness)对成本和质量的影深远,”以及“在许多情况下,像Pi这样简单的框架在我们的工作负载上表现最佳。”
当Pi与Opus 4.8(xhigh)组合时,获得了最高的总体通过率,且成本显著低于Claude Code和Codex。
Pi的优势在于,它不会试图用一堆默认设置和指令包裹模型,这些指令在[指令层级](https://openai.com/index/the-instruction-hierarchy/)中很容易丢失。相反,Pi不干扰模型,让团队能够为工作流添加真正需要的功能。
Databricks的研究很有启发性,因为它将模型与框架分离开来。
他们报告称,当通过不同框架运行同一模型、使用相同的思考力度时,“每个任务的成本差异显著(某些情况下超过2倍),而质量保持不变”。我们称其为Pi的“上下文纪律”。“Pi每轮发送的上下文减少了约3倍。它更好地管理上下文,保持更紧凑的工作集,并用更少的运行次数完成任务。”
我们同意,必须考虑端到端的工程经济学,而不仅仅是每token的价格。在模型层面也是如此;例如,我们观察到,在Haiku 4.5上运行复杂工作流通常比Sonnet 4.6更昂贵,尤其是在涉及代码执行时,仅仅因为智能体需要更多轮次才能成功完成任务。
现在我们在框架层面也看到了这一点:更强大、更昂贵的模型配合高效的框架,可能比相反的组合更便宜。
极简主义是Pi核心哲学的一部分。它之所以有效,是因为极简并不意味着不灵活。事实上,它是第一个为可扩展性和可自编辑性而设计的广泛使用的智能体基础设施。
另一个对Pi设计的有见地的外部验证来自Shopify。在Shopify Engineering的这篇文章中,David Cortés描述了如何直接构建pi-autoresearch作为Pi扩展,只需简单地问“Pi,[请]创建一个用于Autoresearch的扩展……”。Pi读取自己的扩展文档,并由此开始构建新的工作流。
Autoresearch是一个使用编码智能体进行优化的自主循环。当你要求更改时,它会运行实验以找出有效的方法以及导致回退的原因。只要目标可衡量,它就能排除这些回退并持续自我改进。
对于Shopify及其他公司来说,Autoresearch扩展迅速成为一款重要的内部生产力工具。Shopify报告了几个案例,包括单元测试“快300倍”运行、React组件挂载“快20%”、多个项目的构建时间缩短,甚至pnpm性能也有所提升。
这里的重点是,Pi并没有预装这些工具。相反,它让你构建这些工具变得极其简单。Pi不假设供应商了解你的工作流并试图提供所有工具,而是假设你最了解自己,赋予你可扩展性来掌握和打造自己的工作流。