基准测试已成为 AI 公司验证模型能力的行业惯例——当指标对己方有利时,公司便可借此从竞争对手中脱颖而出,宣扬自身优势。换句话说,好的基准测试成绩几乎总是意味着好的公关效果。
不幸的是,各公司也早已摸索出绕过传统基准测试系统的方法——其中许多基准年代已久,并非为衡量现代模型的能力而设计。
成立于 2024 年的初创公司 Vals 表示,其使命正是修复这个极不完善的体系。在不到两年的时间里,该公司已在科技行业站稳脚跟:去年完成了由 8VC 和 Bloomberg Beta 领投的种子轮融资;上月,在经历一段快速增长期后,它又完成了由 Andreessen Horowitz 领投的 4000 万美元 A 轮融资。
公司 25 岁的联合创始人 Rayan Krishnan 曾在 Palantir 实习,本科就读于斯坦福大学期间,还为 Microsoft 以及该校大名鼎鼎的人工智能实验室工作过。Krishnan 表示,Vals 的创立源于他的亲身观察:基准测试的演进已落后于它本应衡量的行业本身的发展。
“我们看到大量能力强大的新模型迅速进入市场,而学术基准测试却跟不上这种前沿进展。”Krishnan 分享道。随着 AI 被整合进社会的方方面面,基准测试理应承担起验证模型能否真正做到公司所宣称功能的职责。
上周,这位年轻的创始人带我参观了他公司位于旧金山 Folsom 街的两层办公楼——这是一栋有着百年历史的老砖楼,曾经是一座大型啤酒厂的所在地。如今,这座历史建筑不再产出工业啤酒,而是容纳了多家致力于打造科技行业未来的初创公司。
“以往,我认为评估是以非常抽象的方式衡量智能,”Krishnan 告诉我,“比如,模型掌握的知识是否足够通过律师资格考试这类测试?”
这正是 Vals 寻求差异化之处。许多基准测试系统的题目都是公开的(这可能让公司针对这些题目训练模型,无异于考试作弊),而 Vals 不会公开其具体测试材料。除了衡量 AI 模型的通用知识,Vals 还评估模型完成法律、金融、编程等特定行业复杂任务的能力。
“我们真正做的,是考察模型带来的实际影响,”Krishnan 说,“在各个领域,它们能否完成与人类产出质量相当的工作?”
他说,其理念是不仅检测正面结果,也要检测负面结果,希望能分析“如果这些模型在现实中肆意运行,会产生哪些负面影响”。
Vals 衡量的能力范围正在扩大。除了更传统的行业,这家初创公司还在向更独特的领域推进。“我们有一个关于递归自我改进的基准。我们还在心理健康、网络安全、生物安全,甚至武装冲突法等方向开展研究,让模型理解如何适用《日内瓦公约》,”Krishnan 分享道。
企业付费请 Vals 测试自家模型,这个概念乍听起来有些奇怪:为什么公司要花钱得知自己的模型表现不佳?但有效的衡量方式能帮助企业排查问题并持续改进。Krishnan 将其收入模式比作学生付费向 College Board 参加 SAT 考试。
反过来,这些评估也正成为企业选购新 AI 模型时的关键决策依据。
这家初创公司最近披露,其收入目前是去年的八倍。团队规模也在增长:Vals 年初仅有 8 人,如今已增长两倍达到 25 人。Krishnan 表示,随着公司发展,计划搬入规模大得多的办公室,并再招聘 10 到 15 名员工。该公司最近还启动了一个项目,专注于为联邦机构提供模型评估。
Krishnan 认为,公司的基准测试体系将塑造 AI 公司未来思考业务增长与建立公众信任的方式。
“AI 公司正陆续上市。SpaceX 已经上市,Anthropic 预计今年晚些时候上市,我猜 OpenAI 很快也会上市。我认为,随着 AI 模型成为经济的核心组成部分并被更广泛地应用,我们所做的这类基准测试和评估将推动模型的使用,并成为这些公司提交公开文件或谈论 AI 领域投资计划时的重要组成部分。”他说。