小型模型已经到来
2026年8月26日
过去几周,我一直在玩gpt-5.6-luna。它惊人地能干、快速且聪明。我经常看到它以约100 tps的速度运转,并快速处理我的代码库、电子邮件和知识库。
当然,luna最大的亮点是成本。我尝试运行了一些相当复杂的研究线程,结果很难把账单推高。即使让它搜索数千封邮件,最终的API成本也只有几毛钱。
有了GLM 5.3,我们在帕累托前沿上甚至有了新的选择。
在做编码工作时,我几乎总是选择最昂贵、最强大的模型(Fable 5、5.6 Sol)。所以很容易忽视小型快速模型取得的进步。
与我交谈过的一些投资者提到:“很奇怪我们没有看到更多消费级AI公司。这是为什么?”
答案很简单:token成本。
在AI之前的时代,大型消费级应用的打法是这样的:
- 创建一个有吸引力的网站,运行成本相当低
- 吸引大量用户(通常借助某种病毒式传播)
- 融资,扩展到更多用户
- 创建广告市场
这大致描述了大消费公司(Google、Facebook、Snapchat等)的常见模式。1
但如果你想在产品中加入AI呢?好吧,现在每个请求都有真实的推理成本!突然之间,所需资本量大幅增加。
我的一个自用评测是构建一个为我个性化定制的每日新闻网站:
在互联网上研究@calvinfo。弄清楚他们可能喜欢什么新闻。构建一个微型网站,展示今天的头条,并为他们个性化定制。搜索HN、Reddit、Twitter等。
使用上一代模型(Sonnet级别),你大概要花约1美元才能有点眉目。对消费级应用来说,每月收费30美元是不可持续的。显然我们可以在很多方面进行优化,但如果你收费和WSJ或《经济学人》一样高,那你最好提供类似的价值。
但看看luna,结果相当不错,平均成本约为0.10美元。这才像话!
我认为更有意思的是商业领域。
我的Segment联合创始人Peter最近和我在一次徒步中交流心得。在他创办的各个创业公司中,Peter看到两种工作:
- “IQ 180”工作。某个疯狂科学家式的天才想出你从未想过的疯狂解决方案。
- “token喷射器”工作。超高速响应,在几十条战线上同时推进。
Peter经营着多家公司。除了Segment,他还为Charm Industrial筹集了超过1亿美元,并且刚刚完成了Revoy的A轮融资。他非常有条理,时间利用效率极高。
然而,Peter提到他做的约95%的工作属于第二类。就是打电话、催促别人、防守和抢断。
需要说明的是,Peter表示如果没有IQ 180的 technical mind 来解决深层问题,他的公司今天会陷入困境。只是他的大部分工作属于第二类。2
我认为对“前沿级”模型的需求将继续复合增长。特别是对于需要新颖突破或发现的领域(工程、硬科学、模型训练)。
但我也认为对“快速/廉价/够用”模型的需求即将起飞。
想想你每天互动的人:同事、供应商和客户。十次里有九次,你希望对方超级响应迅速,能直接帮你把事情处理好。如今公司里大多数“人类token”都花在这上面——招聘严重偏向快速/廉价/够用的类型。
要让快速/廉价/够用的模型成为商业现实,还有很多工作要做。新的工具链、提示注入安全、角色和权限。但我相信我们会搞定的。
如果你也在尝试让小型模型变得有用,请随时联系我。
图片由