ESC
AI 1 分钟阅读

Andrej Karpathy:对LLM能力的认知鸿沟正在扩大

OpenAI创始成员、前Tesla AI总监Andrej Karpathy发帖称,社会对LLM能力的认知差距正急剧扩大:约75%的人几乎未接触过LLM,约20%是免费版轻度用户,约2000万开发者亲眼见证agent一键完成数周的工作量,而仅约5000名能访问内部前沿系统的人,已在见证数千agent集群协作完成软件超级工程,人类审阅能力开始掉队。

来源:Hacker News

翻出今年4月的这条旧推,因为对LLM能力的共同认知差距正在扩大。现在的局面已经不那么是“两群人各说各话”,而更像一个陡峭的漏斗。

  • 粗略估算,约60亿人(约75%的人口)几乎从未真正接触过LLM。
  • 约10-20亿人(约20%)是免费版ChatGPT类产品的轻度、低频用户。这个群体看到的是傻乎乎的聊天机器人,把它们当成更好用的Google搜索、写作助手之类,或许还有agent帮你订机票。我有一些非技术圈的朋友(在我看来不无道理地)表示根本用不上这东西。甚至许多数学与代码领域之外的专业人士也属于这一层。比如高管和许多其他职能的人,大量时间都花在与人沟通上,所以尽管理智上明白正在发生什么,那终究是二手的、有些抽象的体验。
  • 再往上是数学与代码领域对前沿级LLM的专业使用。约2000万人(0.2%)亲眼看到:过去要花数周甚至数月的大型复杂项目,如今一个prompt就能交给agent完成。构建应用、复刻应用、移植应用、从二进制反编译应用……这一切发生得非常快也非常近——不到一年前,我还在徒手写代码,一个字符一个字符地把背下来的命令敲进代码编辑器,偶尔按一下Tab自动补全一小段。
  • 最后是约5000人(约0.00006%),他们能在内部访问前沿级系统。外部世界看到的只是预览:那看起来像是数千个agent组成的集群,在数周内协作完成软件超级工程:挖掘zero-day漏洞、以机器速度展开网络攻防、发现新科学、推进数学前沿——这些本该是业内顶尖专家数年才能完成的工作。与此同时,人类的审查与理解力已开始掉队。例如,人们至今仍在为几个月前的OpenAI-HF事件做“考古”;数学家们恐怕还得花上一阵子啃那722篇前沿数学论文。

这个漏斗由多重因素共同驱动:

  1. 影响力随雄心、问题规模和时间跨度放大。一个只需一段话回答的问题几乎给系统造不成压力,你需要一座由你真正在乎的大型难题组成的矿藏。这一因素驱动了漏斗的消费者/专业维度。
  2. 系统的“锯齿状”不均衡性(这一点我单独写过很多)。能力峰值出现在数字化、可验证、有经济价值的领域,因为LLM能力源自以营收潜力为导向的精选环境组合上、基于可验证奖励的强化学习。这一因素主要塑造漏斗的领域(如数学与代码)维度。
  3. 访问权限:免费档、付费档、内部档。

所以,这就是此刻的诡异之处:普通大众大多还没接触过这些系统,接触时看到的也只是个傻乎乎的聊天机器人;大多数专业人士仍只感到温和的提升;而一小撮专业人士正在体验曲线垂直攀升带来的眩晕。而这一切,正在同时发生。

【附:被引用的4月9日原推文】 从我的时间线看,人们对AI能力的理解差距正不断扩大。

我认为第一个问题出在使用时点的先后和使用档位。很多人是去年某个时候试用了免费版ChatGPT,就让这种体验过度塑造了对AI的看法。这个群体的反应多是嘲笑模型的种种怪癖、幻觉等。是的,我也看过那些疯传的视频:OpenAI的Advanced Voice模式连“我该开车还是走路去洗车店”这种简单问题都应付不来。但关键在于,这些免费、老旧/已弃用的模型完全代表不了今年最新一批最先进的agentic模型的能力,尤其是OpenAI Codex和Claude Code。

但这就引出第二个问题:即使有人每月付200美元用上最先进的模型,其能力在高度技术性领域也相当“偏科”。搜索、写作、建议等典型用例并非能力进步最显著、最惊人的领域。部分原因是强化学习的技术细节和对可验证奖励的依赖;另一部分原因是,这些用例在公司攀爬能力曲线时未被充分优先,因为它们带不来那么多$$$价值。金矿在别处,重心自然随之而去。

于是有了第二群人,他们同时满足两点:1)付费使用最先进的前沿agentic模型(OpenAI Codex / Claude Code);2)在编程、数学、研究等技术领域专业地使用。这群人受“AI精神病”冲击最重,因为今年这些领域的进步已只能用瞠目结舌形容。当你把终端交给这类模型,可以亲眼看着它们“融化”掉通常需要几天/几周才能完成的编程难题。正是这第二群人,对这些能力、能力曲线的斜率以及各种网络安全层面的后果,赋予了远为沉重的分量。

TLDR:这两群人完全是在自说自话。现实就是同时成立:OpenAI那个免费、而且我觉得有点被弃养(?)的“Advanced Voice Mode”会搞砸你Instagram reels里最蠢的问题,与此同时,OpenAI最高档付费的Codex模型能独自跑上1小时,连贯地重构整个代码库,或找到并利用计算机系统的漏洞。这一部分之所以真实有效、进步惊人,靠的是两个特性:1)这些领域拥有明确且可验证的奖励函数,天然适合强化学习训练(比如单元测试通过与否,不像写作那样难以显式评判);2)它们在B2B场景里价值高得多,团队里最大的一块人力自然聚焦于此。于是,我们就走到了今天。