我们在欧洲打造这些技术,在这里,“端侧运行”是主权默认选项。数据永远不会离开用户之手,功能永远不会依赖他人的云,而从未上传过的东西,也永远不可能被强制索取。
五年来,我们一直以端侧优先的方式打造视频应用 Detail。但当我们推出 Auto Edit(自动剪辑短视频)或播客音频增强等功能时,不得不退而求其次使用云端 API。而随着 Detail 人气的增长,我们的基础设施账单也水涨船高。
每隔几个月,我就会去搜寻有用的端侧模型。我会在 Hugging Face 上翻找能识别填充词或清理录音的模型。每年六月,我们都会迎来很棒的新构建工具,但整个行业的进展还是不够快。基础其实已经具备:芯片、Core ML、相关研究。缺的是从这些基础到真正在应用中实现功能之间的一切:一个可以直接嵌入、几行代码就能上线的模型。
于是,我们决定自己训练模型。事实证明,训练模型本质上是一个产品设计挑战,而产品正是我们的专长。我们设计的模型和本地推理方案在速度、质量和成本上都胜过云服务,在具体任务上的表现也优于其他本地和云端模型,而体积只有它们的一小部分。
我们用 Clear 替代 Dolby,实现了更好、更快的音频增强;用 Voz 把端侧转录速度提升了5倍。我们还用 Clips 替代了 Claude Sonnet——这个 284MB 的模型能在5秒内把一段10分钟的视频变成十几个片段,比 Sonnet 快10倍、能耗低470倍,而质量不相上下。
即将随 iOS 27 一同发布的 Detail 6,将用我们自己的模型取代所有云端 API,完全在设备上运行。
过去几年,我们都把 LLM 当作又一种普通 API 来构建产品。在围绕“通用前沿大脑”的喧嚣炒作中,我们几乎忘了它们并非唯一的选择。
我交谈过的每一位开发者,都有一份“如果成本不是问题就想去构建的端侧模型”愿望清单,或者某个正让他们大量烧 token 的功能——只要能换成本地模型,他们都乐于接受。每天以同样方式运行十万次的调用:清理录音、给照片打标签、从句子中提取日期、在文本到达你的服务器之前捕捉人名。这些都不需要前沿大模型。
NVIDIA 自家的研究人员拆解了三个 agent 系统,估计其中 40% 到 70% 对大型模型的调用,其实可以交给小型专用模型来完成。
今年,整个行业将在数据中心上投入约 4500 亿美元。与此同时,全球每年出货超过十亿部搭载日益强大芯片的手机、平板和笔记本,它们非常适合这类任务。人们手中的算力,已经超过地球上所有 AI 数据中心的总和。
免费的推理给了我们不公平的优势。没有按次计费的成本,功能可以在每一条消息上运行,而不只是你检查得起的那几条。没有网络往返,客户的数据也永远不会离开设备。当推理不花一分钱,我们构建产品的方式将彻底改变。
要用本地模型开发,开发者体验必须大幅提升。你需要可商用的模型,在你的任务上比其他方案更快、更准,能几行代码就嵌入你的应用,并且容易被发现。
不妨把最初的这一百个模型想象成小脑。小脑负责那些持续运转的工作——平衡、节奏、那些你从不刻意去想的技能,从而让大脑的其他部分可以自由思考。这就是我们首先要构建的:快速、专用的模型,承担那些全天候运行的工作,在设备上、免费完成。
然后是大脑皮层——决定由哪个模型来作答的那一层。优先用小型本地模型,任务需要时用更大的模型,只有当工作必须离开设备时才动用云端。随着开放研究不断推进、设备芯片日益强大,本地模型也会不断成长,我们将自己训练更大的模型。前沿智能,从小处开始构筑。