ESC
AI 1 分钟阅读

AMD收购Taalas,将模型蚀刻进硅片以大幅提升推理性能

AMD宣布收购AI芯片初创公司Taalas,其技术可将AI模型权重直接蚀刻到硅片中,每颗芯片支持200亿参数,仅需50颗加速器即可运行万亿参数模型,推理速度可达每秒17000 tokens,且功耗和成本大幅降低。但模型固定后更新需重新流片,主要适用于模型开发商和大型推理服务商。AMD计划将Taalas技术与其Instinct GPU结合,可能对Nvidia构成挑战。

来源:Hacker News

每颗芯片承载200亿参数,意味着仅需50个加速器即可支持万亿参数模型,而AMD恰好拥有机架级计算平台和内部系统设计团队,可以轻松容纳这一规模。

相比Nvidia最近发布的LPX系统,这要节省更多空间和功耗——后者需要数十块GPU和至少2,000个Groq LPU才能服务同样的模型。

据我们了解,AMD计划将基于Instinct的Helios机架与基于Taalas技术的芯片搭配,这暗示了一种解耦架构:计算密集的提示处理在GPU上完成,而token生成则卸载到基于Taalas的加速器上。

另一种可能是,AMD采用类似“嘀-嗒”的节奏:客户先在Instinct加速器上部署和验证模型,满意后再迁移到Taalas加速器。我们目前只能猜测,但AMD AI高级副总裁Vamsi Boppana在一份事先准备好的声明中表示:

“AMD正在构建一个全栈AI平台,让客户能够灵活地为每个AI工作负载部署合适的计算解决方案。”

尽管该技术速度极快,但你可能已经注意到,它有一个相当大的缺点:一旦芯片部署完成,模型就被固定了。任何超出LoRA适配器级别的改动都需要重新流片,这不仅昂贵而且耗时。

在AI热潮将近四年之际,新模型几乎每月都在推出。为了从Taalas技术中获益,AMD的客户必须对自己选择的模型非常确定——这对某些客户来说比其他人更容易。

不过,如果这家初创公司所言属实,情况并不像听起来那么糟糕。虽然新模型需要重新流片,但不必从头再来。只需更换两层金属层即可,这要便宜得多,也省时得多。

话虽如此,我们强烈怀疑这项技术将主要由AI模型开发商、其基础设施提供商以及少数推理服务提供商部署。今年2月,Taalas在接受我们的姊妹站点The Next Platform采访时表示,将模型权重蚀刻到硅片中的成本比训练前沿模型便宜100倍。

AMD当然有能力进行这些交易。OpenAI、Anthropic和Meta都是Instinct的重大客户。鉴于模型公司与芯片设计商之间的紧密合作关系,看到GPT或Claude部署在Taalas和Instinct加速器的组合上也不足为奇。

该技术对模型开发也有影响。开发者减少幻觉的方法之一是用时间换取准确性。这种被称为“测试时扩展”的技术在实践中很简单,就是让模型在响应前“思考”更长时间。

测试时扩展的一个缺点是消耗的token明显更多,这使其成本高昂,而且用户需要等待更长时间才能得到聊天机器人、代码助手或智能体的回复。如果AMD收购Taalas能将每token成本降低,并将输出速度提升10倍或20倍,模型开发者可能会选择进一步延长推理时间。

无论如何,我们可能不必等太久就能看到Taalas如何融入AMD的更宏大愿景。该交易尚需监管批准,预计将在第四季度完成。®