斯坦福大学教授、《A Philosophy of Software Design》作者John Ousterhout将我们的目光引向AI网络工作负载的演变,以及TCP、RDMA等传统协议为何正在成为现代数据中心环境的瓶颈!
工作负载的转变
历史背景:过去AI流量以大规模、长时间运行的数据传输为主(数GB的梯度数据),吞吐量是首要指标(2:19-2:42)。 现代AI:如今的工作负载,尤其是推理和Agent应用,依赖频繁的小型协调消息(如KV cache查询、屏障同步)。这些小消息对延迟极为敏感(3:09-4:02)。 瓶颈所在:当小型同步消息与大规模流量混合时,它们会被困在队列中(由incast引发),显著推高99分位(尾部)延迟,导致GPU闲置,浪费昂贵的计算资源(4:24-5:34)。
传统协议为何力不从心
发送端驱动的拥塞控制:TCP和RDMA依赖发送端通过丢包或交换机的延迟信号来检测拥塞。这一过程本质上是被动响应且会产生震荡,导致性能不稳定(7:10-9:58)。 字节流模型:这些协议将数据视为不透明的字节流而非离散消息,难以对短小而关键的任务进行优先级调度(10:05-11:05)。
Homa解决方案
John介绍了Homa,一个为数据中心从零设计的全新传输协议(11:15-12:15): 基于消息:与字节流不同,Homa理解消息边界,能够预测流量并使用最短剩余处理时间(SRPT)算法为短消息设置优先级(12:22-13:28)。 接收端驱动:接收端通过向发送端发放许可来控制流量,在拥塞发生前就在交换机处予以管控(13:30-14:58)。 优先级队列:Homa利用现代交换机中已有的多个硬件队列,让低延迟短消息绕过排队的长流量(14:59-15:51)。 性能结果:基准测试显示,与TCP相比,Homa可将短消息的尾延迟降低10倍以上,同时改善大消息的性能(15:52-17:27)。
演讲者信息:
时间轴: 0:00 - 为什么延迟正成为最重要的指标 2:19 - 旧工作负载:数GB数据与吞吐量 3:09 - 新工作负载:元数据与协调 4:24 - 一次缓慢的交换如何拖停所有GPU 6:07 - Incast以及队列真正形成的位置 7:10 - 为什么拥塞控制放在了错误的一端 10:05 - 字节流没有消息边界 11:08 - Homa:从零开始的重新设计 12:12 - 消息,而非字节流 13:30 - 由接收端控制拥塞 14:59 - 利用交换机中已有的优先级队列 15:52 - 与TCP的基准对比