新闻
用于分类 GPU 推理的拓扑感知数据移动
1 分钟阅读
来源:arXiv ML
arXiv:2607.28633v1 公告类型:新 摘要:分类 LLM 推理会造成数据中心网络问题,现有系统无法正确解决该问题。当预填充和解码在不同的 GPU 池上运行时,必须在它们之间传输 KV 缓存。对于 70B 型号,每个请求为 2.6 GB,在生产规模上超过 100 GB/s 聚合。然而,DistServe、Splitwise 和 Mooncake 都使用统一的 RDMA,忽略了两个 GPU 之间的带宽根据其物理关系变化了 72 倍:域内通过 NVLink 实现 900 GB/s,跨节点通过 InfiniBand 实现 50 GB/s,跨数据中心通过 TCP 实现 12.5 GB/s。我们设计了一个拓扑感知的传输协调器,可以发现互连