返回
查看原链接原链接
Bilibili2小时17分11秒 · —

AI通信系统架构总结

AI通信:从单GPU到集群的状态与控核心结论通信的核心是管理producer到consumer的数据依赖,涉及交付、放置、完成、可见性和顺序,状态与控制责任的划分决定性能与成本。核心概念与关键问题通信的本质将producer-consumer依赖转化为可验证、推进、恢复的契约确保数据在正确时间到达正确计算单元五个关键语义delivery:数据是否到达端点placement:是否正确写入目标地址completion:各阶段任务是否结束visibility:consumer能否观察到数据ordering:内存序和依赖关系同步到异步的演进数据搬运从programmer-managed到hardware-managed异步操作需要细粒度同步机制节点内通信与数据搬运Tensor Core演进Volta:地址自算,显式拷贝Ampere:copy.async,减少寄存器占用Hopper:TMA硬件搬运,异步Blackwell:TMem内存层级,重构数据流边界Pipeline与排序通过pipeline隐藏数据搬运延迟代码排序影响可见性,需手动保证ordering内存模型设计是核心节点内路径寄存器、shared memory、L2、HBM数据流必须经过这些层级节点间通信与互联架构互联硬件NVLink、C2C、PCIe、RDMA、交换机NVSwitch用于多GPU互不同服务器类型(DGX、Grace Blackwell等)拓扑结构DGX:8卡通过4个NVSwitchNV72:三层扁平NVSwitchTPU:3D torus互联路径差异影响通信性能路径选择最佳:fabric direct(NVLink等)次优:PCIe路径最差:经过host memory拷贝通信的状态与控制责任状态由谁维护delivery:link/transportplacement:DMAcompletion:NIC发布CQEvisibility:内存系统ordering:kernel中的acquire操作RC RDMA流程示例发送方提交WQE,接收方NIC写入数据需检查ready signal和acquire flag区分payload、控制信息和完成通知软件 vs 硬件分工硬件实现:低延迟但绑定期权软件实现:灵活但CPU开销高状态上移或下沉的权衡工业界大规模通信实践OpenAI MRC支持断网情况下训练继续将故障恢复下沉到transport层支持write和write-with-immediate APIMeta大规模通信优化初始化、QP状态管理、流控可观测性和故障诊断NCCL等库的扩展其他实践Google TPU的集成交付NVIDIA的GPUDirect等技术工作负载与优化策略典型工作负载collective通信(allreduce等)pipeline并行(PP)的P2PMoE的dispatch/combineKV cache的传输优化技巧异步与重叠(communication-computation overlap)细粒度流水线调度利用RDMA和GPUDirect减少同步依赖和尾部延迟通信感知的调度未来硬件与研究方向