CuteNote
颜值笔记
价格
反馈
中 / EN
登录
中 / EN
登录
← 返回
生成耗时 35秒
耗时
查看原链接
原链接
导出脑图
导出
Bilibili
2小时17分11秒 · —
AI通信系统架构总结
长图
脑图
Markdown
原文
AI 问答
AI通信:从单GPU到集群的状态与控
制
核心结论
通信的核心是管理producer
到consumer的数据依赖,涉
及交付、放置、完成、可见性和顺序
,状态与控制责任的划分决定性能与
成本。
核心概念与关键问题
通信的本质
将producer-consu
mer依赖转化为可验证、推进、
恢复的契约
确保数据在正确时间到达正确计算
单元
五个关键语义
delivery:数据是否到达
端点
placement:是否正确写
入目标地址
completion:各阶段任
务是否结束
visibility:cons
umer能否观察到数据
ordering:内存序和依赖
关系
同步到异步的演进
数据搬运从programmer
-managed到hardwa
re-managed
异步操作需要细粒度同步机制
节点内通信与数据搬运
Tensor Core演进
Volta:地址自算,显式拷贝
Ampere:copy.asy
nc,减少寄存器占用
Hopper:TMA硬件搬运,
异步
Blackwell:TMem内
存层级,重构数据流边界
Pipeline与排序
通过pipeline隐藏数据搬
运延迟
代码排序影响可见性,需手动保证
ordering
内存模型设计是核心
节点内路径
寄存器、shared memo
ry、L2、HBM
数据流必须经过这些层级
节点间通信与互联架构
互联硬件
NVLink、C2C、PCIe
、RDMA、交换机
NVSwitch用于多GPU互
联
不同服务器类型(DGX、Gra
ce Blackwell等)
拓扑结构
DGX:8卡通过4个NVSwi
tch
NV72:三层扁平NVSwit
ch
TPU:3D torus互联
路径差异影响通信性能
路径选择
最佳:fabric direc
t(NVLink等)
次优:PCIe路径
最差:经过host memor
y拷贝
通信的状态与控制责任
状态由谁维护
delivery:link/t
ransport
placement:DMA
completion:NIC发
布CQE
visibility:内存系统
ordering:kernel
中的acquire操作
RC RDMA流程示例
发送方提交WQE,接收方NIC
写入数据
需检查ready signal
和acquire flag
区分payload、控制信息和
完成通知
软件 vs 硬件分工
硬件实现:低延迟但绑定期权
软件实现:灵活但CPU开销高
状态上移或下沉的权衡
工业界大规模通信实践
OpenAI MRC
支持断网情况下训练继续
将故障恢复下沉到transpo
rt层
支持write和write-w
ith-immediate A
PI
Meta大规模通信
优化初始化、QP状态管理、流控
可观测性和故障诊断
NCCL等库的扩展
其他实践
Google TPU的集成交付
NVIDIA的GPUDirec
t等技术
工作负载与优化策略
典型工作负载
collective通信(al
lreduce等)
pipeline并行(PP)的
P2P
MoE的dispatch/co
mbine
KV cache的传输
优化技巧
异步与重叠(communica
tion-computatio
n overlap)
细粒度流水线调度
利用RDMA和GPUDirec
t
减少同步依赖和尾部延迟
通信感知的调度
未来硬件与研究方向
首页
登录
我的