AI 训练时 GPU 之间要频繁同步参数,网络带宽与稳定性直接决定集群规模扩得上去还是空转等待。按传统通算集群的思路组网往往满足不了需求。本文梳理训练集群网络的关键设计点。

认识 AI 流量的两股水流

第一股是计算节点之间的集合通信流量:突发、同步性强、对时延与丢包极其敏感,任何一条慢链路都会拖住整个组;第二股是数据集从存储流向计算节点的读取流量:持续、吞吐大、对时延相对宽容。两股流量应物理或逻辑隔离,否则数据读取的长流会挤占参数同步的短突发。

接入层设计

汇聚与无损保障

参数网的汇聚用 Spine-Leaf 提供无阻塞转发,并端到端启用 ECN 与 PFC 无损机制;集群扩容时保持参数网全网同速率,避免新旧设备混速形成短板。存储网可独立组网,按 100G 模块加 LC-LC单模双芯跳线 规划长距链路。

AI 网络设计的核心是全局均衡而非单点堆料。EB-LINK 可批量供应高速模块与网卡并按设备品牌写码,集群链路选型可打 0755-83179002 沟通。