解析NVIDIA Spectrum-X以太网的独特架构原则

AI 生成摘要

Spectrum-X 以太网协同设计高性能交换机和 SuperNIC,为十亿瓦级 AI 工厂提供可预测的低延迟和高网络利用率。

传统以太网无法处理 AI 工作负载,因为静态 ECMP 路由会导致哈希冲突和掉队,有损网络会造成数据包丢失,低效的拥塞控制难以处理 AI 同步的突发流量。

Spectrum-X 以太网实现了三层硬件加速:基于交换机的动态路由使用最低拥塞的端口进行数据包转发、优化的拥塞控制在 RTT 时间尺度上进行响应,以及基于网卡的平面负载均衡(PLB)在多个独立网络平面上动态分发流量。

Spectrum-X 多平面技术将单个主机的带宽分解,连接到多个物理上独立的两层胖树平面,从而实现多达 128,000 个端点的扩展能力,避免传统多层拓扑带来的延迟和抖动。

硬件加速的平面负载均衡(PLB)保持每个平面独立的拥塞状态和本地队列深度,以隔离故障,可在 2.68 毫秒内实现故障恢复,远低于传统以太网的 1.08 秒恢复时间。

在 10% 的网络链路故障场景中,测试显示 Spectrum-X 以太网带宽按比例降低了 11%,尾延迟仅增加 7%,而使用传统以太网带宽则降低至 50% 甚至更低。

后续步骤

阅读高速网络助力十亿瓦级 AI 工厂白皮书详细的架构分析和评估结果。

生成式 AI 的迅猛发展从根本上改变了数据中心的设计。随着分布式模型训练的规模扩展到数十万个 GPU,连接这些节点的横向扩展网络已成为决定性的性能瓶颈。

几十年来,传统的通用以太网一直是企业和云网络的毋庸置疑的王者。它在处理通用、高熵的互联网流量方面实现了成本低廉、标准化且非常有效。然而,当传统以太网用于处理 AI 架构所需的大规模、高度同步的通信模式时,它遇到了难以逾越的物理墙。

为了弥合这一差距,NVIDIA 推出了 Spectrum-X 以太网。这是一种硬件加速的网络架构,专为十亿瓦级 AI 工厂设计。有别于传统以太网依赖数十年来积累的路由和拥塞控制范式,Spectrum-X 以太网协同设计了高性能交换机和主机侧网卡 (NIC),可在极端负载和压力下提供可预测的低延迟、高网络利用率和强大的弹性。

本文将探讨传统以太网在应对 AI 工作负载时面临的结构性限制,解析 Spectrum-X 以太网的独特架构原则,并介绍 Spectrum-X 多平面技术如何最大限度地提高对分带宽并加速 AI 时代。

碰撞课程:传统以太网面对 AI 工作负载的局限性

标准数据中心流量的墒值很高,数百万独立的小型流量会向不同的方向传输。等价多路径 (ECMP) 路由算法使用静态流哈希将流量分散在并行路径上,通常能实现均衡的利用率。

AI 训练流量具有低墒特性。GPU 通过 All-Reduce、All-Gather 和 All-to-All 等集合通信持续同步,从而产生了数量少但是数据量巨大的同步流。这暴露了传统以太网的几个限制:

哈希冲突和掉队:ECMP 并未考虑实时拥塞,可能发生几个大型流哈希到某个链路上聚集碰撞,而其他链路则相对带宽空闲的情况。由于同步集合操作仅在最后一个流完成时才结束,因此一条拥塞的路径可能会导致集合操作整体延迟,从而使许多 GPU 处于空闲等待状态。

有损与无损网络:拥塞会造成交换机缓冲区溢出,并引发丢包和重传,从而导致延迟,显著损害 AI 性能。RoCEv2 部署通常使用优先级流控 (PFC) 来减少丢包,但暂停帧会扩大拥塞,造成头阻塞,并可能导致网络中断。

缓慢的拥塞控制:数据中心量化拥塞通知 (DCQCN) 等协议难以针对同步 AI 突发流进行调整。延迟反应或过度反应会导致缓冲区积聚、利用率不足和延迟陡增等。

近乎完美的多租户隔离:在传统以太网上,来自一个作业的“邻居噪声”流量可能会流入另一个作业,导致 All-to-All 集合通信的带宽崩溃 80% 以上。使用 DeepSeek-V3 LLM 训练测试证明了这种隔离故障的影响。独立运行时,使用标准以太网实现了 735 毫秒的训练步长时间。然而,在引入背景“噪声”流量时,使用相同以太网的步长时间增加到 1.18 秒 (速度减慢了 1.6 倍)。Spectrum-X 以太网通过隔离每个平面的独立拥塞并对热点实现动态路由,在独立运行和高度拥塞的多租户条件下运行均保持了 668 毫秒的稳定训练步长时间,几乎没有任何性能下降。

wKgZO2qjdHKAV9VMAAGnTX-8XYo413.png

图 1. RDMA 噪声流量下的 DeepSeek-V3 训练步长时间

解构 Spectrum-X 以太网:三个互相联动的控制回路

在 800Gbps 及以上的速度下,传播延迟仍然受光速的影响而固定不变,但带宽冲突引入的延迟累积影响很大。为了避免队列积聚和数据包丢失,网络必须在微秒级时间尺度上实时响应拥塞。

由于基于软件的控制路径无法在如此紧凑的时间窗口内做出反应,Spectrum-X 以太网将实现完整的硬件加速作为核心架构要求。Spectrum-X 以太网的基本设计原则是按范围、信号和责任划分硬件加速的控制回路。通过将网络控制分解为三个不同的非干扰回路,Spectrum-X 以太网可在自然时间尺度内解决拥塞问题,避免产生破坏网络稳定的反馈回路。

基于交换机的动态路由

与传统以太网基于哈希的静态 ECMP 路由不同,Spectrum-X 以太网交换机可实现逐包动态路由 (AR)。交换机利用量化硬件近似 Join-Shortest-Queue (JSQ) 算法,以亚微秒的间隔对 ECMP 组中每个出端口的队列深度进行采样。当数据包到达时,交换机会动态地将其引导到拥塞最少的物理端口。这种无状态、与流无关的机制会在数百纳秒内对瞬变局部失衡做出反应,从而保持交换机队列较小,并防止出现局部热点。

定向拥塞控制

虽然 AR 均衡了网络路径带宽利用率,但它无法解决端点 incast 问题,即多个发送者同时向单个接收者传输数据,使接收侧出端口饱和的场景。为此,Spectrum-X 以太网实现了先进的硬件加速拥塞控制 (CC) 机制。

重要的是,Spectrum-X 以太网协同设计了交换机和 SuperNIC 响应:交换机只需要在动态路由容量耗尽且队列深度持续增长时生成显式拥塞通知 (ECN) 标记。发送端网卡利用精确的 RTT 探测信息与 ECN 标志,在 RTT 时间尺度上调整发送速率。这既可以防止网络对短暂的微爆发 ( AR 很容易对其平衡) 反应过度,又在真正发生端点级拥塞时提供快速、精确的速率控制。

基于网卡的平面负载均衡(PLB)

在主机侧运行的平面负载均衡 (PLB) 是 Spectrum-X 以太网 SuperNIC (例如 NVIDIA ConnectX) 内部的专用硬件引擎。PLB 结合本地队列反馈和端到端、平面独立拥塞遥测信息,在多个网络平面上动态分发数据包。本文稍后会详细讨论这种机制。

揭秘多平面拓扑和 Spectrum-X 多平面技术

为了将 AI 工厂扩展到数十万个 GPU,传统的网络架构需要添加额外的层级 (例如,从 2 层胖树到 3 层胖树拓扑)。但是,添加层级存在很多问题:这会增加延迟、带来抖动、引入负载不平衡,并大幅提高光模块、布线和电力的成本。

为了解决扩展挑战,现代 AI 数据中心引入了多平面拓扑。相较于传统拓扑构建单个大型多层网络,多平面是将单个主机的网络带宽 (例如,8 通道 ConnectX SuperNIC 800 Gbps) 分解为多个低速、物理上独立的网络平面 (例如,四个独立的 200 Gbps 平面),每个平面都是高效的浅层胖树。

为了将主机连接到这些平面,在主机侧需要使用 shuffle-box 无源光学设备或主干线缆。这些设备将光纤从每个多端口网卡路由到所有独立的平面,在主机边缘侧构造出路径多样性,同时保证完整的网卡到网卡可访问性。这样通过简单的两层拓扑就能够扩展到超过 128,000 个端点,使用三层拓扑则可扩展至多达 1,600 万个端点,避免传统多层网络拓扑带来的延迟和抖动瓶颈。

数据包盲喷洒的缺陷

虽然多平面拓扑提供了大量的理论带宽,但只有在所有平面的流量完全平衡的情况下,它才效率最大化。一些标准架构试图通过盲喷洒来解决这一问题,即数据包按顺序平均分发在传输层的所有平面上,但是对各个平面的实际状况没有任何可见性。

这种方法不适用现实世界。对于十亿瓦级系统,物理故障、光连接器性能下降和光纤链路闪断等时常发生。如果平面 2 中的某个光纤链路发生性能下降或闪断,该平面的传输能力就会下降。由于盲喷洒无法感知这种不对称性,因此会继续将同等数量的流量分发到损坏的平面上,因此,单个变慢、性能下降的平面就会变成整体性能的瓶颈,并且单个局部链路闪断的爆炸半径被放大,影响整个多平面集群的性能。

解决方案:Spectrum-X 多平面技术

为了释放多平面架构的真正潜力,Spectrum-X 多平面技术直接在 SuperNIC 芯片中实现了硬件加速的平面负载均衡器 (PLB)。平面负载均衡器使多平面架构对应用层完全透明;操作系统和集合通信库只看到单个统一的 RoCE 设备。所有流量分发、负载均衡和故障转移完全在 Spectrum-X 以太网硬件中处理。

图 2. NVIDIA 硬件加速的 Spectrum-X 以太网多平面拓扑图

与 Spectrum-X 以太网交换机配合使用,PLB 会针对每个传输的数据包,通过独特的、有状态的两阶段分层选择流程进行操作:

端到端拥塞过滤:对于每个目标 GPU,SuperNIC 都会维护独立、有状态的拥塞控制上下文;每个物理平面一个上下文。每个上下文都独立监控 RTT 探测信息并处理拥塞通知数据包 (CNP) ,以计算其特定平面的实时速率允许量。在发送数据包之前,SuperNIC 会将所需的传输速率与每个平面的允许带宽进行比较。任何端到端拥塞或链路故障的平面都会暂时从健康组中过滤掉。

本地队列选择:SuperNIC 硬件从健康、不拥塞的平面中选择本地出口队列最浅的平面。这反映了交换机在主机侧的动态路由机制。

通过分离每个平面的 CC 状态并将其与本地出口队列深度相结合,Spectrum-X 以太网可隔离拥塞平面的影响。如果 Plane 2 发生链路故障,Connect-X SuperNIC 会立即检测到 RTT 超时,从健康组中标记 Plane 2,在 3 毫秒内透明地将所有流量重定向到其余三个正常的平面上,从而保留 75% 的线速带宽。

现实世界的影响:弹性、隔离和 AI 时间

为了验证这些架构设计,NVIDIA 和研究人员在生产级集群和高保真仿真中严格评估了 Spectrum-X 以太网。结果表明,在高利用率、故障场景和多租户环境下,Spectrum-X 以太网与传统的以太网形成了鲜明的对比:

多平面弹性:例如,在 8 平面网络中,当其中一个平面发生 20% 的局部交换机到交换机连接故障时,传统的以太网多平面网络会立即形成性能瓶颈,由于它依赖于盲喷洒负载均衡,降速平面造成所有平面的性能崩溃,将整个网络的性能都降到了 80%。相比之下,Spectrum-X 多平面使用其有状态 PLB 动态地绕过局部瓶颈,保障其余七个正常的平面仍然以 100% 的速率运行,而只有降速的平面以 80% 的速率运行。Spectrum-X 多平面利用所有可用的正常带宽,而不是一起降低到最低速度,相比而言,可在发生故障时将整体 All-to-All 集合带宽性能提高 1.2 倍,从而保障大规模 AI 训练作业所需的流畅、最大化带宽性能。

图 3. 多平面弹性:在链路故障场景,Spectrum-X 多平面可提供高达 1.2 倍的 All-to-All 性能

可预测的高利用率:在 RDMA 对分基准测试的最坏场景,传统以太网使用静态 ECMP 路由算法可能触发哈希冲突而崩溃,一些 GPU 之间的吞吐量甚至下降到 25 Gbps。Spectrum-X 以太网使用 AR 和 PLB 提供紧密且可预测的带宽分配,在所有 GPU 之间保持 98% 的带宽性能。此外,传统以太网呈现高延迟抖动,其 99% (P99) 尾延迟高达 22 微秒,而 Spectrum-X 以太网可在 75% 的网络负载下保持较低的 P99 尾延迟,仅 8 到 9 微秒。

图 4. 高负载下性能:与传统以太网相比,Spectrum-X 以太网在高负载下表现出稳定的性能

无缝的故障弹性迁移:当主机到叶交换机之间的链路发生闪断时,传统以太网基于软件的负载均衡需要超过 1.08 秒的时间来恢复和重新路由流量。这会导致大量通信停顿,从而冻结 GPU 集合运算。相比而言,Spectrum-X 以太网的硬件加速 PLB 可快速检测到故障并在 2.68 毫秒内完成故障转移。这是 400 倍的加速,可以透明地吸收瞬时故障,而不会中断正在进行的 LLM 训练。

wKgZO2qjdMGAdHMIAAE0SsvIbuY248.png

图 5. Spectrum-X 硬件 PLB 与基于软件的负载均衡在单链路闪断场景恢复时间对比

最后要考虑的是,链路故障是不可避免的,但其对性能的影响应与物理链路的损失成正比。实现这一目标并不容易,因为路径中的多个故障会严重降低许多源-目标对之间的连接性能。

传统以太网在线缆故障和链路闪断时会造成非线性比例的性能降低;由于路由不对称,叶交换机的上行链路发生 10% 的掉线可能会导致总带宽崩溃 50% 或更多。Spectrum-X 以太网实现了严格按比例的带宽下降,在发生 10% 的网络链路故障情况时,Spectrum-X 以太网可保持近乎理想的性能,带宽按比例降低了 11%,尾延迟仅增加 7%。

这种强大的弹性可确保用户即使在物理基础设施问题没有解决之前,也能以近乎最佳的效率继续运行训练工作负载,从而大幅缩短“AI 时间”。

AI 工厂蓝图

从通用云计算到十亿瓦级生成式 AI 的转变代表着对网络需求的根本性转变。传统的通用以太网基于高流量、静态路由和软件控制的拥塞的需求假设而构建,从根本上难以满足同步 AI 集群的微秒级零抖动需求。

Spectrum-X 以太网重塑了网络规则手册。Spectrum-X 以太网通过网络内的动态路由、传输层的定向拥塞控制和主机侧的 PLB,以及对关键控制回路进行分解和硬件加速,提供可预测、稳定和超低延迟的性能,满足十亿瓦级 AI 的需求。此外,Spectrum-X 多平面技术提供了一个稳健、高弹性和操作可见的网络架构,可简化集群扩展,保护多租户工作负载,并更大限度地缩短“AI 时间”。对于任何构建 AI 工厂的组织而言,Spectrum-X 以太网不仅仅是一种性能优化,更是一种架构需求。

关于作者

Scot Schultz 是 HPC 技术专家,专注于人工智能机器学习系统。 Scot 在分布式计算、操作系统、人工智能框架、高速互连和处理器技术方面拥有广泛的知识。在他的整个职业生涯中,拥有超过 25 年的高性能计算系统经验,他的职责包括各种工程和领导角色,包括战略 HPC 技术生态系统支持。 Scot 在众多行业标准组织的成长和发展中发挥了重要作用。

  • 随机文章
  • 热门文章

您可以还会对下面的文章感兴趣:

暂无相关文章