SXM与PCIe GPU性能对比 | AI生成和翻译

首页 2026.07

问题:为什么SXM外形的GPU(H100/H200/MI300X SXM)比PCIe版本更好?

答案:

1. 互联带宽 —— 关键因素

对于采用张量/流水线并行的训练,all-reduce和all-to-all操作主导了步进时间。900 GB/s的全互联与约64 GB/s的PCIe路由相比,差距巨大——这决定了GPU是真正作为一个大型加速器工作,还是8个独立岛屿被一条同时服务主机DMA的总线所瓶颈。

2. 供电能力

3. 拓扑 / 扩展性

4. 对您工作负载的实际影响

对于您在MI300X上进行的GPT-2 760M训练——如果使用OAM/SXM MI300X(8 GPU UBB),梯度同步的all-reduce开销扩展性远优于PCIe MI300X。在小模型规模(760M)下影响较小,因为计算/通信比有利;但一旦扩展到您每月训练20亿 token、更大架构的模型时,互联将首先成为瓶颈,而非FLOPs。

经验法则: PCIe适用于推理/单GPU/小型微调。一旦进行多GPU预训练且使用张量并行,SXM就是必须的,因为通信密集型操作(all-reduce、all-to-all)正是PCIe显卡性能急剧下降的地方。

参考资料:


AI生成和翻译,但整理分享仍需精力。如果觉得有帮助,欢迎 捐助支持。 微信:@lzwjavaWeChat QR · X: @lzwjava · 打个招呼 👋

返回 捐助