微软Azure部署AMD Helios机架平台,推出三款AI/HPC虚拟机
内容摘要
核心要点
微软Azure于2026年7月22日宣布将在其数据中心部署AMD Helios机架级AI平台。Helios每机架集成72颗AMD Instinct MI455X GPU,配备31TB HBM4内存,提供最高1.4PB/s聚合带宽。双宽配置下可实现3 AI exaflops的计算性能,预计2026年Q3批量供货。该平台采用第六代EPYC Venice CPU(台积电2nm工艺),并集成Pensando网络DPU及AI NIC,实现高性能网络加速。
同时,微软推出三款Azure虚拟机:ND MI455X v7专为AI推理优化;HDv2面向数据工程,提供近500个Venice核心和4TB RAM;HXv2面向HPC/EDA工作负载,配备176个Venice核心和800Gb InfiniBand连接。这些VM充分利用了Helios平台的硬件能力,为用户提供多样化的计算选择。
Helios平台的部署标志着AMD在AI基础设施领域的重要进展,通过与微软的深度合作,AMD试图在AI训练和推理市场挑战NVIDIA的统治地位。然而,其实际性能表现和生态成熟度仍有待市场验证。
重要性说明
合围NVIDIA,但生态短板明显:AMD通过Helios平台联合微软,试图在AI推理和HPC领域合围NVIDIA。然而,MI455X GPU的软件生态(ROCm)相比NVIDIA CUDA仍显薄弱,用户迁移成本高。微软Azure的部署可能锁定用户到AMD+微软的联合生态,但Pensando DPU和AI NIC的集成增加了供应商锁定风险。
隐性成本陷阱:Helios机架功耗和散热要求极高,72颗MI455X GPU的TDP可能超过100kW,数据中心的电力容量和冷却设施需大幅升级,企业用户可能面临隐性基础设施成本。此外,HBM4内存虽然带宽大,但容量31TB对于大型模型训练可能仍不足,且双宽配置的3 exaflops是稀疏性能还是稠密性能未明确。
物理限制:800Gb InfiniBand互连虽快,但在大规模分布式训练中,尾部延迟和拥塞控制(PFC/ECN)仍是挑战。AMD的InfiniBand方案相比NVIDIA的NVLink和NVSwitch在集体通信性能上可能处于劣势。
PRO 决策建议
【厂商】
NVIDIA应强调其CUDA生态的成熟度和NVLink互连的低延迟优势,攻击AMD Helios平台在软件兼容性和集体通信性能上的不足。通过提供与Azure类似的GPU实例(如ND H100 v5),并突出其在AI训练领域的领先性能,吸引用户继续留在NVIDIA生态。Intel可推广其Gaudi AI加速器,强调在推理工作负载上的性价比,并指出AMD平台的高功耗风险。
【企业】
企业CIO和架构师应对Helios平台进行独立基准测试,验证其在真实AI推理和HPC工作负载下的性能与功耗。评估Pensando DPU和AI NIC是否带来不必要的复杂性和锁定,考虑跨云可移植性,避免被单一供应商绑定。同时,注意HBM4内存的容量和带宽是否满足未来模型需求,以及InfiniBand网络在规模下的拥塞控制表现。
【投资者】
投资者应认识到AMD在AI基础设施领域的追赶是长期过程,但短期内市场份额大幅提升受限,因为NVIDIA的生态护城河深厚。微软采用AMD更多是供应链多元化策略,而非性能碾压。关注Helios平台的实际部署量和客户采纳率,警惕过度炒作。长期看,AMD在AI推理市场可能获得一定份额,但训练市场仍由NVIDIA主导。
觉得这篇分析有用?
每周收到3-5条AI基础设施关键信号 →
💬 评论 (0)