AMD Helios机架全栈出击,以开放网络UALoE挑战NVIDIA NVLink生态锁死
内容摘要
核心要点
AMD在Advancing AI 2026大会上发布了完整的AI基础设施产品线,CEO Lisa Su推出了AMD Helios机架级AI解决方案(已量产),直接对标NVIDIA的Vera Rubin NVL72。Helios机架包含72颗AMD Instinct MI455X GPU(CDNA 5架构)、18颗第6代AMD EPYC Venice CPU(Zen 6架构,TSMC 2nm工艺)、AMD Pensando前端/纵向扩展/横向扩展网络,以及AMD ROCm开源软件栈。性能方面,AMD宣称Helios在推理token/$上比竞争对手高出最多30%。MI455X配备432GB HBM4(4.0代),内存带宽19.6 TB/s,FP4推理性能业界领先。此外,AMD发布了UALoE(Unified Accelerator Link over Ethernet)开放标准,旨在打破NVIDIA NVLink的封闭生态,推动跨厂商兼容。CPU方面,第6代EPYC Venice提供AI Host Node、高密度Agent CPU和通用企业三种版本,强调每瓦/每美元/每机架agent数业界领先,其中Venice-X达到96核+1152MB 3D V-Cache+5.15GHz。合作方面,Cerebras将集成AMD Helios提供超低延迟推理联合方案,Cisco将在Helios上集成企业AI解决方案。客户包括OpenAI(6GW Helios合同)、Anthropic(2GW MI455X)、Meta等。AMD预测2028年AI加速器市场达5000亿美元,2030年达1.4万亿美元。
重要性说明
AMD此举表面是技术升级,实质是对NVIDIA的合围。通过推出UALoE开放标准,AMD试图将AI基础设施的控制点从NVIDIA的NVLink专有互联转移到开放以太网,从而削弱NVIDIA的生态锁定。然而,UALoE作为新生标准,其互操作性和实际性能尚待验证,初期可能面临兼容性风险,且缺乏像NVLink那样经过大规模验证的低延迟特性。同时,AMD虽然强调CPU在agent编排中的重要性,但Venice EPYC在协调数十个GPU时可能引入额外的尾部延迟,尤其是在高频推理场景下。此外,AMD的Pensando网络在AI训练中的拥塞控制(如PFC/ECN瓶颈)可能不如InfiniBand成熟,导致大规模分布式训练时的性能波动。AMD声称的30% token/$优势很可能基于特定工作负载(如低精度推理),在通用训练场景下优势可能缩小。用户若迁移到AMD平台,将面临ROCm软件栈与CUDA生态的差距,以及Pensando网络管理工具链的陌生性,形成新的隐性锁定。AMD通过Helios整柜方案,实际上是在复制NVIDIA的集成策略,试图将用户从单芯片采购锁定到其全栈系统,长期可能削弱用户的架构弹性。
PRO 决策建议
【厂商】竞争对手(NVIDIA、Intel)应如何应对?NVIDIA应强化NVLink的性能优势,并推动其开放化(如NVLink Switch的可编程性),同时指出UALoE在延迟和可靠性上的不足。Intel可推出类似机架方案,利用其Xeon CPU在agent编排上的成熟生态,并联合网络厂商提供开放互联选项。此外,NVIDIA应加速Vera Rubin平台的量产,并以实际基准测试对比AMD的token/$数据,揭露其局限性。
【企业】建议CIO/架构师保持零信任审计:要求AMD提供独立第三方基准测试,覆盖训练和推理多种工作负载,验证token/$优势。评估从CUDA迁移到ROCm的成本和风险,包括软件兼容性和性能损失。测试UALoE在真实大规模集群中的延迟和拥塞控制表现,避免被宣传数据误导。考虑采用多供应商策略,避免单一Helios机架锁定,保留基于InfiniBand或NVLink的选项。
【投资者】应看穿公关辞令:AMD的TAM预测(2030年1.4万亿美元)过于乐观,需关注实际营收和市场份额增长。Helios的客户合同(OpenAI 6GW、Anthropic 2GW)虽大,但需关注交付进度和实际性能是否达标。UALoE标准能否被行业广泛采纳是关键,若仅AMD单方推动,其生态价值有限。长期关注AMD与NVIDIA在推理性价比上的真实差距,以及ROCm生态的追赶速度。
觉得这篇分析有用?
每周收到3-5条AI基础设施关键信号 →
💬 评论 (0)