AMD 2026-07-26
Product Launch 影响: Major 置信: 85%

AMD Helios投产:12层HBM4容量制胜,开放UALoE挑战NVLink封闭生态

内容摘要

AMD第二代Helios机架AI服务器全面投产,搭载72张MI455X GPU和Samsung独家12层HBM4内存,单机柜31TB。相比NVIDIA Rubin 8层设计,容量提升50%,成本降低30%。微软Azure规模部署,标志Hyperscaler双供应商策略落地。

核心要点

2026年7月,AMD CEO苏姿丰在首尔Advancing AI大会上宣布第二代Helios机架级AI服务器已全面投产,Q3末开始出货。Helios机架搭载72张MI455X加速器(CDNA 5架构,采用TSMC N2 + N3P工艺)和18颗EPYC Venice CPU(96核Zen 6),配备Samsung独家供应的HBM4 36GB 12层堆栈(12-Hi),每GPU 432GB,单机柜总内存31TB,显存带宽1.7PB/s,FP4算力2.9 EFLOPS,FP8算力1.4 EFLOPS。横向扩展带宽43TB/s,纵向扩展带宽260TB/s,网络采用Pensando Salina 400GUALoE 800G开放标准。
性能对比NVIDIA Vera Rubin NVL72,Helios在AI算力上领先15%,HBM容量高出50%,横向扩展带宽高出50%,并实现30%的token/$成本优势。在Kimi K2 Thinking模型上吞吐量提升10-15%。这一优势源于AMD的'容量优先'内存哲学,与NVIDIA的'带宽优先'设计形成分野,尤其适合长上下文和Agentic AI推理场景。
微软计划在Azure中规模部署Helios,与自研Cobalt 200 ARM服务器形成互补,标志着Hyperscaler'双供应商'策略的具体化。五大Hyperscaler(OpenAI、Oracle、Anthropic、Meta、Microsoft)均已背书。Samsung凭借12层HBM4独家供应AMD,打破了SK Hynix在HBM市场的58%份额垄断,重塑内存供应链格局。

重要性说明

AMD Helios的'容量优先'哲学在长上下文推理中确实有优势,但这是以牺牲内存带宽为代价的。对于需要高带宽的密集训练任务,NVIDIA的8-stack设计可能仍占优。此外,AMD宣称的30% token/$优势可能基于特定优化,未考虑ROCm软件栈的迁移成本和企业用户对CUDA生态的依赖。UALoE 800G作为开放标准,其实际尾部延迟和拥塞控制(PFC/ECN)性能是否达到NVLink的水平尚未公开。Pensando Salina 400G作为AMD自有网络芯片,可能形成新的互连锁定,而非真正的开放。
AMD通过独家HBM4供应和Pensando网络,试图在开放外衣下建立新的控制点。Samsung的12层HBM4良率和供应稳定性是潜在风险,可能影响大规模部署。同时,AMD未提及Helios的功耗和散热需求,对于数据中心改造可能带来隐性成本。
本质上,AMD此举是在合围NVIDIA的AI基础设施主导地位,但同时也通过CDNA架构和ROCm软件栈锁定用户。企业需警惕从NVIDIA锁定转向AMD锁定的风险,尤其是编程模型和互连技术的迁移成本。

PRO 决策建议

【厂商】NVIDIA应加速Rubin的12-stack HBM4设计以消除容量劣势,同时强化NVLink的生态粘性,突出CUDA在训练工作负载中的不可替代性。通过独立基准测试展示在密集训练任务中的性能优势,并降低H100/B200的token成本以应对价格竞争。同时,NVIDIA应加强与SK Hynix的合作,确保8-stack带宽优势的同时探索更高容量方案。
【企业】企业CIO在评估Helios时,必须进行零信任技术审计:要求AMD提供ROCm与主流框架(PyTorch、TensorFlow)的兼容性清单,并测试实际工作负载的token成本和迁移成本。警惕Pensando网络可能形成的锁定,要求支持标准RoCEv2或InfiniBand作为备选。同时评估Samsung HBM4的供应稳定性和AMD的长期路线图承诺。建议采用小规模试点验证后再扩大部署。
【投资者】投资者应关注AMD能否持续获得Hyperscaler订单以验证其量产能力,但需警惕软件生态短板和供应风险。双供应商策略对NVIDIA是长期利空,但AMD的利润率可能因竞争而承压。关注Samsung HBM4的良率进展和SK Hynix的反制措施(如推出12-stack HBM4E)。长期看,开放网络标准UALoE的生态建设是关键,但AMD的Pensando锁定可能削弱其开放叙事。

来源: 36氪
查看原文 →

觉得这篇分析有用?

每周收到3-5条AI基础设施关键信号 →

💬 评论 (0)