华为加速测试昇腾910B,8192芯片超节点与存内计算芯片突破能效比
内容摘要
核心要点
华为正在加速测试其最新AI芯片昇腾910B,这是在美国制裁下挑战NVIDIA的关键举措。该公司展示了Atlas 950 SuperPoD,一个集成8192颗芯片的超节点,提供524 EFLOPS FP8算力,计划2026年Q4推出。此外,华为规划了Atlas 950 SuperCluster,集成超过52万颗芯片,提供约1 ZFLOPS FP4算力,瞄准超大规模AI训练。在ISSCC 2026上,华为发布了基于Tao Law架构的55nm存内计算AI芯片,能效比7nm冯诺依曼架构高3.2倍,获得双重认可。这些进展显示华为在AI硬件领域从芯片到系统级的持续创新。昇腾910B的具体性能未公开,但预计对标NVIDIA H100。Atlas 950 SuperPoD的8192芯片互连方案,体现了华为在系统级设计上的能力,旨在支持超大规模模型训练。存内计算芯片聚焦推理场景,通过减少数据搬运降低功耗。华为此次发布正值美国进一步限制对华AI芯片出口,其昇腾910B和Atlas 950 SuperPoD旨在为国内AI企业提供替代NVIDIA的算力方案。Tao Law架构的存内计算芯片则代表了后摩尔时代的一种创新路径,通过架构突破而非工艺提升获得能效增益。华为的AI芯片路线图显示其正加速追赶,尽管先进工艺受限,但通过系统集成和架构创新试图保持竞争力。
重要性说明
华为此次发布表面是技术突破,实则在防守NVIDIA在中国市场的份额,同时合围国内AI芯片初创企业。通过Atlas 950 SuperPoD和昇腾910B,华为试图构建从芯片到集群的完全封闭生态,利用自研互连技术和CANN软件栈锁定用户,一旦采用,迁移至其他厂商(如NVIDIA或AMD)的成本将极为高昂。
华为刻意淡化了8192芯片超节点的物理限制:功耗和散热问题未提及,实际部署可能需要大规模液冷基础设施,显著增加TCO。FP4算力的宣传掩盖了精度损失风险,在训练场景中可能需额外校准开销。Tao Law架构的55nm存内计算芯片虽能效比高,但计算密度低,仅适用于特定推理负载,且软件生态不成熟,开发者面临工具链锁定。
从控制层转移看,华为通过超节点将控制点从标准以太网转向其专有芯片互连,剥夺了用户对网络架构的弹性选择权。这与NVIDIA的NVLink策略类似,但华为的互连更封闭,缺乏行业标准支持,长期将导致用户资产锁定。
PRO 决策建议
【厂商】NVIDIA和AMD应强调自身开放生态,指出华为自研互连和CANN的锁定风险。NVIDIA应推广NVLink开放标准,AMD突出ROCm和Ethernet灵活性。质疑FP4精度训练实用性及55nm存内计算通用性不足。强调华为受制裁影响,长期工艺演进受限。
【企业】要求华为提供Atlas 950 SuperPoD功耗、散热及互连带宽数据。测试FP4精度对模型影响,审计CANN框架兼容性。考虑跨云可移植性,要求标准接口选项。将液冷改造成本纳入TCO比较。
【投资者】看穿公关辞令:昇腾910B性能受工艺限制,存内计算市场有限,SuperPoD推出时NVIDIA已有更新产品。关注生态采用率而非硬件参数。华为在中国有政策优势,但全球竞争力有限。
觉得这篇分析有用?
每周收到3-5条AI基础设施关键信号 →
💬 评论 (0)