DeepSeek联手华为:Ascend 950对标GB200,自研Tile Language破CUDA垄断
内容摘要
核心要点
DeepSeek创始人梁文锋在投资者会议中表示,芯片供应将不再是制约中国AI发展的瓶颈,时间窗口为一年以内。DeepSeek已锁定约16,000张华为Ascend 950芯片用于测试,声称华为Ascend 950超节点在性能和价格上对标NVIDIA GB200/GB300系统。梁文锋将中美AI差距归因于资源而非技术:美国前沿模型约8,000亿激活参数,中国仅数百亿,差距约10倍。DeepSeek自评估落后美国领先者12-18个月,目标缩短至3-6个月,且在仅相当于美国1/20算力条件下输出可比模型。
关键技术路线上,DeepSeek正在自研推理芯片,将与华为、NVIDIA竞争。软件层面用自研Tile Language编程语言减少对CUDA依赖。梁文锋预计一年内业界对国产芯片难用的认知将改变。市场数据显示,NVIDIA在中国AI加速器份额从2025年的59%跌至接近0%,本土厂商占据41%份额,出货165万张卡。华为AI芯片2026年营收预计达120亿美元,增长60%,受政府强制采购和超10亿美元补贴推动。
行业生态方面,阿里、华为、Moore Threads协同推进国产替代:阿里T-Head振武芯片已部署数千张并开源软件栈;华为WAIC 2026展示Atlas 950 SuperPoD(连接8192张昇腾芯片,算力为NVIDIA NVL144的6.7倍,无美国零件)。梁文锋的一年时间表与NVIDIA投资SSI、Vera Rubin量产等海外动作形成对比。DeepSeek+华为组合若在12个月内实现性能对标+生态可用突破,将从根本上改变全球AI算力供应链格局。DeepSeek自研推理芯片+Tile Language的双重押注,标志着中国AI产业从国产替代向自主技术体系演进的临界点。
重要性说明
尽管华为Ascend 950宣称对标GB200/GB300,但实际性能尚未有公开独立基准测试。华为芯片基于7nm制程(SMIC N+2),相比NVIDIA 4nm,在能效比和晶体管密度上存在代际差距,可能导致同等算力下功耗更高、散热需求更大。在大规模集群训练中,华为HCCS互联带宽和RoCEv2网络相比NVIDIA NVLink和InfiniBand,在尾部延迟和拥塞控制(PFC/ECN瓶颈)上可能成为瓶颈,影响大模型训练效率。DeepSeek的Tile Language目前仅用于内部,缺乏外部开发者生态和工具链支持,短期内难以撼动CUDA的统治地位。此外,政府强制采购和补贴虽然加速了华为芯片部署,但也将企业锁定在华为生态中,未来若想迁移至其他架构将面临高昂的转换成本。DeepSeek自研推理芯片可能与华为形成竞争,导致生态碎片化,增加开发者的适配负担。梁文锋的一年时间表过于乐观,忽略了软件生态成熟所需的长期积累。
PRO 决策建议
【厂商】竞争对手如NVIDIA、AMD、Intel应利用华为Ascend 950实际性能尚未验证的机会,加快推出更具性价比的产品(如NVIDIA B200/B300系列),并强化CUDA生态优势,提供迁移工具和兼容层,降低客户转向华为的风险。NVIDIA应积极游说美国政府放宽部分出口管制,或推出针对中国市场的合规产品(如H20的后续),以挽回市场份额。AMD和Intel应加速ROCm和OneAPI生态建设,提供开放的替代方案,吸引对华为锁定担忧的企业。
【企业】CIO与架构师应对华为Ascend 950进行独立的性能基准测试,特别是在大模型训练场景下的实际吞吐量和能效比,不要轻信厂商宣称。评估CANN软件栈的成熟度和与现有CUDA代码的迁移成本。考虑多云/多架构策略,避免被单一供应商锁定。关注DeepSeekTile Language的开放性和长期支持。对政府强制采购保持谨慎,评估长期运维和人才储备成本。
【投资者】应看穿公关辞令:华为Ascend 950的营收增长主要来自政府补贴和强制采购,而非市场自由竞争,可持续性存疑。DeepSeek自研芯片和语言增加了不确定性,可能分散资源。NVIDIA在中国市场份额下降是地缘政治结果,而非技术落后,一旦管制放松,可能反弹。长期关注真正具备全球竞争力的国产芯片厂商(如壁仞、摩尔线程)的技术突破。
觉得这篇分析有用?
每周收到3-5条AI基础设施关键信号 →
💬 评论 (0)