情报
AI 生成的结构化厂商动态简报
微软Azure引入AMD Helios机架级平台,正式打破NVIDIA AI GPU垄断格局
微软Azure宣布将在2026下半年部署AMD Helios机架级AI平台。该平台集成72颗MI455X GPU、18颗Venice CPU及液冷系统,单机架提供2.9 Exaflops FP4推理算力。此举标志着全球第二大云厂商正式摆脱对NVIDIA单一GPU供应商的依赖,开启AI基础设施多架构时代。
AMD发布Helios机架级AI平台,MI400系列主打推理密度与TCO优势
AMD在AAI 2026发布Helios机架级解决方案,集成72颗MI455X GPU与18颗Venice CPU,单机架提供2.9 Exaflops FP4推理算力与31TB HBM4内存。MI430X GPU提供288 TFLOPS FP64用于HPC。AMD宣称相比竞品每美元推理Token数提升30%。
AMD Helios全栈AI服务器获Azure规模化部署,UALoE开放标准挑战NVLink
AMD与Microsoft Azure联合宣布Helios全栈AI服务器将在Azure规模化部署,采用72×MI455X GPU、18×EPYC Venice CPU和Pensando DPU,配备31TB HBM4和1.7PB/s显存带宽。同时推出两个新Azure VM系列,分别面向Agentic AI和半导体设计。此举标志着Microsoft多供应商战略关键落地,直接挑战NVIDIA在AI基础设施的主导地位。
AMD发布Zen 6 Venice与MI455X,Helios机架级设计挑战NVIDIA
AMD在Advancing AI 2026大会发布基于TSMC 2nm的Zen 6 EPYC Venice(最高256核)和CDNA5架构MI455X(432GB HBM4,40 PFLOPS FP4),推出Helios机架级参考设计(单rack 2.9 exaFLOPS FP4),宣称四年AI性能提升1000倍,获Meta、OpenAI等大客户长期合同。
NVIDIA开源Cosmos 3 Edge 4B世界模型,Jetson Thor实现15Hz实时机器人控制
NVIDIA开源Cosmos 3 Edge(4B参数)世界动作模型,专为边缘机器人控制设计,在Jetson Thor平台实现15Hz实时推理和32个动作生成。此举将物理AI栈从数据中心扩展到边缘,推动机器人从感知到动作的端到端部署。
测试情报-NVIDIA AI chip news
...
NVIDIA推出Jetson Thor T3000/T2000,以Blackwell架构压降边缘AI推理成本壁垒
NVIDIA发布基于Thor架构的Jetson T3000和T2000模块。T3000集成Blackwell GPU、8核Neoverse CPU,以T5000一半的功耗提供865 FP4 TFLOPS算力,并搭配新的Jetson Agent Skills自动化内存优化工具,旨在推动人形机器人和边缘AI应用的大规模部署。
NVIDIA发布Vera CPU:以最大单线程性能重构AI Agent生态
NVIDIA推出Vera CPU,专为AI Agent工作负载设计,采用Olympus核心,提供比x86高1.8倍的持续每核心性能。该CPU与NVIDIA GPU和BlueField统一架构,旨在构建AI工厂的统一计算平台,挑战现有x86 CPU生态。
高通携Dragonfly C1000与HBC技术杀入AI推理,直指Nvidia HBM壁垒
高通发布Dragonfly路线图,包括自研Oryon核心的C1000 CPU和搭载HBC近存计算技术的AI300推理加速器,Meta和Microsoft已签约。目标是通过降低TCO和突破memory wall,在AI推理市场形成差异化,避开与Nvidia在训练端的正面竞争。
Announcing the Monetization Gateway: charge for any resource behind Cloudflare via x402
...
OpenAI联合博通发布推理ASIC Jalapeño,摆脱NVIDIA GPU依赖
OpenAI与博通合作推出首款定制AI推理芯片Jalapeño,9个月完成流片,专为大模型推理优化。OpenAI负责架构,博通负责网络硬件,Celestica集成。计划2026年底大规模部署,配套千兆瓦级数据中心,旨在降低推理成本并减少对NVIDIA的依赖。
华为MWC上海2026力推Token计费:从字节管道转向AI价值交付,运营商需重构网络架构
华为在MWC上海2026提出运营商应从基于字节的计费转向基于AI Token的计费,并展示了AI推理加速方案,将长序列推理吞吐量提升372%。同时强调U6 GHz频段对AI可穿戴设备上行链路的关键作用,推动5G-A网络成为AI计算交付基础设施。
Anthropic指控阿里系发起史上最大AI蒸馏攻击,暴露API安全致命漏洞
Anthropic向美国参议员致信,指控与阿里相关的运营商通过约2.5万个欺诈账户发起2880万次模型交换,系统性地提取Claude前沿能力。此事件凸显AI模型API面临的新型大规模蒸馏威胁,迫使行业重新评估推理端点安全与使用监控。
华为推AI原生网络架构:从字节计费转向Token货币化,UCM缓存突破长上下文瓶颈
华为在MWC上海2026发布AI原生网络架构,集成服务-网络-计算,实现从流量中心到智能中心的转变。核心是Unified Cache Manager(UCM)将KV缓存扩展至PB级外存,在GLM-5.1模型128K序列长度下实现372% token吞吐量提升。同时推出token货币化框架,允许运营商按AI推理容量计费,并引入agentic运营模式。
Google Cloud推多代理自主运维,控制点从人类转向AI验证架构
Google Cloud提出“agent-scale data management”,通过多代理验证架构减少人工监督,并与Nokia部署6个Gemini代理实现网络自治。同时Amazon计划商业化Trainium芯片,加剧AI硬件竞争,挑战Google TPU和Nvidia GPU。
高通发布Dragonfly数据中心CPU与HBC内存,以推理优先架构挑战NVIDIA霸权
高通在投资者日公布完整数据中心路线图,包括250核Oryon CPU(Dragonfly C1000)、近内存计算HBC(声称133TB/s带宽)、AI300推理加速器(54x带宽提升),以及800G/1.6T互联。与Meta签署多年CPU供应协议,2028年商用,旨在以低功耗高带宽颠覆AI推理市场。
OpenAI联手Broadcom推出Jalapeno推理芯片,重塑AI硬件生态
OpenAI与Broadcom合作开发了名为Jalapeno的LLM推理加速芯片,采用多芯片模块、HBM3E内存,9个月完成流片。该芯片专为OpenAI模型栈优化,旨在降低推理成本并减少对NVIDIA GPU的依赖,计划2026年底部署。
Cisco Live US & InfoComm 2026 : la collaboration entre dans l’ère agentique
...
NVIDIA与AWS联手:cuVS默认化GPU加速向量搜索,G7实例4.6倍推理性能突破
NVIDIA与AWS深度整合,推出EC2 G7实例(基于RTX PRO 4500 Blackwell GPU),性能提升4.6倍;并在OpenSearch Serverless中默认启用cuVS进行GPU加速向量索引,速度提升10倍、成本降低75%。AWS获GB300 Exemplar Cloud认证。
NVIDIA全栈统治超算TOP500:Grace CPU与InfiniBand锁定AI基础设施生态
NVIDIA宣布其技术驱动了81%的TOP500超算,其中Grace CPU部署增至26台,Quantum InfiniBand连接376台。全栈策略(GPU+CPU+网络)正在将超算采购从开放组件转向单一供应商锁定,Green500前八名均使用NVIDIA GPU。