情报
AI 生成的结构化厂商动态简报
NVIDIA Vera Rubin全球部署:每兆瓦Token吞吐量10倍提升,锁定AI工厂标准
NVIDIA宣布Vera Rubin平台全面量产交付,CoreWeave等云厂商已部署NVL72系统。该平台采用Vera CPU和Rubin GPU,每兆瓦Token吞吐量较Blackwell提升10倍,支持千兆瓦级AI工厂,全球超350站点部署。
CrowdStrike联手Cerebras:晶圆级芯片加速安全推理进入亚毫秒时代
CrowdStrike与Cerebras达成战略合作,将Falcon AIDR平台与Cerebras晶圆级推理引擎集成,实现亚毫秒级威胁检测。同时Cerebras部署CrowdStrike保护其AI基础设施。此举标志着安全AI推理从GPU向专用晶圆级芯片的范式转移。
高通收购Modular:用Mojo语言挑战CUDA,开启AI全栈生态重构
高通完成对AI软件平台Modular的收购,保留Mojo语言、MAX推理引擎和Modular Cloud品牌。此举标志着高通从芯片公司向全栈AI计算平台转型,意图通过Mojo语言直接挑战NVIDIA的CUDA生态,加速从边缘到云端的AI部署。
NVIDIA Rubin GPU:3nm双die 336B晶体管,HBM4与NVLink 6带宽翻倍
NVIDIA在SIGGRAPH 2026公布Rubin GPU完整规格:采用TSMC 3nm工艺双die封装,总计3360亿晶体管,配备288GB HBM4内存和22 TB/s带宽。NVLink 6提供3600 GB/s双向带宽,较上代翻倍。NVL72机架集成72颗Rubin GPU,功耗超1000W,需全液冷散热。
Qualcomm收购Modular:控制点从芯片移向Mojo语言,全栈AI平台战略落地
Qualcomm完成对AI软件公司Modular的收购,获得Mojo编程语言、MAX推理引擎和Modular Cloud平台,并任命Chris Lattner领导AI软件部门。此举标志着Qualcomm从纯硬件芯片供应商向全栈AI计算平台的战略转型,意图通过软件生态锁定开发者。
苹果M7芯片跳过M6代际直指端侧AI推理加速
...
NVIDIA通知合作伙伴GPU套件全线涨价
...
AMD发布第六代EPYC Venice与MI400 GPU,Helios机架主打推理性价比
AMD发布基于2nm制程的第六代EPYC Venice处理器和MI400系列GPU,其中MI455X推理token吞吐量提升34倍。同时推出集成72颗MI455X GPU与18颗EPYC CPU的Helios机架级AI解决方案,通过Pensando网络互联和ROCm加速,宣称每美元推理token数比竞品高30%,并获得OpenAI、Meta等客户采用。
DeepSeek联手华为:Ascend 950对标GB200,自研Tile Language破CUDA垄断
DeepSeek创始人梁文锋宣称一年内中国将摆脱NVIDIA,华为Ascend 950超节点性能对标GB200/GB300。DeepSeek自研推理芯片及Tile Language编程语言以减少对CUDA依赖,标志着中国AI产业从国产替代向自主技术体系演进的关键转折。
NVIDIA Vera Rubin NVL72量产交付,能效比10倍跃迁改写AI算力基础设施规则
NVIDIA宣布Vera Rubin NVL72平台全面量产,首批交付CoreWeave、Microsoft、Amazon、Oracle等云厂商。每机架集成72颗Rubin GPU和36颗Vera CPU,在Agent AI工作负载上每单位能耗吞吐量较Blackwell提升10倍,推理成本降低10倍,标志着AI算力进入系统级集成的新阶段。
AMD发布第六代EPYC Venice处理器与Helios机架级AI解决方案
...
阿里云WAIC 2026发布Agent-Native全栈,开源SAIL软件栈挑战CUDA生态
阿里云在WAIC 2026发布Agent-Native云套件(AgentLoop/AgentTeams/AgentRun/TokenWorks),开源T-Head SAIL AI软件栈,推出2.4T参数模型Qwen 3.8-Max-Preview及Zhenwu M890超节点,全面布局Agent-Native云与开源AI生态,意图构建从硬件到平台的全栈竞争力。
Anthropic Claude Opus 5登陆AWS Bedrock,0%注入率挑战OpenAI安全论断
Anthropic发布Claude Opus 5,在AWS Bedrock四个区域GA,同时上线Claude Platform。Auto Mode在129个浏览器代理测试中实现0% prompt injection,反驳OpenAI'无法解决'论。定价$5/$25 per M token,性能领先,半价对标Fable 5。
微软自研MAI模型公开预览:GPU成本降低89%,摆脱OpenAI依赖
微软在Azure Foundry推出自研MAI-Image-2.5-Pro和MAI-Voice-2-Flash,实现8K文字渲染96.8%准确率,GPU成本较GPT系列降低84%-89%。已部署于Bing、PowerPoint、OneDrive等产品,标志着微软从依赖OpenAI转向自研AI的战略转折。同期NVIDIA Jetson登月任务展示太空边缘AI。
AMD Helios投产:12层HBM4容量制胜,开放UALoE挑战NVLink封闭生态
AMD第二代Helios机架AI服务器全面投产,搭载72张MI455X GPU和Samsung独家12层HBM4内存,单机柜31TB。相比NVIDIA Rubin 8层设计,容量提升50%,成本降低30%。微软Azure规模部署,标志Hyperscaler双供应商策略落地。
AMD与Cerebras合作分解式AI推理,WSE-3芯片突破延迟极限
AMD与Cerebras推出分解式AI推理方案,将Helios Rackscale系统(第六代EPYC Venice处理器+最多72颗MI455X GPU)与Cerebras WSE-3(4万亿晶体管)通过Infinity Fabric互联,旨在为AI推理提供超低延迟与高吞吐量,挑战传统GPU集群架构。
AMD发布2nm GPU MI455X与Zen 6 EPYC,双线夹击NVIDIA与英特尔
AMD在Advancing AI 2026大会上宣布数据中心CPU市场份额达46%,并发布全球首颗2nm制程GPU Instinct MI455X,采用CDNA架构与HBM4内存,专为AI训练与推理优化。同时推出第六代EPYC Venice处理器,基于Zen 6架构,进一步强化AI负载性能。
NVIDIA联合纬创美国首产GB300,AI制造生态重心转移至德州
NVIDIA携手纬创在德州开设D1工厂,实现GB300 Grace Blackwell Ultra的L6级美国本土集成制造。该工厂投资7亿美元,首台系统含150万零件、重2吨、单价400万美元,并规划Vera Rubin量产。此举标志着美国AI Capex本土化率从5%向30%跃升的关键转折,重塑全球AI供应链格局。
OpenAI发布Presence Agent平台,控制面转移锁定企业AI部署
OpenAI发布企业级Agent部署平台Presence,集成模型推理、权限、策略、评估与升级工具,将控制面从模型转向平台。同时ChatGPT Health向美国18+用户全面开放,整合Apple Health等健康服务,加速消费级AI Agent落地。
Google启动Gemini 4预训练,4M+上下文与月度迭代加速AI竞赛
Alphabet确认启动史上最大规模预训练Gemini 4,支持4M+上下文和多模态原生,计划接近月度发布。同时上调2026资本开支至$1950-2050亿,Google Cloud Q2增长82%,显示全栈AI战略加速。