情报
AI 生成的结构化厂商动态简报
Meta开发AI模型路由器Switchboard,意图控制推理成本与生态
Meta内部孵化器AAI Labs开发AI模型路由器Switchboard,可自动分析任务难度并分配至最适模型,以降低推理成本。项目初期用于内部AI编程Agent,后续可能面向企业客户,意图构建AI推理分配控制层。
NVIDIA 20亿投资CoreWeave,以‘算力央行’模式重构AI云生态
NVIDIA对CoreWeave进行20亿美元战略投资,并推出‘AI计算合伙人计划’,通过信用增级、收入分成和GPU回购三重机制,从GPU供应商转型为算力生态的‘央行’,压缩中间商利润,巩固对AI算力供应链的控制。
Moonshot发布Kimi K3:2.8万亿参数开源MoE,定价$3/$15冲击AI格局
Moonshot AI发布Kimi K3,2.8万亿参数MoE架构(896专家激活16个),原生多模态,1M上下文。API定价$3/$15,显著低于竞争对手。开源权重将于7月27日公开,发布后GPU容量即耗尽。该模型在Arena.ai排行榜以1679分超越Fable 5。
阿里发布2.4T参数Qwen3.8-Max,MoE架构与0.2折定价冲击AI市场
阿里巴巴发布Qwen3.8-Max-Preview,总参数2.4万亿,采用MoE架构,支持多模态和1M上下文窗口。同步推出Qoder平台与Token Plan,限时折扣低至0.2折,大幅降低推理成本。官方声称综合能力仅次于Anthropic Fable 5,标志着中国AI进入参数军备与开源竞争双轨制。
Anthropic启动自研AI芯片,三星2nm代工,算力自主战略加速
Anthropic正式启动自研AI芯片研发,并与三星洽谈2nm代工合作。此举旨在降低对NVIDIA GPU的依赖,优化推理成本,并在IPO前强化技术护城河。加入OpenAI、Google等自研芯片行列,标志AI算力从软件竞赛转向硬件圈地。
Anthropic启动自研AI芯片:软硬一体化锁定推理成本控制权
Anthropic发布Claude Sonnet 5的同时,被曝启动自研AI芯片计划,采用三星代工。此举旨在降低对NVIDIA的依赖,控制长期推理成本,标志着Anthropic从纯软件公司向软硬一体化基础设施企业转型。
OpenAI通过系统优化将推理成本砍半,数百GPU支撑ChatGPT海量请求
OpenAI通过模型量化(FP16→INT4/INT8)、KV-Cache优化、动态批处理与投机解码等系统底层技术,将AI推理成本降低50%以上,仅用数百张NVIDIA GPU支撑ChatGPT未登录用户流量。推理毛利率从38%跃升至65%,实现接近盈亏平衡。
OpenAI联手博通9个月流片自研推理芯片Jalapeño,剑指NVIDIA生态
OpenAI与博通联合发布首款自研推理ASIC芯片Jalapeño,采用TSMC 3nm工艺,专为Transformer推理优化,目标推理成本降低50%。从设计到流片仅9个月,计划2026年底部署于千兆瓦级数据中心,标志着OpenAI向全栈AI基础设施提供商转型,直接挑战NVIDIA在推理市场的控制权。
OpenAI GPT-5.6激进定价与150万上下文窗口,加速Agent化转型
OpenAI传闻发布GPT-5.6,上下文扩展至150万token,定价仅为Claude Fable 5的三分之一,并强化Agent可靠性。此举意在利用Anthropic被下线窗口期抢占市场,同时修复reward hacking事故。
高通AI200借AWS入云:推理芯片生态从英伟达独走向多元联盟
高通AI200推理芯片(768GB内存)预计2026年大规模部署于AWS,旨在降低云推理成本。此举标志着高通从移动端向云数据中心的关键战略转移,并借助AWS定制化芯片战略,直接挑战英伟达在AI推理环节的垄断地位,重构云推理芯片生态联盟。
华为云发布AICS灵衢智算集群:Token工业化时代的控制平面转移与Agent锁定
华为云发布四大Agentic Infra新品,核心为AICS灵衢智算集群(10万卡/200 EFLOPS),通过NPU直通CMS硬件、CCE VolcanoNext通智一体化调度引擎与AgentSphere安全沙箱,构建从算力、记忆到调度、安全的统一控制平面,旨在锁定大模型训练与Agent推理的全栈基础设施。
Apple与Google达成多年期合作,Gemini将成Siri新大脑
Apple与Google达成多年期合作,Google Cloud成为Apple首选云服务商。Google正为Apple构建1.2万亿参数的定制Gemini模型,是当前Apple云端模型的8倍。Siri将在2026年获得Gemini能力,随iOS 27在秋季发布。隐私架构保持不变——Gemini模型运行在Apple自有服务器,Google不得使用Apple数据训练。设备兼容性限制意味着数亿老款iPhone用户被排除在外。
NVIDIA内部部署OpenAI Codex:万人使用GPT-5.5驱动智能体编程革命
NVIDIA超过10,000名员工使用OpenAI Codex,GPT-5.5运行于GB200 NVL72平台,推理成本降低35倍。
OpenAI发布小型化模型GPT-5.4 mini/nano优化企业AI推理
OpenAI推出GPT-5.4 mini和nano两款小型化模型,针对编码、多模态和高吞吐API场景优化。模型通过减小体积提升推理速度,降低企业部署成本。这代表OpenAI通过模型优化战略强化企业级AI服务竞争力。