情报
AI 生成的结构化厂商动态简报
思科发布AI模型溯源宪法,定义权重级衍生关系标准
思科发布《模型溯源宪法》,为AI模型供应链安全提供规范性定义。该标准严格基于模型权重的可验证衍生历史,明确区分了直接衍生、蒸馏等五种关联关系与独立复现等八种非关联模式,旨在解决当前行业在模型溯源定义上的不一致问题。
思科开源AI模型血缘工具包,瞄准AI供应链安全治理层
思科发布开源工具Model Provenance Kit,通过分析模型元数据、分词器及权重信号,生成唯一指纹并比对,以技术手段验证AI模型的血缘关系与完整性,旨在应对模型供应链中存在的篡改、伪造及合规风险。
英伟达内部规模化部署GPT-5.5驱动AI代理,定义企业AI基础设施新范式
英伟达宣布其超过1万名员工已通过Codex应用,在基于GB200 NVL72的NVIDIA基础设施上规模化使用GPT-5.5。此举不仅展示了前沿模型推理在企业内部工作流中实现‘变革性’生产力的技术可行性,更通过专用的安全云VM架构,为企业部署AI代理提供了可审计、隔离的参考范式。
Meta"裁员换算力":AI基础设施军备竞赛的极端表达
Meta的战略选择代表了AI基础设施军备竞赛的"终局思维"——不是如何盈利,而是如何生存。当capex达到营收的50%+时,这不再是商业决策,而是生存押注。劳动力成本的"相对价值"在AI时代发生了根本性重估。
英伟达联合谷歌优化Gemma 4,强化本地AI代理基础设施
英伟达宣布与谷歌合作,针对其RTX、DGX Spark及Jetson平台,对Gemma 4系列开源模型进行深度优化。此举旨在将高性能、多模态AI推理能力从云端扩展至边缘设备和个人工作站,为本地AI代理(Agentic AI)提供从2B到31B参数的全栈模型支持。
NVIDIA 优化 Gemma 4 模型以加速本地代理 AI
NVIDIA 与 Google 合作优化 Gemma 4 系列模型,使其能够在从边缘设备到高性能 GPU 的各种 NVIDIA 硬件上高效运行。这些模型支持多种任务,包括推理、编码和代理功能,适用于本地代理 AI 应用。
谷歌发布Gemma 4开源模型,瞄准边缘推理与AI代理架构
谷歌推出Gemma 4开源模型家族,包含从2B到31B的四个版本,强调单位参数性能突破,并原生支持AI代理工作流、多模态与长上下文。其小参数模型专为边缘设备优化,旨在将前沿推理能力扩展至移动与IoT场景。
Google发布Gemma 4开源模型系列
Google推出Gemma 4开源模型系列,包含四种规模变体,特别优化边缘计算和移动设备。该系列支持多模态处理、长上下文窗口和140多种语言,采用Apache 2.0许可。
AMD发布突破性MLPerf 6.0推理结果,展示多节点扩展与多模态能力
AMD在MLPerf Inference 6.0基准测试中,凭借Instinct MI355X GPU在Llama 2 70B和GPT-OSS-120B模型上首次突破每秒100万令牌的推理吞吐量。其提交强调了多节点扩展效率、对新型文本到视频模型(Wan-2.2-t2v)的快速启用,以及广泛的合作伙伴生态系统复现结果。
NVIDIA扩展NIM微服务与数字孪生平台,强化全栈AI生态
NVIDIA推出NIM微服务,支持30+模型涵盖文本、视觉、语音和具身智能,通过AI Enterprise和云服务商提供。同步发布Omniverse Cloud数字孪生平台,集成机器人模拟与感知技术,并推出BioNeMo医疗基础模型集合。
英伟达Jetson平台推进边缘AI开源模型本地化部署
英伟达通过Jetson边缘AI平台实现开源生成式AI模型的本地化部署,支持包括Qwen3 4B和Mistral 3在内的多种模型在边缘设备运行。平台提供从Jetson Orin Nano到Thor的完整硬件选项,集成计算与内存于SoM以简化设计。关键性能指标显示,Jetson Thor可实现52 tokens/秒的Mistral 3推理速度。
思科将提示注入防御提升至基础设施层
思科将提示注入类比为新型SQL注入,强调单一防护层不足,需采用分层防御策略。提出在网络层实施微隔离和东西向流量检测,终端层部署EDR异常检测,构建纵深防御架构。
Trend Micro发布AI安全报告,揭示AI供应链风险与模型攻击面
Trend Micro发布《AI生态系统断层线》报告,系统性地分析了AI供应链中的安全风险,包括模型训练数据污染、第三方插件漏洞以及模型窃取攻击。报告指出,企业AI应用的安全边界已从传统IT基础设施扩展至模型层和数据管道。
微软推出Phi-4系列小语言模型,强化边缘AI与多模态推理能力
微软发布Phi-4系列小型语言模型(SLM),包括5.6B参数的Phi-4-multimodal模型,支持语音、视觉和文本的多模态处理。该系列已部署至Azure AI Foundry、HuggingFace和NVIDIA API Catalog,重点优化边缘设备上的AI推理能力。
Google TurboQuant:6倍KV缓存压缩,AI推理内存成本拐点到来
Google发布TurboQuant算法,通过PolarQuant和QJL两阶段压缩,将大模型KV缓存内存占用压缩6倍(3-bit量化),注意力计算速度提升8倍,且无精度损失。该技术直接冲击HBM内存需求叙事,导致Micron、Western Digital等内存股下跌,标志AI推理效率拐点。