筛选

×
当前筛选 清除全部
关键词: Llama ×
35 情报总数
1/2 当前页
Meta 其他 2026-07-26

Meta与Anthropic百亿算力租赁:Hyperscaler从租户到房东的生态重构

Meta与Anthropic正就最高100亿美元的算力租赁协议进行早期谈判,标志着Meta Compute从内部自用转向对外商业出租。此举将Meta的巨额AI资本支出转化为可货币化资产,同时开创了Hyperscaler间相互租赁算力的‘Inter-Cloud’模式,重构AI基础设施生态。

AMD 其他 2026-07-23

AMD反向投资Anthropic 50亿美元,绑定2GW MI450部署,重构AI算力生态

AMD与Anthropic达成战略合作,Anthropic将部署最多2GW AMD Instinct MI450系列GPU,AMD反向投资$50亿。双方将联合优化ROCm软件栈,并利用Claude优化Instinct负载。此举标志着AMD从芯片供应商升级为AI生态投资者,加速AI算力多元化,直接挑战NVIDIA的垄断地位。

AMD 其他 2026-07-23

AMD发布Zen 6 Venice与MI455X,Helios机架级设计挑战NVIDIA

AMD在Advancing AI 2026大会发布基于TSMC 2nm的Zen 6 EPYC Venice(最高256核)和CDNA5架构MI455X(432GB HBM4,40 PFLOPS FP4),推出Helios机架级参考设计(单rack 2.9 exaFLOPS FP4),宣称四年AI性能提升1000倍,获Meta、OpenAI等大客户长期合同。

Meta 其他 2026-07-20

Meta发布Muse Spark 1.1及API,低价策略转向闭源商业化

Meta正式发布Muse Spark 1.1多模态推理模型,并首次推出付费API,终结Llama开源传统。API定价仅为竞品25%,支持1M上下文窗口和Agent任务,标志着Meta从开源转向闭源商业化,意图通过低价抢占市场份额。

Other 其他 2026-07-20

Moonshot发布Kimi K3:2.8万亿参数开源MoE,定价$3/$15冲击AI格局

Moonshot AI发布Kimi K3,2.8万亿参数MoE架构(896专家激活16个),原生多模态,1M上下文。API定价$3/$15,显著低于竞争对手。开源权重将于7月27日公开,发布后GPU容量即耗尽。该模型在Arena.ai排行榜以1679分超越Fable 5。

Other 其他 2026-07-14

SANS发现49个IP分布式扫描MCP服务器,AI基础设施成安全新靶

SANS Internet Storm Center披露攻击者系统性地扫描MCP服务器、AI助手配置文件和本地LLM端点。49个独立IP发起MCP握手,利用CVE-2026-25536和CVE-2026-34742,标志AI基础设施成为攻击焦点。

OpenAI 其他 2026-07-09

OpenAI重返开源:GPT-oss系列以Apache 2.0许可部署云端卸载控制点

OpenAI发布GPT-oss-120b和GPT-oss-20b两款开源模型,采用Apache 2.0许可,可在单张80GB GPU上运行。但模型内置云端卸载机制,复杂任务自动转至闭源模型处理,表面开源实则保留核心控制点。

TSMC 其他 2026-07-01

Etched发布Transformer专用ASIC Sohu:推理性能声称达H100的20倍,正面冲击NVIDIA垄断

AI芯片初创公司Etched推出首款Transformer专用ASIC芯片Sohu,采用台积电N4P工艺,搭载144GB HBM3E。通过将注意力机制固化于电路,实现8卡服务器运行Llama 70B吞吐量达H100的20倍,每美元性能为140倍。累计融资8亿美元,首批机柜今夏出货,直接挑战NVIDIA推理市场地位。

Amazon 其他 2026-06-17

Introducing Amazon Bedrock Managed Knowledge Base for faster, more accurate enterprise AI applications

...

AMD 其他 2026-06-17

AMD MLPerf 6.0:MI350系列用MXFP4实现3.5倍代际提升,多节点训练首秀

AMD在MLPerf Training 6.0中提交了最全面的结果,包括首次多节点训练(FLUX.1在512 GPU上)和MXFP4训练配方。MI355X相比MI300X在Llama 2-70B上实现3.5倍性能提升,且与NVIDIA B200的差距缩小至5%以内。10家生态伙伴验证了可复现性。

NVIDIA 其他 2026-06-16

NVIDIA Blackwell MLPerf六连冠:NVLink与NVFP4定义AI训练新范式

NVIDIA在MLPerf Training 6.0中凭借Blackwell平台全面领先,首次提交所有7个基准测试,包括MoE模型。GB300 NVL72比GB200快1.6x,通过第五代NVLink实现72 GPU一体化,NVFP4低精度训练提升性能。展示了从单机到8192 GPU集群的线性扩展能力。

Cisco 其他 2026-06-11

思科AI Defense Policy Studio:用元提示将隐性策略转化为可审计护栏

思科推出AI Defense Policy Studio,通过一个AI助手引导策略所有者以对话方式定义自定义AI护栏。该工具使用元提示(meta-prompting)技术,将非正式指导转化为人类和模型可读的策略文档,并直接部署到思科AI Defense运行时进行执行。

NVIDIA 其他 2026-06-11

NVIDIA借DiffusionGemma并行生成,将本地AI推理控制权锁定于自家GPU

NVIDIA优化Google DeepMind的DiffusionGemma开源模型,该模型通过并行生成256 tokens(非逐token)实现4倍加速。在H100上达1000 tokens/sec,DGX Spark上150 tokens/sec,完全本地运行,无云成本。此举强化了NVIDIA GPU在计算密集型本地AI推理中的核心地位。

Google 其他 2026-06-09

GKE Inference Gateway前缀缓存:AI推理延迟降低92%,但锁定风险暗藏

Google Cloud推出GKE Inference Gateway,通过前缀缓存和模型感知路由,在Llama 3.1 8B模型上实现92.8%更短首令牌延迟和15.7%更高吞吐量。Snap实测缓存命中率达75-80%。但该技术深度绑定GKE Gateway API和Google生态,企业需警惕架构弹性损失。

NVIDIA 其他 2026-06-09

NVIDIA NVFP4:原生4位训练实现1.73倍吞吐跃升,锁定Blackwell生态

NVIDIA发布NVFP4格式,利用Blackwell原生硬件支持,在JAX/MaxText中实现4位混合精度预训练。相比FP8基线,Llama 3.1 405B在GB300上获得1.73倍吞吐提升,且精度无损失。该技术通过微块缩放、随机哈达玛变换等创新,显著降低训练成本,但深度绑定NVIDIA硬件生态。

NVIDIA 其他 2026-06-04

NVIDIA Nemotron 3 Ultra:以MoE与MOPD重构AI Agent控制平面,锁定企业推理成本

NVIDIA发布**Nemotron 3 Ultra**,一个550B参数MoE模型(55B活跃),专为AI Agent编排而设计。通过**多教师在线策略蒸馏(MOPD)** 与**Hybrid Mamba-Transformer**架构,其在**SWE-bench**等任务中实现5倍吞吐量提升与30%成本节省,标志着推理控制权从单一模型向分层Agent系统的转移。

NVIDIA 其他 2026-06-02

NVIDIA DGX Spark更新:一键部署本地AI代理,多节点集群扩展至400B模型

NVIDIA在Computex 2026发布DGX Spark软件更新,包括NemoClaw一键安装本地AI代理、Qwen3.6-35B模型在vLLM上实现2.6倍性能提升、以及Sync集群助手支持2-4节点通过ConnectX-7 200Gbps RoCE高速互联,使本地运行大规模自主代理和多节点分布式推理成为可能。

NVIDIA 其他 2026-06-01

NVIDIA RTX Spark:以SoC形态夺取PC控制权,AI算力革命或锁定生态

NVIDIA发布RTX Spark SoC,集成Blackwell GPU与20核Grace CPU(MediaTek设计),通过NVLink-C2C实现600GB/s互联,最高128GB统一内存,1 petaflop FP4 AI算力,支持本地运行1200亿参数大模型。此举从GPU供应商跃升为整机方案商,直接挑战Apple M系列、Qualcomm及x86阵营。

AMD 其他 2026-05-20

AMD Ryzen AI Halo与Max PRO 400系列:本地运行300B参数模型,但隐性锁定与工程短板并存

AMD发布Ryzen AI Halo开发者平台(128GB统一内存,支持200B参数模型)及Ryzen AI Max PRO 400系列处理器(首款x86客户端运行300B参数模型)。通过统一内存架构、ROCm优化和OEM合作,推动代理AI从云端走向本地,但实际性能受限于共享内存带宽与散热设计。

Cisco 其他 2026-05-07

思科与AMD联合基准测试:将AI网络控制点从GPU移至智能网卡与交换机

思科与AMD联合发布基于N9000 800G交换机、Pensando Pollara 400智能网卡和MI300X GPU的AI组网基准测试。通过IBPerf和MLPerf测试,展示在incast拥塞下P01/P99带宽均接近400Gbps线速,证明其架构能消除GPU空转,实现确定性性能。