英伟达 Vera Rubin 架构进入 H2 2026 量产,算力迈向智能体时代

随着 Blackwell 成为成熟的生产平台,英伟达的下一代 Vera Rubin 架构正进入 2026 年下半年量产与云平台铺货阶段,目标直指推理与智能体 AI 时代的新算力经济学。

规格跃迁

Rubin GPU 采用台积电 N3 工艺,集成 3360 亿晶体管,配备 288GB HBM4 显存(带宽 22 TB/s),推理算力达 50 PFLOPS(NVFP4);与之配对的 Vera CPU 拥有 88 个 Olympus ARM 核心。整柜的 Vera Rubin NVL72 集成 72 颗 Rubin GPU 与 36 颗 Vera CPU,提供约 3.6 EFLOPS 推理算力、260 TB/s 的 NVLink 6 互联带宽,并采用全液冷设计。英伟达称其相较 Blackwell 可实现约 5 倍机柜级推理性能、约 10 倍更低的推理 Token 成本。

为智能体而生

智能体与传统对话式 AI 的根本差异在于:它一次任务可能要执行数百乃至数千步推理、检索与工具调用,消耗的 Token 量呈数量级增长。因此每瓦 Token 数、每美元 Token 数成了新的数据中心核心指标。Rubin 为此专门设计了 Rubin CPX 加速器,以 128GB GDDR7 专攻超长上下文推理,单柜(NVL144 CPX)可达 8 EFLOPS、近 100TB 高速内存,适合 AI 编程助手、长视频分析等场景。

Blackwell 并未退场

英伟达通过软件持续优化 Blackwell 的生命周期:推理软件 Dynamo 1.0 可在受支持负载下把 Blackwell 推理性能提升最高 7 倍,已被 AWS、Azure、谷歌云、甲骨文云以及字节、美团、PayPal 等采用。Rubin Ultra 则计划于 2027 年下半年到来。对 CIO 而言,未来相当一段时间将是两代平台并存的运营格局。

解读

当算力竞争从谁更快转向每瓦每元能产出多少 Token,Rubin 标志着 AI 工厂从训练中心向推理与智能体中心的范式迁移。电力、内存带宽与互联,正取代单纯峰值算力,成为新的瓶颈与护城河。

信息来源:InfotechLead、Thunder Compute、SourceBySpec

声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。