跳到主要内容

6 篇博文 含有标签「HBM4」

HBM4 high bandwidth memory

查看所有标签

AI 算力周报(9.1-9.5):DeepSeek 订 16 万颗昇腾 950DT、英伟达 129 亿美元收购 Hugging Face、Rubin Ultra 显存减配

· 阅读需 9 分钟
Industry Research Team

本周(2026 年 9 月 1 日–5 日)AI 算力行业的题眼,是两条相反方向的成本重构:海外,英伟达以史上最大并购吞下开发者生态入口,同时给旗舰减配显存——"内存太贵"倒逼硬件从单卡堆料走向系统级互联;国内,DeepSeek 16 万颗昇腾订单把"国产替代"从口号变成头部实验室的资产负债表决策,字节近 300 亿美元融资为算力扩张装上杠杆。


1. DeepSeek 拟购 16 万颗昇腾 950DT:国产算力的"标志性订单"

彭博社 9 月 4 日报道,DeepSeek 计划在内蒙古乌兰察布新建的约 1GW 数据中心部署至少 16 万颗华为昇腾 950DT,主要用于推理而非训练。按每颗约 11.1 万元的市场价估算,订单总额约 178 亿元人民币(约 25.6 亿美元)——这是迄今已知规模最大的昇腾集群,是半年前深圳首个万卡级集群的 16 倍。

三个关键读数:

  • 主动选择,而非被迫替代:DeepSeek 是公认最会"榨干"算力的实验室。创始人梁文锋 7 月曾直言:华为超节点能完成 GB300 的任务、延迟没有明显差别,但约需 4 颗昇腾才抵 1 颗英伟达、技术上落后约两年。选择昇腾跑推理,是在综合成本、供应链安全与本土化后的理性决策——推理对软件生态依赖较浅,正是国产芯片的突破口;
  • 瓶颈在供给端:受高端内存(HBM)短缺制约,昇腾 950DT 今年产量仅数十万颗(2026 年全部昇腾 die 计划约 160 万颗),DeepSeek 希望加购更多但产能所限,整单交付或需一年以上——国产 HBM 与先进封装成为整条链的胜负手;
  • 过渡性押注:DeepSeek 同时在与中芯国际合作开发自研推理芯片,并于 6 月完成约 500 亿元融资、继续洽谈数十亿美元基建融资。国产算力的终局是多元自主,而非单一依赖。

单颗 950DT:144GB HBM、4.0TB/s 带宽、2.0TB/s 互联,原生支持 FP8/FP4/HiF8,详见昇腾 950DT 规格页

2. 英伟达 129.3 亿美元收购 Hugging Face:买下"铲子的交易所"

当地时间 9 月 3 日,英伟达宣布以 129.3 亿美元收购全球最大开源 AI 平台 Hugging Face,超过 2020 年 69 亿美元收购 Mellanox,成为其史上最大并购。交易含约 119 亿美元股权款与最高约 10 亿美元员工留任计划,预计 2027 年上半年完成,待监管批准。

Hugging Face 托管超 300 万个模型、50 万个数据集,服务超 1800 万名开发者。黄仁勋承诺平台继续开放中立运营:不强制绑定英伟达资源、开源属性完整保留。

解读:算力霸主的护城河从"芯片 + 网络 + 软件栈"一路修到了"模型分发 + 开发者生态"——卖铲人开始收购铲子的交易所。平台的"中立性"承诺能否兑现,将成为全球监管与竞争性云厂商持续盯防的焦点;对国内产业而言,模型托管、权重分发这类"轻资产 AI 基础设施"与芯片一样,正在成为大国科技博弈的卡点。

3. Rubin Ultra 显存减配:内存占 TCO 40% 后的算术题

SemiAnalysis 最新报告(科创板日报 9 月 3 日转引)显示,英伟达已将旗舰 Rubin Ultra 的 HBM 配置从 HBM4E 12-Hi(384GB 档)下调至 HBM4 8-Hi(192GB),三星正配合开发 8 层产品。

  • 动因:HBM/DRAM 涨价后,内存已占整机 TCO 约 40%;减配后 HBM 成本降超 50%,即便计入 2026 年 HBM 涨价预期,内存占总资本开支比例也将从 40% 压至 28%;
  • 钱去了哪:转向 Scale-up 纵向扩展网络——以 NVL576 NPO 方案测算,光模块取代机架间互连后,Scale-up 网络占机架总支出比例从 4% 升至 12%
  • 连锁反应:TrendForce 显示英伟达自 2026 Q3 起并行评估 HBM4E 8-Hi / 12-Hi / HBM4 8-Hi 多套方案,部分云厂商也在考虑下调下一代自研 ASIC 的 HBM 容量。

连定价权最强的英伟达都给旗舰"减配求量",等于官宣:当前 AI 硬件最紧的约束是内存(美光高管称新增内存供应 2028 年前难有实质放量),单卡堆料的军备竞赛告一段落,硬件价值重心正迁移到光互联、CPO、高速交换与 PTFE 背板。华泰测算 2027 年存储供需缺口将从约 -7% 收窄至 -3%——上行周期未逆转,但从"普涨"走向"结构性紧缺"。

详见本站已同步更新的 Rubin Ultra 规格页HBM4 量产竞速分析

4. 推理 ASIC 军备提速:谷歌"一年两款",Jalapeño 规格落地

  • 谷歌 TPU 迭代周期从两年一代压缩至"每年两款"(华创证券 9 月 4 日研报):第八代已拆分为训练(8t)与推理(8i)双架构,8i 把内存/算力配比拉到 8t 的 1.65 倍,专为推理放量设计;
  • OpenAI Jalapeño 规格披露:6 堆栈 HBM4 共 216GB、带宽 15.4TB/s700W,围绕投机解码设计;OpenAI 称在 DeepSeek R1 负载下 tokens/kW 达 GB300 的 1.7 倍;RTL 冻结到流片 9 个月,首批硅片后约 10 周承载 ChatGPT 流量。详见规格页(本站已更新);
  • workload-specific 时代开场:训练、推理、推荐各自长出专用芯片,上游 HBM/封装/光互联的供应节奏必须跟上"半年一代"。

5. 国内动态:字节 296 亿美元加杠杆,摩尔线程 Token 超节点投产

  • 字节跳动获约 296 亿美元融资安排(彭博 9 月 3 日),较最初约 200 亿美元目标大幅上调,用于数据中心与 AI 基建;另据产业报道正洽谈在内蒙古新增 5-6GW 算力产能——中国 AI 公司迄今最大规模基建融资之一,算力正被当作可融资、可证券化的重资产经营;
  • 摩尔线程 × 趋境科技 "Token 超节点"投产(光明网 9 月 4 日):以 MTT S500 承担 Prefill 与 KV Cache 生成、高带宽 GPU 专注 Decode 的 PD 异构方案,实测平均生成速度超 50 TPS、KV Cache 命中率超 90%、稳定性 99.9%,已承接头部模型厂商官方业务流量——超节点竞争维度从"单卡参数"转向"单位 Token 生产成本";
  • OpenAI 发布 GPT-6 Astra(9 月 4 日):超 10 万颗 GPU 在 Stargate 集群完成训练,推理放量与超大规模集群仍是全球算力叙事主线;
  • SemiAnalysis 基准:AMD MI355X 新提交在 AgentX 基准低交互区间tokens/$ TCO 击败 B300——vLLM + LMCache 软件栈的贡献首次被独立机构量化认可。

6. 市场:中美算力资产一涨一调

美东 9 月 4 日,美国 8 月非农仅增 8.9 万人(预期 16 万),10 年期美债收益率回落至 3.78%,成长股走强:科技板块 XLK 周涨 4.2%,英伟达周涨 8.7% 收于 230.36 美元。A股 9 月 4 日反向回调:AI 算力芯片板块 -1.99%、服务器 -2.51%、超节点 -2.86%,浪潮信息跌停、寒武纪 -2.54%——基本面无恶化(博通、戴尔、中际旭创订单与财报持续验证景气),更多是交易层面获利兑现。

下周起三连催化密集:CIOE 光博会(9/9-11)→ 华为全联接大会(9/17-19)→ 云栖大会(9/22-24)。国产超节点从"发布会 PPT"到"批量交付"的成色,将迎来集中检验。

本周一句话

内存太贵改变了所有人的算法:英伟达给旗舰减配显存、把钱投给互联;DeepSeek 用 16 万颗昇腾买推理确定性;谷歌把 TPU 迭代压到半年一代。2026 年 Q4 起,"每兆瓦/每美元 token 数"将取代"单卡 PFLOPS",成为算力采购的第一指标。


相关链接

参考资料


本文基于彭博社、科创板日报、SemiAnalysis、TrendForce、华创证券研报及光明网等公开报道整理。订单金额与市场数据为媒体/机构预估口径,实际以相关公司正式披露为准。

HBM4 从送样竞速进入量产爬坡竞速:SK 海力士率先交付 Rubin、美光产能翻倍、三星直逼王座

· 阅读需 6 分钟
Industry Research Team

9 月第一周,存储行业传来三组关键信号:SK 海力士面向英伟达 Vera Rubin 平台量产交付全球首款 12 层 HBM4;三星 Q2 HBM 份额飙升至 33%、直逼王座;美光宣布年底 HBM 月产能翻倍至约 10 万片晶圆。 HBM4 的竞争,已经从"谁能造出来"变成"谁能最快量产爬坡、谁绑定的客户最深"。


1. 三巨头战报:领跑者、追赶者与搅局者

维度SK 海力士三星电子美光
HBM4 关键节点2026 年中向 Vera Rubin 量产交付 12 层 HBM4(全球首款完整质量认证)2026 年 2 月全球首家大规模量产出货2026 Q2 量产 12 层 HBM4,批量出货
DRAM 核心裸片1b(第五代 10nm 级)1c(第六代)
Base Die 代工台积电 12nm自家 4nm拟转台积电(1γ 工艺代)
2026 HBM4 份额预测~54%~28%~18%
Q2 HBM 营收份额50%(环比 -14pct)33%(环比 +12pct)18%
HBM 产能~15–20 万片/月~15–20 万片/月年底冲刺 10 万片/月(现为 4–5 万)

三个关键读数:

  • 三星的反扑是真的:从去年 Q2 份额低至 15%(落后美光 6 个百分点)到今年 Q2 的 33%,三星用一年时间把与 SK 海力士的差距缩小到 17 个百分点。三星预计 HBM4 将占其下半年 HBM 收入的 60% 以上,且现有 HBM4 产能已被客户预订售罄,2026 年 HBM 总产能计划提升约 50%;
  • 美光的追赶也是真的:CEO 梅赫罗特拉透露 12 层 HBM4 爬坡速度约为 HBM3E 的两倍、累计收入已超 10 亿美元;年底若如期达成 10 万片月产能,与两强的差距将缩小一半;
  • SK 海力士的护城河依然深:与英伟达签署多年期 HBM/DRAM 供应协议、率先完成 2027 年 HBM4 价格谈判,在英伟达 HBM4 采购中占比约 60%(乐观情形 70%)。

2. 变局核心:封装比 DRAM 制程更值钱

HBM4 与 HBM3E 时代最大的不同,是胜负手从存储颗粒转向了封装与 Base Die

  • I/O 通道数从 1024 条翻倍至 2048 条,单颗 12 层封装吞吐超 2TB/s,能效较前代提升逾 40%;
  • Base Die 首次引入晶圆代工厂先进逻辑工艺——SK 海力士用台积电 12nm,三星用自家 4nm,美光计划在 1γ(首次导入 EUV)世代转由台积电代工;
  • 存储原厂与代工厂的协作深度,第一次成为决定出货速度的关键变量——这正是 Hot Chips 2026 上"三星 HBM Base Die 逻辑工艺化"议题的产业注脚。

SEMI 数据显示,2026 年全球 HBM 市场规模预计增长 58% 至 546 亿美元,约占 DRAM 市场四成。行业预计 HBM4 销售占比将在 2026 年 Q4 正式超越 HBM3E,成为市场主流。

3. 客户端信号:Rubin 加码,Rubin CPX 重生

需求端同样在 9 月出现重要变化:

  • Vera Rubin 全面量产(详见本站专文):每颗 Rubin GPU 搭载 288GB HBM4、带宽 22TB/s,NVL72 整柜 75TB 快速内存——HBM4 供给直接决定 Rubin 出货上限,这也是英伟达把"先进晶圆与 HBM 供应"列为当前第一约束的原因;
  • Rubin CPX 项目重启:据 CFM 闪存市场 9 月 2 日简讯,英伟达重启此前搁置的 Rubin CPX 机柜项目,内存规格由 128GB GDDR7 改为 168GB HBM4,机架改为独立 MGX ETL 设计,客户可选 64/128/192/256 颗 GPU 配置——推理专用卡也全面转向 HBM4,进一步放大了 HBM4 需求;
  • 供给协议长期化:英伟达已与 SK 海力士、美光签署多年期 HBM 及 DRAM 供应协议,锁供给、锁价格、锁产能成为巨头标配动作。

4. 下半场:HBM4E 已经鸣枪

下一代产品的竞争在 2026 年同步开启:

  • SK 海力士:HBM4E 送样提前至 2026 年年中(原计划下半年),COMPUTEX 2026 已展出 12 层样品,单引脚速率最高 16Gbps、单堆栈带宽约 4TB/s,计划 2027 年量产
  • 三星:2026 年 Q2 起向头部客户交付业界首批 HBM4E 样品(48GB),目标 2027 年拿下 HBM4E 市场 50% 以上份额
  • 美光:HBM4E 预计 2027 年量产,首批样品采用 1γ 制程 DRAM。

5. 对采购方与投资观察者的启示

  • 供应商组合成为第一优先级采购变量:同样买 Rubin 平台,采用哪家 HBM 供应商的整机,交付周期可能相差数月;
  • 国产链条的机会窗口:HBM 供不应求叠加出口管制,长鑫等国产存储玩家的 HBM 进展值得持续跟踪——国产 AI 芯片(昇腾 950 系列等)对 HBM 的需求同样在放量;
  • 跟踪三个领先指标:头部云厂商 Rubin 机架采购量、HBM 设备供应商订单(美光已加大 PO)、HBM4E 送样→量产的时间差。

相关链接

参考资料


本文基于 2026 年 9 月初 Counterpoint Research、CFM 闪存市场及韩媒报道整理。份额与产能数据均为研究机构/供应链预估口径,实际以各原厂财报为准。

HBM4 量产元年:三星良率突破80%、三巨头齐过英伟达认证,AI 算力供给的最后一道瓶颈

· 阅读需 6 分钟
Industry Research Team

如果说 2025 年是 HBM3E 的产能爬坡年,那么 2026 年就是 HBM4 的量产元年。NVIDIA Vera Rubin 与 AMD MI400 两代旗舰同时押注 HBM4,让这块"AI 芯片上的内存"第一次成为决定整机柜交付节奏的战略物资。而 8 月密集披露的良率与认证数据,正在重写全球 HBM 供应版图。


1. 黄金良率突破:三星六个月从不足六成冲上 80%

据韩国《首尔经济日报》8 月 9 日披露,三星电子 HBM4 良率已于 8 月初正式跨过 80% 的"黄金良率"门槛——较其原定年底达成的目标提前了四个多月

时间节点三星 HBM4 良率备注
2026 年 2 月(量产启动)不足 60%产线爬坡期
2026 年 8 月初约 80%跨过规模量产 / 稳定盈利分水岭

半导体行业素有"80% 良率为黄金良率"之说——它既是晶圆厂竞争力的标尺,也被视为大规模商业化供给的财务转正点。推动这一跃迁的关键,是三星在 热压非导电薄膜(TC-NCF)键合工艺 上的突破,以及底层 1c DRAM 良率早已站上 80% 所提供的稳定基底。同期,三星 HBM4E 可靠性测试良率也已突破 70%。

业界评估,SK 海力士的 HBM4 良率同样迈入 80% 区间。两大巨头在量产品质上的差距正被快速抹平。


2. 供应版图:SK 海力士握有 Rubin 六至七成分配

黄仁勋 6 月 5 日在首尔公开确认:三星、SK 海力士、美光三家均已通过 Vera Rubin 的 HBM4 认证——这是三大存储厂首次同时获得同一平台的公开认证。

但认证只是"进门券",分配份额才是话语权

厂商2026 年 Rubin HBM4 分配(估算)备注
SK 海力士60%–70%凭借 HBM3/3E 世代积累的客户关系与 MR-MUF 封装工艺
三星25%–30%良率跃迁后份额快速提升
美光剩余部分HBM4 曝光有限,份额相对稳定

Counterpoint Research 预测 2026 年 HBM4 市场格局为 SK 海力士 54% / 三星 28% / 美光 18%。三星已设定阶梯式追赶目标:Q3 HBM4 营收环比三倍增长、下半年 HBM4 占 HBM 总营收超 60%、年底 HBM 整体市占率向 38% 靠拢。


3. 真正的瓶颈:从晶圆转向"后端堆叠"

随着前端良率企稳,AI 加速器供应链的节奏,不再取决于"能产多少晶圆",而取决于后端堆叠、键合、测试、出货的速度

  • 行业分析师将 HBM 堆叠列为 AI 芯片供应链第二严重的瓶颈,仅次于 TSMC 的 CoWoS 先进封装产能。
  • HBM 占 2026 年 DRAM 晶圆产量的约 25%;每片 HBM 晶圆消耗约 3–4 倍于普通 DRAM 晶圆的资源(额外 TSV 与堆叠步骤),每redirect一片晶圆就等于从现货市场抽走 3–4 单位商品内存。
  • 三星正考虑将部分传统内存后端产线(天安、温阳)迁往越南以释放 HBM 后端产能——侧面印证后端吞吐已是整条链最紧的环节

4. HBM4 规格速览:带宽与能效的代际跃迁

规格HBM4(12-Hi / 16-Hi)HBM4E
单栈容量36 GB / 48 GB
引脚速率11.7–13.0 Gbps16 Gbps
单栈带宽最高 3.3 TB/s最高 3.6 TB/s
总线位宽2048-bit
能效较 HBM3E 提升 40%
热阻 / 散热改善 10% / 提升 30%

三星 HBM4 于 2026 年 2 月量产,11.7 Gbps 的引脚速率已超出 Vera Rubin 兼容所需的 8 Gbps 行业基线;HBM4E 样品则于 5 月 29 日率先发往主要客户。


5. 价格权力延续至 2027:供给仍将是紧平衡

TrendForce 判断,HBM 供应商的定价权将贯穿 2027 年,原因是供给持续受限:

  • 2027 年 HBM bit 出货量预计年增 50%–60%,但仍跟不上需求增速,市场维持紧缺;
  • 行业已预期显著涨价;
  • 对 NVIDIA 与 AMD 而言,一个更强的三星意味着更多供货选择与更从容的交期——在内存成为 AI 服务器最紧一环的市场里,第二、第三供应商的存在本身就是缓冲。

对整机柜而言,HBM 成本已是最大推手:Rubin Ultra 机柜预估售价高达 2100 万美元,HBM 占其中相当比重。


6. 对中国的启示:HBM 出口管制加速国产迭代

HBM 是当前 AI 芯片管制的核心环节之一。在海外 HBM4 军备竞赛白热化的同时,国产 HBM 技术迭代被同步推快——华为昇腾路线图已明确将"推动国产 HBM 技术迭代"写入产品节奏(950 系列推进国产 HBM 配套,960/970 系列规划于 2027–2028 年陆续推出)。

短期看,HBM4 的紧缺会直接传导到 Rubin / MI400 的交付节奏;长期看,谁能锁定稳定的 HBM4 供给,谁就握住了 2027 年 AI 算力扩张的阀门。

相关链接

参考资料


本文基于 TrendForce、Seoul Economic Daily、TechTimes 等 2026 年 8 月公开报道整理。HBM 分配份额与市占率为第三方机构估算,非厂商官方确认数据。

AMD Advancing AI 2026明日开幕:MI400三款CDNA5齐发,Helios机架3 exaFLOPS,OpenAI+Meta锁定12GW大单

· 阅读需 5 分钟
AI Hardware Analyst

AMD 已确认旗舰 AI 大会 Advancing AI 2026 将于 2026年7月22-23日 在旧金山 Moscone Center 举行,主题演讲定于 7 月 23 日,由董事长兼 CEO 苏姿丰(Lisa Su)主持。大会将补全 Instinct MI400 系列 的可用性时间线、定价与独立基准数据。

1. Instinct MI400 家族:三款 CDNA 5 加速器

AMD 在 CES 2026 已完整公布 MI400 产品矩阵,三款加速器均基于 CDNA 5 架构、TSMC 2nm 制程,按精度与场景分工:

型号定位关键规格
MI455X(旗舰)大规模训练/推理(机架级)3200 亿晶体管、12 chiplet、432 GB HBM4(12×36GB)、19.6 TB/s、FP4 40 PFLOPS / FP8 20 PFLOPS
MI440X(企业版)本地企业 AI(8 卡节点)低精度 AI(FP4/FP8/BF16),可直接替换 MI300/MI350,兼容既有机房供电散热
MI430X(HPC/主权 AI)高精度科学计算 + AI完整 FP32/FP64,已部署橡树岭 Discovery、法国首台 exascale Alice Recoque

MI455X 与 MI440X 主攻低精度 AI(FP4/FP8/BF16),MI430X 补齐传统 HPC 高精度需求——通过"按精度裁减执行单元"提升能效与性价比。三者均支持 UALink(首批兼容该标准的加速器)与 Infinity Fabric 片间互联,机架扩展走 Ultra Ethernet。

苏姿丰在 2026 Q1 财报会上确认:已向核心客户送样 MI455X GPU,客户需求"超过公司对 2027 年的内部预期"。

2. Helios 机架:3 exaFLOPS 单柜

AMD 以 Helios 机架级平台 切入超大规模市场:

指标Helios 机架
加速器72 × MI455X
聚合 HBM431 TB
总内存带宽1.4 PB/s
单柜算力最高 3 AI exaFLOPS(Q3 交付目标)
目标客户超大规模训练/推理集群

Helios 采用 AMD 自研 Zen 6 EPYC Venice CPU(每机架 18 颗)+ Pensando Vulcano 800G NIC,通过开放 ROCm 软件栈整合;AMD 还规划了 双宽 128 卡 Helios 变体,单柜算力可推高至 3 AI exaFLOPS 上限。更长远的 MI500 系列(CDNA 6、2nm、HBM4E) 计划 2027 年推出,官方称相对 MI300X 的 AI 性能提升最高达 1000 倍

3. 12GW 大单:OpenAI + Meta 双重背书

AMD 手握两份历史级别的算力协议,合计约 12 GW,全生命周期潜在收入或达 1000 亿美元

客户规模首批部署结构
OpenAI6 GW(多代产品)首期 1 GW,2026 H2 用 MI450"compute-for-upside":授予最多 1.6 亿股认股权证,随里程碑与股价目标分阶段归属
Meta6 GW定制 MI450 芯片,2026 H2 起部署于下一代数据中心

财务预期

指标2026 预测
MI400 系列营收~$72 亿(约占数据中心销售 25%)
数据中心 GPU 营收~$150 亿(同比 +114%)
数据中心总营收或达 $287 亿(同比 +73%)

⚠️ 执行风险:AMD 已提示 MI450 于 Q3 量产将拖累毛利率(新品低于公司平均);先进制程与先进封装(TSMC CoWoS)产能仍是主要约束。

产业解读

  1. CUDA 护城河被撬动:当 Meta、OpenAI 这类构建全球最大训练集群的公司押注 AMD 硅片,AMD 长期 5–7% 的 GPU 份额天花板正被打破。
  2. 内存优势差异化:432 GB HBM4 / 19.6 TB/s 相较 NVIDIA Rubin 的 288 GB 具备容量优势,对大模型推理(KV Cache 受限场景)尤为关键。
  3. 对标节奏咬紧:MI450 与 NVIDIA Vera Rubin 同在 2026 H2 放量,两强在 HBM4 供应、CoWoS 产能上正面争夺。

相关链接

参考资料


本文写于 Advancing AI 2026(7月22-23日,明日开幕)前夕;大会主题演讲定于 7 月 23 日由苏姿丰主持,届时将揭晓 MI400 最终上市时间、定价与独立基准数据,我们将同步更新。

NVIDIA Vera Rubin正式出货:首台VR200 NVL72交付,三星HBM4量产,Rubin Ultra机柜天价

· 阅读需 5 分钟
Industry Research Team

2026年7月,NVIDIA 下一代 AI 计算平台 Vera Rubin 正式启动首批出货,接替 Blackwell 架构,并计划在 2026 年下半年进入大规模量产。首批客户包括微软、谷歌、亚马逊、Meta、Oracle 等大型云服务商。

1. 全球首台 VR200 NVL72 交付(里程碑)

CoreWeave 联合 Dell 宣布,全球首台 NVIDIA Vera Rubin VR200 NVL72 机柜已正式交付,并一次性通过 L11 全机柜级硬件诊断测试。这标志着 Rubin 从路线图走向实物,供应链核心环节(HBM4、先进封装、液冷、超高功率电源)未出现重大卡点。

VR200 NVL72 核心配置

指标Vera Rubin VR200 NVL72
机柜代号Oberon
GPU72 块 Rubin GPU
CPU36 颗 Vera CPU
单 GPU 显存288 GB HBM4
单 CPU 内存1.5 TB LPDDR5X
整柜 HBM420.7 TB(20,736 GB)
整柜 LPDDR5X54 TB
互联NVLink 6 全互联
推理性能~3.6 exaFLOPS 级别
散热液冷
代际提升单 GPU 计算约 3.5×、内存带宽约 2.8×(对比 Blackwell)

Vera CPU 集成 88 个定制 Olympus ARM 核心,与 GPU 间互联带宽 1.8 TB/s,可作为 GPU 显存扩展池。NVIDIA 已于 5 月完成对 Anthropic、OpenAI、xAI 及 Oracle Cloud 的首批 Vera CPU 交付。

2. 三星 HBM4 量产:关键瓶颈松动

2026年7月8日,三星电子正式启动面向 Vera Rubin 平台的 HBM4 量产,据报道其 HBM4 量产良率达到 70%(超出 60–65% 的初始预期)。这一关键供应链环节的确认,为 Rubin 大规模部署扫清障碍。

HBM 供应格局(2026 Q1)份额
SK 海力士45%
三星40%
美光15%

HBM4 采用 8 层堆叠(12 层设计计划 2028 年),价格约为 HBM3e 的 2.8 倍。TrendForce 预测 HBM 供给将年增 65%,到 2027 Q4 HBM4 占总产出的 35%。

3. Rubin Ultra 天价:HBM 成本主导

据美国银行全球研究(BofA Global Research)测算,Rubin 一代将把单台服务器成本推向历史新高:

成本项Rubin VR200(Oberon)对比
单柜 HBM4 用量20,736 GB
HBM4 单价~$18.40 / GBBlackwell(HBM3e)~$11.26 / GB
仅 HBM4 成本~$38.2 万尚未计入 LPDDR5X
Rubin Ultra 机柜预估售价~$2,100 万IT 之家 / BofA 估算

4. Rubin Ultra 设计调整:原 4 芯片方案取消(据 SemiAnalysis)

半导体研究机构 SemiAnalysis(2026-06-30) 披露,GTC 2026 发布的原版 4 芯片 Rubin Ultra GPU 已被取消,2027 年实际出货的版本规模与性能均缩减约一半:

  • 取消原因:原版在单一 CoWoS-L 封装内集成 4 颗计算 die + 16 颗 HBM4E,基板在 4 die 配置下出现翘曲(warpage),导致计算 die 与基板接触失效、良率崩塌;替代方案 CoPoS 量产要等到 2028 年底以后,赶不上 2027 节点。
  • 新方案:改为 双 die(与标准 Rubin 同构)+ HBM4E,单 GPU 约 384 GB HBM4E(高于标准 Rubin 的 288 GB),但总算力与带宽仅为原版一半;为逼近原设计的聚合算力,NVIDIA 预计在 Kyber 机架内以"2+2"板级配置 拼出四 die 等效规模。
  • Kyber 机架延迟:配套 Kyber NVL144 机架因中板 PCB 制造难题推迟 12 个月以上至 2028 年,800V 直流供电方案同样推迟至 2028 年。

⚠️ 口径提示:NVIDIA 未就上述设计调整发表官方评论;X 平台亦有声音认为"芯片数量并未改变、属旧闻翻炒"。本段基于 SemiAnalysis 公开报告整理,最终以 NVIDIA 官方披露为准。我们已在 Rubin Ultra 预览卡 中标注"规格待官方确认"。

产业解读

  1. "Never doubt"时刻兑现:Rubin 首发交付一次性通过 L11,打消了市场对"Rubin 延期"的疑虑,2026 H2 AI 算力供应确定性提前锁定。
  2. 专为 Agentic AI 设计:Rubin 面向智能体工作流、超长上下文推理,将进一步压低万亿参数模型的训练/推理成本曲线。
  3. HBM 是全链条赢家:单机柜 20.7 TB HBM4 用量巨大,SK 海力士、三星、美光及先进封装(CoWoS-L)、液冷、电力改造全链条受益,同时也成为成本与产能的最大约束。

相关链接

参考资料


本文持续跟踪 Vera Rubin 量产爬坡与 HBM4 供应链动态。

AMD MI455X CES 2026 震撼发布:4年AI芯片性能涨1000倍

· 阅读需 7 分钟
Industry Research Team

2026年1月5日,在CES 2026(国际消费电子展)首日,AMD董事会主席兼CEO苏姿丰博士在主题演讲中震撼发布:Instinct MI400系列AI加速卡

其中最引人注目的是MI455X——AMD史上性能最强的AI加速卡,采用2nm + 3nm混合制程432GB HBM4显存、FP4算力高达40 PFLOPS(FP8为20 PFLOPS)。

核心亮点

  • MI455X:FP4算力40 PFLOPS,FP8算力20 PFLOPS,相比MI355X提升10×
  • MI450:高性价比版,FP4算力28 PFLOPS,288GB HBM4
  • 制程升级:全球首款采用2nm + 3nm混合制程的AI芯片(GCD用2nm,MCD用3nm)
  • 显存升级:从MI350X的288GB HBM3e升级到432GB HBM4(MI455X)
  • 带宽升级:从MI350X的8 TB/s升级到19.6 TB/s(提升2.45×)
  • 架构升级:从CDNA 4升级到CDNA 5
  • 量产时间:MI455X 2026年Q4,MI450 2026年Q3

MI400系列完整规格

📌 重要更正(2026-06-16):经官方规格核对,MI455X 显存为 432GB HBM4(非早期报道的 288GB),FP4 算力为 40 PFLOPS。特此更正。

型号定位显存FP4 算力FP8 算力TDP(推测)
MI455X旗舰训练+推理432GB HBM440 PFLOPS20 PFLOPS~1,000W
MI450高性价比训练288GB HBM428 PFLOPS14 PFLOPS~800W
MI440X企业推理216GB HBM425 PFLOPS12.5 PFLOPS~600W
MI430XHPC / 科学计算192GB HBM420 PFLOPS10 PFLOPS~500W
MI400X通用 / 边缘推理128GB HBM412 PFLOPS6 PFLOPS~400W

关键升级(vs MI350系列)

  • 显存:HBM3e → HBM4,容量提升 50%(432GB vs 288GB)
  • 带宽:19.6 TB/s(vs MI350的 8 TB/s,提升 2.45×
  • 算力:FP4 40 PFLOPS(vs MI355X的 20 PFLOPS,提升
  • 制程:2nm + 3nm 混合制程(GCD用2nm,MCD用3nm)
  • 架构:CDNA 5(vs MI350的 CDNA 4)

与MI355X的性能对比

指标MI355X(2025)MI455X(2026)提升
FP4算力20 PFLOPS40 PFLOPS
FP8算力10 PFLOPS20 PFLOPS
显存容量288GB HBM3e432GB HBM41.5×
显存带宽8 TB/s19.6 TB/s2.45×
制程TSMC 3nm2nm + 3nm 混合新一代
架构CDNA 4CDNA 5新一代
TDP800-1000W~1,000W持平

苏姿丰在CES 2026上说

"4年前,MI250的AI性能是X。现在,MI455X的性能提升了1000倍。这就是AI芯片的进步速度。"

CDNA 5架构详解

MI400系列采用CDNA 5架构(MI355X用CDNA 4):

关键升级

  1. Matrix Core 升级:支持FP8/INT8/FP16,稀疏化加速
  2. HBM4控制器:支持12层HBM4( vs HBM3e的8层)
  3. Infinity Fabric 4.0:Die间/Die-GPU间互联带宽提升50%
  4. 稀疏化原生支持:MoE模型的Expert Parallel优化
  5. 长上下文优化:1M+ token KV Cache加速

与NVIDIA Blackwell / Rubin对比

指标AMD MI455XNVIDIA B200NVIDIA Rubin R200(2026 Q4)
FP4算力40 PFLOPS20 PFLOPS(稀疏 45 PFLOPS)~40 PFLOPS(推测)
FP8算力20 PFLOPS10 PFLOPS(稀疏 22.5 PFLOPS)~20 PFLOPS(推测)
显存432GB HBM4192GB HBM3e288GB HBM4
显存带宽19.6 TB/s8 TB/s13 TB/s
TDP~1,000W700-1000W~1,000W
制程2nm + 3nm 混合TSMC 4npTSMC 3nm
量产时间2026年Q42024年Q42026年Q4
软件生态ROCmCUDACUDA
优势显存容量、开放生态生态最成熟下一代架构
劣势软件生态差距显存较小尚未发布

结论:MI455X在FP4/FP8算力显存容量/带宽上领先B200,但软件生态仍是短板。与Rubin R200相比,纸面性能相近,但Rubin有CUDA生态护城河。

量产时间表

时间事件
2025年6月12日Advancing AI大会首次公布MI400系列规格
2026年1月5日CES 2026正式发布MI455X/MI450/MI440X
2026年Q3MI450开始送样
2026年Q4MI455X正式量产
2026年Q4MI440X(企业推理版)发布
2027年Q1MI430X/MI400X(HPC/边缘推理版)发布
2027年MI500系列(下一代)

AMD AI芯片路线图(2025-2027)

时间产品制程备注
2024年Q4MI325XTSMC 5nmHBM3e升级版
2025年Q3MI355X(MI350系列)TSMC 3nmCDNA 4,288GB HBM3e
2026年Q4MI455X(MI400系列)2nm + 3nm 混合CDNA 5,432GB HBM4
2027年Q1MI500系列TSMC 2nm(推测)下一代,性能再提升

软件生态:ROCm的进步与挑战

✅ 进步

  • PyTorch 2.5+:原生支持MI300X/MI455X
  • Hugging Face Transformers:官方支持AMD GPU
  • vLLM 0.8+:MI300X推理支持(实验性)
  • JAX:AMD正在适配(对标Google TPU)

⚠️ 挑战

  • 框架优化度:PyTorch在AMD GPU上的性能仍低于NVIDIA
  • 算子覆盖率:部分小众算子需要自己写HIP代码
  • 多卡通信:RCCL(对标NCCL)性能仍有差距
  • 开发者生态:教程、案例、社区活跃度远不及NVIDIA

与竞品对比

厂商产品FP4算力显存量产时间优势劣势
AMDMI455X40 PFLOPS432GB HBM42026 Q4显存容量最大、开放生态软件生态差距
NVIDIAB20020 PFLOPS192GB HBM3e2024 Q4生态最成熟显存较小
NVIDIARubin R200~40 PFLOPS288GB HBM42026 Q4下一代架构、CUDA生态价格昂贵
华为昇腾910C~1.6 PFLOPS64GB HBM2026 Q2中国本土化受出口管制
GoogleTPU 8t~9.2 PFLOPS~256GB HBM3e2027年底与Gemini集成仅Google Cloud

行业影响

1. 对NVIDIA的冲击

AMD MI455X在纸面性能上已经追上B200(FP4 40 PFLOPS vs 20 PFLOPS),甚至在显存容量上大幅领先(432GB vs 192GB)。

  • NVIDIA有CUDA生态护城河
  • NVIDIA有Vera Rubin平台(整体方案,2026 Q4发布)
  • AMD只能卖单卡/单机,NVIDIA卖AI工厂
  • MI455X量产时间(2026 Q4)与Rubin R200相同,正面竞争

2. 对国产芯片的压力

MI455X的发布意味着:国际主流AI芯片在2026年将进入2nm + HBM4时代

国产芯片(华为昇腾、寒武纪、沐曦等)需要:

  • 在2026-2027年追上5nm + HBM3e水平
  • 否则差距将从"1代"扩大到"2代"

3. 对云服务商的意义

MI455X给云服务商提供了NVIDIA之外的第二选择

  • 微软Azure:已部署MI355X,可能跟进MI455X
  • 谷歌Cloud:自研TPU,不会用AMD
  • 亚马逊AWS:自研Trainium/Inferentia,不会用AMD
  • 阿里云、腾讯云:可能采购MI455X作为NVIDIA替代方案

相关芯片

参考资料


本文基于AMD CES 2026官方公告、百度百科及知乎智东西现场报道整理,规格参数已核对官方来源。2026-06-16更新:修正MI455X显存(288GB → 432GB)和算力(FP8 6 PFLOPS → FP4 40 PFLOPS)