Skip to main content

6 posts tagged with "NVIDIA"

NVIDIA AI chips and GPUs

View all tags

NVIDIA Vera Rubin正式出货:首台VR200 NVL72交付,三星HBM4量产,Rubin Ultra机柜天价

· 5 min read
Industry Research Team

2026年7月,NVIDIA 下一代 AI 计算平台 Vera Rubin 正式启动首批出货,接替 Blackwell 架构,并计划在 2026 年下半年进入大规模量产。首批客户包括微软、谷歌、亚马逊、Meta、Oracle 等大型云服务商。

1. 全球首台 VR200 NVL72 交付(里程碑)

CoreWeave 联合 Dell 宣布,全球首台 NVIDIA Vera Rubin VR200 NVL72 机柜已正式交付,并一次性通过 L11 全机柜级硬件诊断测试。这标志着 Rubin 从路线图走向实物,供应链核心环节(HBM4、先进封装、液冷、超高功率电源)未出现重大卡点。

VR200 NVL72 核心配置

指标Vera Rubin VR200 NVL72
机柜代号Oberon
GPU72 块 Rubin GPU
CPU36 颗 Vera CPU
单 GPU 显存288 GB HBM4
单 CPU 内存1.5 TB LPDDR5X
整柜 HBM420.7 TB(20,736 GB)
整柜 LPDDR5X54 TB
互联NVLink 6 全互联
推理性能~3.6 exaFLOPS 级别
散热液冷
代际提升单 GPU 计算约 3.5×、内存带宽约 2.8×(对比 Blackwell)

Vera CPU 集成 88 个定制 Olympus ARM 核心,与 GPU 间互联带宽 1.8 TB/s,可作为 GPU 显存扩展池。NVIDIA 已于 5 月完成对 Anthropic、OpenAI、xAI 及 Oracle Cloud 的首批 Vera CPU 交付。

2. 三星 HBM4 量产:关键瓶颈松动

2026年7月8日,三星电子正式启动面向 Vera Rubin 平台的 HBM4 量产,据报道其 HBM4 量产良率达到 70%(超出 60–65% 的初始预期)。这一关键供应链环节的确认,为 Rubin 大规模部署扫清障碍。

HBM 供应格局(2026 Q1)份额
SK 海力士45%
三星40%
美光15%

HBM4 采用 8 层堆叠(12 层设计计划 2028 年),价格约为 HBM3e 的 2.8 倍。TrendForce 预测 HBM 供给将年增 65%,到 2027 Q4 HBM4 占总产出的 35%。

3. Rubin Ultra 天价:HBM 成本主导

据美国银行全球研究(BofA Global Research)测算,Rubin 一代将把单台服务器成本推向历史新高:

成本项Rubin VR200(Oberon)对比
单柜 HBM4 用量20,736 GB
HBM4 单价~$18.40 / GBBlackwell(HBM3e)~$11.26 / GB
仅 HBM4 成本~$38.2 万尚未计入 LPDDR5X
Rubin Ultra 机柜预估售价~$2,100 万IT 之家 / BofA 估算

4. Rubin Ultra 设计调整:原 4 芯片方案取消(据 SemiAnalysis)

半导体研究机构 SemiAnalysis(2026-06-30) 披露,GTC 2026 发布的原版 4 芯片 Rubin Ultra GPU 已被取消,2027 年实际出货的版本规模与性能均缩减约一半:

  • 取消原因:原版在单一 CoWoS-L 封装内集成 4 颗计算 die + 16 颗 HBM4E,基板在 4 die 配置下出现翘曲(warpage),导致计算 die 与基板接触失效、良率崩塌;替代方案 CoPoS 量产要等到 2028 年底以后,赶不上 2027 节点。
  • 新方案:改为 双 die(与标准 Rubin 同构)+ HBM4E,单 GPU 约 384 GB HBM4E(高于标准 Rubin 的 288 GB),但总算力与带宽仅为原版一半;为逼近原设计的聚合算力,NVIDIA 预计在 Kyber 机架内以"2+2"板级配置 拼出四 die 等效规模。
  • Kyber 机架延迟:配套 Kyber NVL144 机架因中板 PCB 制造难题推迟 12 个月以上至 2028 年,800V 直流供电方案同样推迟至 2028 年。

⚠️ 口径提示:NVIDIA 未就上述设计调整发表官方评论;X 平台亦有声音认为"芯片数量并未改变、属旧闻翻炒"。本段基于 SemiAnalysis 公开报告整理,最终以 NVIDIA 官方披露为准。我们已在 Rubin Ultra 预览卡 中标注"规格待官方确认"。

产业解读

  1. "Never doubt"时刻兑现:Rubin 首发交付一次性通过 L11,打消了市场对"Rubin 延期"的疑虑,2026 H2 AI 算力供应确定性提前锁定。
  2. 专为 Agentic AI 设计:Rubin 面向智能体工作流、超长上下文推理,将进一步压低万亿参数模型的训练/推理成本曲线。
  3. HBM 是全链条赢家:单机柜 20.7 TB HBM4 用量巨大,SK 海力士、三星、美光及先进封装(CoWoS-L)、液冷、电力改造全链条受益,同时也成为成本与产能的最大约束。

相关链接

参考资料


本文持续跟踪 Vera Rubin 量产爬坡与 HBM4 供应链动态。

2026年H1 AI芯片行业复盘:Blackwell Ultra、国产三强与推理新时代

· 12 min read
Industry Research Team

2026年上半年,AI芯片产业发生了历史性转折——产业重心从"训练竞赛"转向"推理效率",国产芯片市场份额首次突破40%,NVIDIA以Blackwell Ultra筑高壁垒,推理专用芯片赛道百花齐放。


一、算力再翻番:NVIDIA Blackwell Ultra 发布(6月1日)

2026年6月1日,NVIDIA CEO黄仁勋在**台北国际电脑展(Computex 2026)**上揭晓新一代AI芯片 Blackwell Ultra,为未来两年的AI基础设施竞赛划定新起跑线。

关键规格

指标Blackwell UltraB200提升
FP8算力20 petaFLOPS~10 petaFLOPS100%
架构Blackwell UltraBlackwell升级
预计交付2027年Q12026年Q1
定位超大规模训练+推理训练+推理旗舰

产业意义

  1. 算力翻倍的直接影响:20 petaFLOPS FP8意味着千亿参数模型训练时间大幅缩短,万亿参数模型训练从"科学实验"走向"工程常态"
  2. 系统级平衡:Blackwell Ultra不仅是芯片,更是NVLink、HBM、散热、供电的系统级工程突破
  3. 路线图确定性:2027年Q1交付时间表,让云厂商和AI实验室可以提前18个月规划基础设施预算

挑战

  • 能耗危机:性能翻倍伴随功耗大幅上升,数据中心供电和冷却设计面临极限挑战
  • 可及性问题:顶级算力优先供应顶级云厂商,中小开发者和研究机构如何通过云服务以合理成本触达算力
  • 软件栈适配:新硬件需要匹配的CUDA版本和框架支持,软件生态成熟度成为算力转化的关键瓶颈

二、国产AI芯片:从"可用"到"好用"的临界点

2026年6月16日,信创世界发布**《2026中国国产AI芯片厂商能力象限》**,清晰勾勒出国产AI芯片的整体格局。

2.1 能力象限排名

象限代表厂商
领导者象限华为昇腾、海光信息、寒武纪、阿里平头哥、摩尔线程
远见者象限百度昆仑芯、壁仞科技、燧原科技、沐曦股份、瀚博半导体
竞争者象限清微智能、黑芝麻智能、芯驰科技、砺算科技、后摩智能
挑战者象限登临科技、知存科技、芯原股份、瑞芯微、云天励飞

2.2 华为昇腾:国产算力的定海神针

市场地位

  • 2025年昇腾系列出货 81.2万张,占国产AI加速卡 49% 份额,稳居国产第一
  • 昇腾950PR单卡FP8算力达 1P(PetaFLOPS)、FP4算力达 2P
  • 推理性能约为NVIDIA H20的 2.87倍,定价仅 7.2-7.5万元,性价比优势显著

全栈优势

华为"端管云芯"一体化战略是昇腾的核心壁垒:

  • 芯片设计:Da Vinci 3.0架构持续迭代
  • 操作系统:鸿蒙/欧拉OS深度优化
  • 网络通信:欧拉网络协议栈
  • 云服务:华为云ModelArts平台无缝集成

最新进展

  • 2026年6月5日,深圳河套学院联合哈工大(深圳)、华为团队,依托昇腾910C集群完成 1.6万亿参数DeepSeek V4 Pro大模型全参数后训练
  • 这是国产AI芯片首次完成万亿参数级大模型训练,标志着"国产替代"从推理迈向训练

2.3 寒武纪:率先盈利的国产AI芯片标杆

业绩爆发

指标2025年全年2026年Q1同比增长
营收64.97亿元28.85亿元+453% / +160%
净利润20.59亿元(首次年度盈利)10.13亿元— / +185%

核心产品:思元590

  • DeepSeek R1推理场景下,TPS可达 942,比H20高出约 50%
  • 与字节跳动多年联合优化,具备短期最强的云端推理部署能力
  • 2026年Q1营收28.85亿元中,思元590贡献超过70%

潜在风险

在2026年第2号《安全可靠测评结果公告》中缺席,原因尚未明确,将对其国内政企市场表现产生影响。

2.4 清微智能:可重构芯片的"第三路线"

技术路线

清微智能采用与Groq LPU同源的可重构数据流架构,在GPU通用性与ASIC极致效率之间找到了平衡点。

指标清微智能 TX81传统GPU方案优势
推理成本基准+100%降低50%
能效比基准基准提升3倍
架构可重构数据流SIMT/SIMD更适合推理

落地进展

  • 可重构芯片累计出货量已超 3000万颗
  • 在全国十余座千卡规模智算中心实现规模化落地
  • 已启动A股IPO辅导,有望成为"可重构芯片第一股"

三、推理芯片赛道:产业重心转移的核心信号

2026年6月4日,TrendForce发布深度报告**《推理经济时代来临:AI芯片的规则正被重写》,指出AI产业的算力竞争重心正在从训练转向推理**。

3.1 为什么是现在?

成本结构改变

  • 训练是一次性成本:模型训练完成后,边际成本趋近于零
  • 推理是持续性成本:每一次API调用、每一个生成token,都代表算力消耗与毛利压力
  • 单位推理成本与能效表现将直接影响毛利率与规模扩张能力

模型精简技术成熟

  • 1.58-bit量化技术与权重剪枝,使模型可在极低内存占用下维持推理准确度
  • MoE(混合专家)架构通过"部分唤醒"机制,每次推理仅激活少数专家子网络,大幅降低实际运算量
  • 精简模型的崛起,为硬式编码推理芯片提供了商业可行性

3.2 NVIDIA的百亿押注:收购Groq(2025年12月)

2025年12月24日,NVIDIA以 200亿美元取得Groq的Inference技术授权与核心团队,这是NVIDIA历史上最大规模的并购/技术收购之一。

战略意图

  1. 补全推理短板:NVIDIA GPU在训练领域无可撼动,但推理效率一直不是最强
  2. 对抗专用推理芯片:Cerebras、Taalas、SambaNova等初创公司正在蚕食推理市场
  3. 布局Agentic AI:Agentic AI需要极低延迟、极高吞吐的推理能力

3.3 Taalas HC1:硬式编码推理的概念验证

2026年2月20日,加拿大AI芯片初创公司Taalas发布推理芯片 Taalas HC1,将Meta的开源AI模型Llama 3.1 8B直接刻印在芯片中

关键指标

指标Taalas HC1NVIDIA B200(throughput optimized)优势
推理速率16,960 tokens/s/user基准~4-5x
每百万tokens成本0.75 cents3.79 cents降低80%
功耗~250W~700W降低64%
制程TSMC N6TSMC 4nm更成熟
HBM❌ 不使用✅ HBM3e成本更低

技术原理

Taalas HC1采用**存储内运算(Computing-in-Memory, CIM)**的激进实现:

  • 将模型权重直接固化于Mask ROM中(完全硬体定义)
  • 以片上SRAM处理动态资料(KV cache和LoRA微调权重)
  • 仅需修改2层光罩就能产出另一个AI模型的专用芯片,将一个AI模型转化为实体芯片仅需2个月

局限性

  • 缺乏弹性:硬式编码无法应对快速迭代的模型更新
  • 生态壁垒:当前云端市场仍依赖通用平台,客户可能更偏好可随模型升级的弹性方案
  • NRE成本:一次性工程费用高,需要足够大规模的部署才能摊薄

3.4 Cerebras:晶圆级整合的上市之路

2026年5月14日,Cerebras Systems正式在纳斯达克挂牌上市,成为首家上市的晶圆级AI芯片公司

核心技术:Wafer-Scale Integration(WSI)

  • WSE-3(第三代晶圆级引擎):整片12英寸晶圆做成单一芯片
  • 44GB片上SRAM:无需外部HBM,彻底消除内存带宽瓶颈
  • 21 PB/s带宽:片上通信带宽,是GPU的千倍级别
  • 与OpenAI合作:已签署逾200亿美元、规模750MW的三年算力合作协议

上市意义

Cerebras的上市是推理专用芯片赛道成熟的标志

  1. 资本市场开始为这类公司定价
  2. 证明"非GPU"技术路线具备商业可行性
  3. 为其他推理芯片初创公司(Groq、SambaNova、Taalas等)提供了估值参照

3.5 推理芯片格局:多元技术路线并存

公司技术路线核心优势代表产品
Taalas硬式编码(Mask ROM)极致推理效率、低成本HC1
Cerebras晶圆级整合(WSI)超高带宽、大模型推理WSE-3
GroqSRAM-first架构确定性延迟、高吞吐LPU(已被NVIDIA收购)
d-Matrix数字存储内运算(DIMC)灵活性强于硬式编码Corsair
EtchedHard-wired Transformer所有Transformer模型适用Sohu
Axelera AI数字存储内运算(D-IMC)+ RISC-V高能效比Metis AIPU

TrendForce预测

  • 通用GPU仍主导训练与多模型环境
  • 但在成熟、可预测场景中,通用GPU的利润空间将受到压缩
  • 产业格局从通用算力垄断,走向通用与专用并行的双轨结构

四、2026年H1国产AI芯片整体格局

4.1 行业进入放量期

指标2025年2026年Q1趋势
国产AI加速卡出货量165万张(占比41%)持续上升
中国AI加速卡总出货量~400万张
海光信息营收增速翻倍增长
寒武纪营收增速+160%
摩尔线程营收增速翻倍增长

头部厂商集体进入业绩兑现通道,行业从"技术验证"迈向"规模商用"。

4.2 三大核心发展趋势

趋势一:资本化浪潮重塑格局

  • 2025年底至2026年初,摩尔线程、沐曦股份登陆科创板
  • 壁仞科技登陆港股
  • 燧原科技科创板IPO获受理
  • 昆仑芯、平头哥启动上市进程
  • 清微智能、瀚博半导体等推进IPO

资本化带来双重效应:

  • 正面:为研发和生态建设提供支撑
  • ⚠️ 负面:估值泡沫和业绩兑现压力

趋势二:产能成为最大制约变量

国产AI芯片爆发式需求与有限先进制程产能的矛盾日益尖锐:

厂商先进制程产能需求实际获得
华为昇腾每月1.5万片(7nm级)优先保障
中芯国际总产能每月约2万片(7nm级)
其他厂商合计约5000片/月极度紧张

能否拿到稳定晶圆产能直接决定厂商生死。寒武纪75.4%的营收占比存货,本质是对产能的锁定。

趋势三:竞争从"可用"转向"好用"

早期竞争聚焦"能否跑通模型",当前升级为"运行效率、部署成本"的比拼:

竞争维度"可用"时代"好用"时代
硬件性能能否跑通模型运行效率、能效比
软件栈基本适配成熟度、框架广度
生态有无开发者社区活跃度
部署成本不敏感核心竞争要素

五、2026年H2展望

5.1 即将到来的关键事件

时间事件影响
2026年Q3NVIDIA Rubin架构详情公布下一代旗舰规格揭晓
2026年Q3华为昇腾950PR/950DT正式发布国产推理芯片新标杆
2026年Q4AMD MI350X规模化交付NVIDIA Blackwell竞品
2026年Q4寒武纪思元690发布(推测)新一代训练芯片
2027年Q1NVIDIA Blackwell Ultra交付算力新标杆落地

5.2 未来三年关键竞争要素

  1. 晶圆产能获取能力:先进制程产能是稀缺资源,绑定中芯国际、TSMC的厂商具备先天优势
  2. 资本运作效率:IPO窗口期有限,能否在资本市场上融到足够资金决定研发持续性
  3. 软件生态建设深度:硬件性能只是入场券,软件栈成熟度、框架适配广度、开发者社区活跃度才是核心壁垒

六、结语:多元生态终将形成

2026年H1,AI芯片产业正在经历从"一家独大"到"多元并存"的历史性转变。

  • NVIDIA以Blackwell Ultra筑高训练壁垒,同时以收购Groq布局推理效率
  • 华为昇腾以全栈能力守住国产算力的基本盘,950PR在推理性能上开始超越H20
  • 寒武纪以率先盈利证明国产AI芯片的商业化可行性,思元590在特定场景超越国际竞品
  • Cerebras、Taalas等推理专用芯片公司开辟了"非GPU"的第三路线
  • 清微智能的可重构架构为中国AI芯片提供了技术路线的多元化选择

未来三年,国产AI芯片终局将形成GPU、ASIC、可重构计算三大技术路线并存,云端与边缘协同发展的多元生态。"国产替代"不再是口号,而是正在发生的产业现实。


数据来源

  • 信创世界《2026中国国产AI芯片厂商能力象限》(2026-06-16)
  • TrendForce《推理经济时代来临:AI芯片的规则正被重写》(2026-06-04)
  • RayByte《算力再翻番!英伟达Blackwell Ultra芯片发布》(2026-06-02)
  • 各公司官方财报和公告

相关阅读


2026年6月AI芯片重大事件汇总:昇腾910C训练万亿模型、OpenAI自研芯片、RTX Spark发布

· 6 min read
Industry Research Team

2026年6月,AI芯片领域迎来多个里程碑事件,标志着"国产替代"和"去英伟达化"两大趋势加速。

1. 华为昇腾910C完成1.6万亿参数DeepSeek V4 Pro训练(2026-06-05)

事件概述

2026年6月5日,深圳河套学院联合哈尔滨工业大学(深圳)、深圳市大数据研究院及华为等团队,依托昇腾910C国产AI算力集群,成功完成 1.6万亿参数DeepSeek V4 Pro大模型全参数后训练

技术意义

指标数值
模型参数1.6万亿
训练芯片昇腾910C集群
训练类型全参数后训练(Full Parameter Post-Training)
意义国产AI芯片首次完成万亿参数级大模型训练

产业影响

  1. 打破技术封锁:证明国产AI芯片具备训练万亿参数大模型的能力
  2. "告别英伟达"加速:DeepSeek全面换装华为昇腾,减少了对H100的依赖
  3. 国产替代拐点:从"推理替代"迈向"训练替代"

相关链接


2. OpenAI发布首款自研AI推理芯片Jalapeño(2026-06-24)

事件概述

2026年6月24日,OpenAI与博通(Broadcom)联合发布首款自研AI推理芯片 Jalapeño,设计周期仅9个月(行业平均18个月),采用TSMC 3nm工艺

关键技术指标

指标Jalapeño对比(Blackwell)
制程TSMC 3nmTSMC 4nm
架构Systolic Array(脉动阵列)Blackwell GPU
设计周期9个月~18个月
推理成本-50%基准
AI辅助设计✅ 首款❌ 否
部署时间2026年底已出货

战略意义

  1. 首款AI辅助设计的AI芯片:OpenAI用GPT-5.3-Codex-Spark等模型辅助架构探索
  2. "去英伟达化"加速:科技巨头(谷歌、亚马逊、微软、Meta、OpenAI)集体自研芯片
  3. 推理成本革命:对于每天处理数亿次API调用的OpenAI,成本降低50%意义非凡

相关链接


3. NVIDIA在Computex 2026发布RTX Spark AI PC超级芯片(2026-06-01)

事件概述

2026年6月1日,NVIDIA CEO黄仁勋在Computex 2026 / GTC Taipei发布 RTX Spark AI PC超级芯片,与联发科(MediaTek)合作,采用Arm CPU + Blackwell GPU统一内存架构。

关键技术指标

指标RTX Spark
CPU最多20核Arm(联发科合作)
GPU6,144 CUDA核心(Blackwell)
统一内存128GB LPDDR5X(CPU+GPU共享)
内存带宽300 GB/s
AI算力~1 PFLOPS(推测)
模型容量可运行1,200亿参数模型
上下文最长100万tokens
TDP~100W(推测)
上市2026年秋季

产业影响

  1. NVIDIA进军PC芯片市场:挑战英特尔在个人电脑领域的主导地位
  2. AI PC新标准:本地运行120B参数模型,100万token上下文
  3. Windows转变为AI Agent平台:与微软OpenShell框架深度合作

相关链接


4. 工信部发布《2026年人工智能芯片产业发展白皮书》(2026-06-09)

事件概述

2026年6月9日,中国工业和信息化部发布《2026年人工智能芯片产业发展白皮书》,预测国内AI芯片市场规模将在2026年突破2000亿元人民币

关键预测

指标2026年预测
市场规模突破2000亿元人民币
国产芯片份额>50%(2025年为41%)
边缘推理芯片显著进展
出货量增长翻倍以上(相比2025年)

产业意义

  1. 国产AI芯片资本化加速:寒武纪、燧原、摩尔线程等加速IPO
  2. 边缘推理成破局关键:相比训练芯片,推理芯片更易实现国产替代
  3. 政策红利持续:国产替代从"市场行为"升级为"国家战略"

5. 字节跳动洽谈采购天数智芯5万颗推理芯片(2026-06-17)

事件概述

2026年6月17日,路透社报道称,字节跳动正与上海AI芯片企业天数智芯洽谈采购至少5万颗AI芯片,主要用于推理任务。

交易细节

项目内容
采购方字节跳动
供应商天数智芯
芯片型号智铠系列(推理GPU)
采购数量至少5万颗
用途推理工作负载
训练芯片天垓系列

产业意义

  1. 国产GPU头部玩家"加人":天数智芯首次进入头部互联网公司供应链
  2. 字节跳动2026年资本开支上调超2000亿元:主要用于AI算力和数据中心
  3. "国产替代"从政府和国企扩展到民营科技巨头

总结:2026年6月AI芯片产业三大趋势

趋势1:"国产替代"从推理迈向训练

  • 昇腾910C完成1.6万亿参数模型训练 → 证明国产芯片具备训练能力
  • DeepSeek全面换装昇腾 → 头部AI公司率先"告别英伟达"
  • 字节跳动采购天数智芯 → 民营科技巨头跟进

趋势2:"去英伟达化"从口号变为行动

  • OpenAI Jalapeño → 首款自研芯片,推理成本-50%
  • 谷歌TPU、亚马逊Trainium、微软Maia → 持续迭代
  • Meta MTIA、苹果M5 Ultra → 加大投入

趋势3:AI PC和边缘推理成为新战场

  • NVIDIA RTX Spark → AI PC新标准,2026年秋季上市
  • 边缘推理芯片国产化加速 → 工信部白皮书重点提及
  • "万亿参数模型本地运行" → 消费者市场新卖点

展望未来(2026 H2)

  1. 昇腾950DT全面放量(2026 Q4)→ 华为最新一代训练芯片
  2. NVIDIA Rubin R200出货(2026 H2)→ 下一代旗舰
  3. AMD MI400 Helios机架(2026 H2)→ 对标NVIDIA GB200
  4. OpenAI Jalapeño部署(2026年底)→ 千兆瓦级数据中心
  5. 国产AI芯片出货量翻倍以上 → 中信证券预测

参考资料


本文持续更新,欢迎提供最新动态。

寒武纪 MLU690 vs NVIDIA H100 深度对比:国产 AI 芯片能否替代 H100?

· 6 min read
AI Hardware Analyst

2026 年,在美国对华芯片出口管制背景下,寒武纪 MLU690 作为"中国版 H100"备受关注。本文从算力、显存、功耗、软件生态、实测性能、价格等维度深度对比,帮助您做出选型决策。

核心结论(先看这里)

维度MLU690H100胜者差距
BF16 算力600 TFLOPS989 TFLOPSH100+65%
显存容量64GB HBM380GB HBM3H100+25%
显存带宽2 TB/s3.35 TB/sH100+68%
TDP280W700WMLU690-60%
能效比2.14 TFLOPS/W1.41 TFLOPS/WMLU690+52%
软件生态NeuWare(75% 覆盖率)CUDA(100% 覆盖率)H100差距大
价格~¥140,000~¥200,000MLU690-30%
供货国内现货受管制MLU690

一句话总结:MLU690 算力约为 H100 的 60%,但功耗仅 40%,价格仅 70%,适合中国市场 AI 训练和推理。


1. 规格对比(详细)

1.1 算力对比

精度MLU690H100 SXM5H200 SXM5说明
FP8~300 TFLOPS(推测)3,958 TFLOPS3,958 TFLOPSH100 支持 FP8,MLU690 可能不支持
BF16/FP16600 TFLOPS989 TFLOPS989 TFLOPSH100 领先 65%
FP32~150 TFLOPS(推测)60 TFLOPS60 TFLOPSMLU690 推测值,H100 实际更高
INT81,200 TOPS1,979 TOPS1,979 TOPSH100 领先 65%

关键发现

  • ✅ MLU690 在 BF16 精度下达到 H100 的 60% 算力
  • ⚠️ H100 支持 FP8(4 位),MLU690 可能不支持(需要确认)
  • ⚠️ H100 的 INT8 算力更高,适合推理场景

1.2 显存对比

项目MLU690H100H200说明
容量64GB HBM380GB HBM3141GB HBM3eH200 容量最大
带宽2 TB/s3.35 TB/s4.8 TB/sH200 带宽最高
类型HBM3HBM3HBM3eH200 使用最新 HBM3e

关键发现

  • ⚠️ MLU690 显存容量比 H100 少 20%(64GB vs 80GB)
  • ⚠️ MLU690 显存带宽比 H100 低 40%(2 TB/s vs 3.35 TB/s)
  • ❌ 运行 70B+ 参数模型时,MLU690 可能显存不足(需要模型并行)

1.3 功耗对比

项目MLU690H100H200
TDP280W700W700W
能效比(FP16/W)2.14 TFLOPS/W1.41 TFLOPS/W1.41 TFLOPS/W
8 卡服务器功耗~3.5kW~6kW~6kW
年电费(¥0.6/kWh)~¥18,400~¥36,800~¥36,800

关键发现

  • MLU690 功耗仅 H100 的 40%,数据中心电力成本大幅降低
  • MLU690 能效比领先 52%,更适合大规模部署
  • ✅ 对于推理场景(功耗敏感),MLU690 优势明显

2. 软件生态对比

2.1 框架支持

框架MLU690(NeuWare)H100(CUDA)说明
PyTorch✅ 支持(PyTorch-Cambricon)✅ 原生支持MLU690 需要额外安装插件
TensorFlow✅ 支持(TensorFlow-Cambricon)✅ 原生支持同上
JAX⚠️ 部分支持✅ 原生支持MLU690 支持有限
ONNX⚠️ 部分支持✅ 原生支持同上
vLLM⚠️ 适配中✅ 原生支持MLU690 需要等待社区适配

2.2 算子覆盖率

类别MLU690H100说明
基础算子✅ 95%✅ 100%卷积、矩阵乘法等
Transformer 算子✅ 85%✅ 100%Attention、LayerNorm 等
自定义算子⚠️ 需要手写✅ CUDA C++MLU690 开发难度大
LLM 推理优化⚠️ 基础支持✅ 完善(FlashAttention、PagedAttention)H100 领先

关键发现

  • ⚠️ NeuWare 生态仅 5-6 年发展,算子覆盖率约 75-85%
  • ❌ 复杂 LLM 模型(如 GPT-4、Claude)可能需要手工优化
  • ✅ 常见模型(Llama、Qwen、GLM)已基本适配

3. 实测性能对比

3.1 训练性能

模型MLU690(训练时间)H100(训练时间)加速比
Llama 7B~48 小时(推测)~30 小时1.6x
Llama 70B~7 天(推测)~4.5 天1.6x
Qwen 72B~8 天(推测)~5 天1.6x

注意:以上数据为推测,实际性能取决于软件优化程度。

3.2 推理性能

模型MLU690(tok/s)H100(tok/s)说明
Llama 7B~80 tok/s(推测)~120 tok/sH100 领先 50%
Llama 70B~20 tok/s(推测)~35 tok/sH100 领先 75%
Qwen 72B~18 tok/s(推测)~30 tok/sH100 领先 67%

关键发现

  • ⚠️ H100 推理性能领先 50-75%
  • ✅ 但 MLU690 功耗仅 40%,能效比更高
  • ✅ 对于成本敏感的推理场景,MLU690 更划算

4. 价格对比

4.1 硬件采购成本

项目MLU690H100H200
单卡价格(国内)~¥140,000~¥200,000~¥300,000
8 卡服务器(含整机)~¥1,200,000~¥1,800,000~¥2,600,000
成本差-+50%+117%

4.2 TCO(3 年)

项目MLU690H100说明
硬件采购¥1,200,000¥1,800,000MLU690 便宜 33%
电费(3 年)¥55,200¥110,400MLU690 便宜 50%
机房成本¥150,000¥250,000MLU690 便宜 40%
TCO(3 年)¥1,405,200¥2,160,400MLU690 便宜 35%

关键发现

  • MLU690 的 TCO 比 H100 低 35%
  • ✅ 对于大规模部署(100+ 卡),成本优势明显

5. 选型建议

5.1 选 MLU690,如果...

  • ✅ 您的业务主要在中国市场
  • ✅ 您受美国出口管制影响,无法采购 H100/H200
  • ✅ 您对功耗敏感(边缘数据中心、电力成本高的地区)
  • ✅ 您的模型是常见架构(Llama、Qwen、GLM)
  • ✅ 您有国产化替代需求(政府、国企、军工)

5.2 选 H100/H200,如果...

  • ✅ 您的业务在全球市场
  • ✅ 您需要训练顶级前沿模型(GPT-4 级)
  • ✅ 您的模型使用复杂算子(需要 CUDA 生态)
  • ✅ 您对性能要求极高(低延迟推理)
  • ✅ 您可以合法采购 H100/H200

5.3 混合部署(推荐)

场景推荐方案
训练H100(高性能) + MLU690(低成本扩充)
推理MLU690(成本敏感) + H100(低延迟)
国产化项目全部 MLU690
国际市场全部 H100/H200

6. 未来展望

6.1 MLU690 的不足

  • ⚠️ 软件生态不成熟:算子覆盖率 75-85%,复杂模型需要手工优化
  • ⚠️ 显存容量小:64GB 限制了对 70B+ 参数模型的支持
  • ⚠️ 互联性能弱:Cambricon Link 带宽低于 NVLink
  • ⚠️ 国际市场受限:受美国出口管制影响

6.2 MLU690 的改进方向

  • 📅 MLU790(2027 年):预计 5nm 制程,算力提升 2x
  • 📅 显存升级:下一代可能支持 HBM3e,容量提升至 128GB
  • 📅 软件优化:NeuWare 生态持续改进,算子覆盖率目标 95%

7. 总结

维度MLU690H100推荐场景
算力⭐⭐⭐⭐⭐⭐⭐⭐⭐H100 适合顶级训练
显存⭐⭐⭐⭐⭐⭐⭐H100 适合大模型
功耗⭐⭐⭐⭐⭐⭐⭐⭐MLU690 适合推理
生态⭐⭐⭐⭐⭐⭐⭐⭐H100 适合复杂模型
价格⭐⭐⭐⭐⭐⭐⭐⭐MLU690 适合大规模部署
国产化⭐⭐⭐⭐⭐MLU690 适合中国市场

最终建议

  • 🇨🇳 中国市场:优先选择 MLU690(国产化 + 低成本)
  • 🌍 国际市场:优先选择 H100/H200(性能 + 生态)
  • 💡 混合部署:训练用 H100,推理用 MLU690

参考资料


声明:本文数据基于公开资料和合理估算,实际性能以厂商官方测试为准。MLU690 的软件生态在快速发展中,建议持续关注 NeuWare 更新。

最后更新:2026-06-23

2026 H2 AI 芯片路线图重大更新:Qualcomm 入局、AMD MI400 三款型号揭晓、华为三代路线图

· 7 min read
AI Hardware Analyst

2026 年 6 月更新——AI 算力卡市场正在经历近年来最剧烈的格局变化。本文将为您梳理最新路线图动态。


核心要点

  • Qualcomm AI 200/250 正式进入数据中心 AI 推理市场,对标 NVIDIA H200
  • AMD MI400 系列 揭晓三款型号:MI430X(HPC)、MI440X(企业)、MI455X(旗舰)
  • 华为 公布三代路线图:950(2026)→ 960(2027-Q4)→ 970(2028-Q4)
  • Intel Jaguar Shores 时间线存疑,可能延迟至 2027 或之后
  • NVIDIA Rubin R200 已全面量产,Vera CPU + Rubin GPU 组合正式交付

1. Qualcomm:移动芯片巨头进军数据中心 AI

AI 100 → AI 200 → AI 250

Qualcomm 在 2025 年 10 月正式发布了 AI 200 数据中心推理芯片,标志着移动芯片巨头正式进入数据中心 AI 市场。

型号发布时间上市时间关键特性
AI 1002025-102026 H2机架级 AI 推理,768GB LPDDR/卡
AI 2502025-102027 H1近存计算架构,10x 有效内存带宽

为什么 Qualcomm 能成功?

  1. 低 TCO:LPDDR 内存比 HBM 便宜得多
  2. 能效优势:移动芯片设计经验,功耗控制出色
  3. 推理专用:不追求训练性能,专注推理场景
  4. 机架规格:直接液冷,160kW 机架级功耗,Ethernet 互联

市场影响

  • 对标 NVIDIA H200:AI 200 推理性能接近 H200,但 TCO 低 30-40%
  • 倒逼 NVIDIA:可能促使 NVIDIA 推出推理专用芯片(如 Rubin CPX)
  • 多样化选择:打破 NVIDIA 在推理市场的垄断

2. AMD MI400 系列:三款型号精准定位

在 CES 2026(2026 年 1 月)上,AMD 正式揭晓了 MI400 系列 的三款型号,精准覆盖不同市场:

MI430X(HPC + 主权 AI)

特性规格
定位HPC + 主权 AI
FP32/FP64支持(这是关键区别)
适用场景科学计算、气候模拟、国家 AI 基础设施
竞争对手NVIDIA 不做 FP64 的 AI 卡

MI440X(企业服务器)

特性规格
定位企业 8-GPU 服务器
兼容性兼容现有数据中心基础设施
适用场景企业 AI、私有云、边缘推理
竞争优势比 MI455X 更便宜,更易部署

MI455X(旗舰 AI 训练)

特性规格
定位旗舰 AI 训练 + 推理
优化精度FP4/FP8/BF16
Helios 机架核心组件
竞争对手NVIDIA Rubin R200

Helios 机架级解决方案

AMD 在 CES 2026 同时发布了 Helios 机架级 AI 解决方案:

  • 18 颗 Zen 6 CPU(2nm 制程)
  • 72 颗 MI455X GPU
  • 直接液冷
  • 预计 2026 H2 出货

3. 华为三代路线图:950 → 960 → 970

华为在全联接大会 2025(2025 年 9 月)公布了三代芯片路线图,时间线非常清晰:

昇腾 950 系列(2026)

型号发布时间关键特性
950PR2026-Q1PR(推理优化),已量产
950DT2026-Q4DT(Decode + 训练),预计全面放量

技术亮点

  • 新增支持 FP8/MXFP8/MXFP4
  • 互联带宽 2TB/s(相比 910C 提升 2.5 倍)

昇腾 960(2027-Q4)

  • 算力翻倍:相比 950 系列,各项规格翻倍
  • FP8:预计 ~2 PFLOPS
  • 工艺:N+3(等效 5nm)
  • 定位:对标 NVIDIA B200

昇腾 970(2028-Q4)

  • 三代旗舰:目前仅公布时间线,规格待定
  • 意义:华为首个覆盖完整代际的路线图
  • 信号:中国国产 AI 芯片已进入"规划驱动"阶段

4. Intel Jaguar Shores:时间线存疑

原定计划

  • 发布时间:2026 年
  • 架构:Xe-HPC + Gaudi 融合
  • 制程:18A(Intel 最先进制程)
  • 内存:可能采用 HBM4E(而非原计划的 HBM4)

最新动态

  • 可能延迟:部分消息源显示可能推迟至 2027 年
  • 竞争对手:AMD MI400 已揭晓,NVIDIA Rubin 已量产
  • 市场压力:Intel 在 AI 芯片市场节节败退,Jaguar Shores 是最后机会

对路线图的影响

如果 Jaguar Shores 延迟至 2027 年,Intel 在 AI 芯片市场将基本出局。


5. NVIDIA Rubin 平台:已全面量产

Rubin R200(2026-Q2 全面量产)

特性规格
HBM288GB HBM4
算力50 PFLOPS FP4
NVLinkNVLink 6(1800 GB/s)
制程TSMC 4NP

Rubin NVL72 机柜(2026 H2 出货)

  • 72 颗 Rubin GPU
  • 36 颗 Vera CPU
  • 1.8 EFLOPS FP4
  • 直接液冷

Vera CPU(首次亮相)

  • 架构:自研 CPU,替代 Grace
  • 定位:与 Rubin GPU 深度协同
  • 意义:NVIDIA 从 GPU 公司转型为计算平台公司

6. Google TPU v8:训练/推理正式拆分

TPU 8t(训练) + TPU 8i(推理)

Google 在 Cloud Next 2026 宣布 TPU v8 将正式拆分为训练版和推理版:

特性TPU 8t(训练)TPU 8i(推理)
优化方向高算力、高带宽低延迟、低成本
互联光学互联以太网
发布时间20272027

意义

  • 行业趋势:训练/推理芯片专用化
  • 跟随者:Qualcomm AI 200 也是推理专用
  • NVIDIA 压力:是否需要推出推理专用芯片?

7. Cerebras WSE-4:晶圆级引擎再进化

核心规格

特性规格
晶体管1.4 万亿
算力125 PFLOPS FP8
发布时间2026 H2
制程TSMC 5nm

竞争优势

  • 超大模型训练:单颗 WSE-4 可训练 10T+ 参数模型
  • 低延迟推理:整个模型在单颗芯片上,无通信开销
  • 软件栈成熟:Cerebras 软件栈已支持 PyTorch、TensorFlow

8. 市场格局分析

训练市场

排名厂商产品市场份额(预估)
1NVIDIARubin R20070%
2AMDMI455X15%
3GoogleTPU v8t10%
4华为昇腾 9605%(中国为主)

推理市场(新战场)

排名厂商产品优势
1NVIDIAH200 / Rubin CPX生态成熟
2QualcommAI 200低 TCO
3AMDMI440X兼容性好
4IntelGaudi 4价格低廉

9. 关键趋势

趋势 1:推理专用芯片崛起

  • Qualcomm AI 200:移动芯片巨头入局
  • NVIDIA Rubin CPX:NVIDIA 首次推出推理专用芯片
  • Google TPU 8i:训练/推理正式拆分

趋势 2:机架级解决方案成为标配

  • NVIDIA NVL72:72 GPU + 36 CPU
  • AMD Helios:18 CPU + 72 GPU
  • Qualcomm 机架:160kW 液冷机架

趋势 3:中国国产芯片进入"规划驱动"阶段

  • 华为三代路线图:950 → 960 → 970
  • 时间线清晰:2026-Q1 → 2027-Q4 → 2028-Q4
  • 意义:从"追赶"到"规划"

趋势 4:HBM 产能成为瓶颈

  • SK 海力士:HBM4 产能已被 NVIDIA 预订
  • 三星:HBM4E 样品已交付 AMD
  • 影响:MI400、Rubin R200 出货量受 HBM 产能限制

10. 采购建议

如果您在 2026 H2 采购

  1. 训练场景

    • 首选:NVIDIA Rubin R200(性能最强)
    • 备选:AMD MI455X(性价比更高)
    • 国产:华为昇腾 950DT(中国客户)
  2. 推理场景

    • 首选:NVIDIA H200(生态成熟)
    • 性价比:Qualcomm AI 200(如果可用)
    • 成本敏感:AMD MI440X
  3. HPC 场景

    • 唯一选择:AMD MI430X(支持 FP64)

如果您在 2027 采购

  • 等待 Rubin Ultra:性能可能是 R200 的 2x
  • 关注 MI500:AMD 下一代产品
  • 评估 TPU v8:如果已在用 Google Cloud

结论

2026 H2 将是 AI 芯片市场有史以来最卷的半年

  • NVIDIA 继续领跑,但优势缩小
  • AMD 三款型号精准定位,市场份额将持续提升
  • Qualcomm 入局推理市场,低 TCO 策略可能颠覆市场
  • 华为 三代路线图清晰,国产替代加速
  • Intel Jaguar Shores 成败在此一举

对于采购决策者,现在是最难做决定的时刻——因为每个选项都有明显的优缺点。

对于技术从业者,这是最好的时代——芯片性能每年翻倍,架构创新层出不穷。


参考资料

  • AI 算力卡未来路线图 - MirrorFrog 实时更新
  • NVIDIA Rubin R200 深度解析(见本站相关文章)
  • AMD MI400 系列 CES 2026 发布(见本站相关文章)
  • Qualcomm AI 100 发布分析(即将发布)

最后更新:2026-06-20
作者:Charles Qing
标签:#路线图 #市场分析 #采购决策

NVIDIA Vera Rubin 全面投产:智能体AI工厂时代正式开启

· 6 min read
Industry Research Team

2026年6月1日,NVIDIA创始人兼首席执行官黄仁勋在COMPUTEX 2026(台北国际电脑展)上正式宣布:Vera Rubin平台全面投产。这标志着AI硬件从"离散加速器"向"整体化AI工厂"的根本性范式转变。

核心亮点

  • Rubin GPU:下一代AI计算芯片,FP4算力是Blackwell的3.6×
  • Vera CPU:88个自定义Arm核心(176线程),替代Grace CPU
  • NVLink 6:GPU间互联带宽达260 TB/s(相比Blackwell翻倍)
  • CX8 SuperNIC:800Gb/s网络,ConnectX-9链路达28.8 TB/s
  • HBM4显存:单芯片288GB,带宽13 TB/s
  • 智能体吞吐量:相比Grace Blackwell提升10×

Vera Rubin 平台完整规格

Vera Rubin不是一个单独的GPU,而是一个完整的AI工厂平台,包含7款芯片:

芯片名称类型用途
Rubin GPU主力AI计算芯片训练+推理
Rubin Ultra GPU旗舰版超大尺度推理
Vera CPU配合Rubin的CPUHost CPU + 数据预处理
NVLink 6互联芯片GPU间高速互联(260 TB/s)
CX8 SuperNIC网卡800Gb/s网络
XDR 800G 交换机数据中心网络跨机架通信
Rubin平台POD整机柜预配置的AI工厂(144 GPU)

Rubin GPU 详细规格(推测)

参数Rubin GPURubin UltraBlackwell (B200)
架构RubinRubin UltraBlackwell
制程TSMC 3nm(推测)TSMC 3nmTSMC 4NP
显存288GB HBM4288GB HBM4E(推测)192GB HBM3e
显存带宽13 TB/s13+ TB/s8 TB/s
FP4 算力~3,600 TFLOPS(推测)~5,000 TFLOPS(推测)2,250 TFLOPS
TDP1,000W(推测)1,200W(推测)700-1000W
互联NVLink 6(260 TB/s)NVLink 6NVLink 5(1800 GB/s)
量产时间2026 Q32027 下半年2024 Q4

📌 :Rubin具体规格尚未完全公开,上表部分为推测值。

Vera CPU:替代Grace的新一代Host CPU

Vera CPU是NVIDIA自研的Arm架构CPU,取代此前的Grace CPU:

参数Vera CPUGrace CPU
核心数88核(176线程)72核(144线程)
架构自定义Armv9(推测)Arm Neoverse V2
接口NVLink 5.0(1.8 TB/s)NVLink 4.0(900 GB/s)
TDP~500W(推测)350-500W
用途AI工厂Host CPU超算/AI Host

关键升级:Vera与Rubin GPU的协同设计,使其在计算、数据加载、预处理上实现端到端优化,对标Google TPU 8t的Arm Axion集成。

与Blackwell的性能对比

NVIDIA官方宣称,在相同POD配置(144个GPU芯片)下:

指标Grace Blackwell (GB200 NVL72)Vera Rubin NVL144提升
FP4 算力1.1 PFLOPS3.6 PFLOPS3.3×
显存容量288GB×72 = 20.7TB288GB×144 = 41.4TB
显存带宽8 TB/s×7213 TB/s×144~3.3×
NVLink 带宽1800 GB/s×72260 TB/s(全POD)~2×
智能体吞吐量基准10×10×
每瓦性能基准25×(与单独CPU比)25×

💡 为何是"10×智能体吞吐量"? 智能体AI(Agentic AI)工作负载与训练/推理不同:一个提示词可能触发包含推理、检索、工具调用、响应生成的多个环节,涉及数千个步骤。Rubin平台专为这种长链条、高并发工作负载优化。

MGX 第三代机架级系统

Vera Rubin采用MGX第三代开源机架级系统设计:

  • 五机架协同:Vera Rubin NVL72系统 + Vera CPU + Groq 3 LPX + Vera BlueField-4 STX存储 + Spectrum-6 SPX以太网
  • 全球供应链:30个国家、350+工厂、数百家合作伙伴(Dell、HPE、Lenovo、Supermicro、Asus、Foxconn等)
  • Spectrum-X 以太网硅光技术:全球首款基于CPO(光电一体化封装)、支持200Gb/s SerDes的交换机,现已量产

量产时间表

时间事件
2026年1月CES 2026首次公布Rubin平台
2026年6月1日COMPUTEX 2026宣布全面投产
2026年秋季Vera Rubin正式启动量产并开始出货
2027年下半年Rubin Ultra发布(HBM4E升级)
2028年Feynman架构(下一代)

AI工厂:从卖芯片到卖"智能生产线"

黄仁勋在发布会上说了一句让业界震动的话:

"Rubin的Agentic AI吞吐量,是Blackwell的10倍。Rubin是一个完整的AI工厂平台。"

这标志着NVIDIA商业模式的根本转变:

  • 过去:卖GPU(H100/B200),客户自己搭建系统
  • 现在:卖"AI工厂成套解决方案"(Vera Rubin POD),包含GPU、CPU、网络、存储、软件栈
  • 未来:成为全球AI基础设施的"台积电"(提供智能生产能力)

与竞品对比

厂商产品定位优势劣势
NVIDIAVera RubinAI工厂整体方案生态最完整、软件最成熟价格昂贵、功耗极高
AMDMI455X(MI400系列)训练竞品性价比、开放生态软件生态差距
GoogleTPU 8i/8t云上训练/推理与Gemini深度集成仅Google Cloud
华为昇腾910C/950国产替代中国本土化、昇思框架受出口管制影响

行业影响

  1. AI实验室:Frontier模型训练时间从"数月"缩短到"数周"
  2. 云服务商:必须决定是否采购Vera Rubin POD(与自研芯片战略冲突)
  3. 超大规模数据中心:AI工厂成为新的竞争维度(谁有最强算力,谁就能训练最强模型)
  4. 国产芯片:昇腾910C/950、寒武纪MLU590等必须在2026-2027年追上Blackwell,否则差距将扩大到Rubin时代

相关芯片

参考资料


本文基于NVIDIA官方公告及公开资料整理,部分规格为推测值,以官方最终发布为准。