Skip to main content

2 posts tagged with "Intel"

Intel AI chips and accelerators

View all tags

2026 H2 AI 芯片路线图重大更新:Qualcomm 入局、AMD MI400 三款型号揭晓、华为三代路线图

· 7 min read
AI Hardware Analyst

2026 年 6 月更新——AI 算力卡市场正在经历近年来最剧烈的格局变化。本文将为您梳理最新路线图动态。


核心要点

  • Qualcomm AI 200/250 正式进入数据中心 AI 推理市场,对标 NVIDIA H200
  • AMD MI400 系列 揭晓三款型号:MI430X(HPC)、MI440X(企业)、MI455X(旗舰)
  • 华为 公布三代路线图:950(2026)→ 960(2027-Q4)→ 970(2028-Q4)
  • Intel Jaguar Shores 时间线存疑,可能延迟至 2027 或之后
  • NVIDIA Rubin R200 已全面量产,Vera CPU + Rubin GPU 组合正式交付

1. Qualcomm:移动芯片巨头进军数据中心 AI

AI 100 → AI 200 → AI 250

Qualcomm 在 2025 年 10 月正式发布了 AI 200 数据中心推理芯片,标志着移动芯片巨头正式进入数据中心 AI 市场。

型号发布时间上市时间关键特性
AI 1002025-102026 H2机架级 AI 推理,768GB LPDDR/卡
AI 2502025-102027 H1近存计算架构,10x 有效内存带宽

为什么 Qualcomm 能成功?

  1. 低 TCO:LPDDR 内存比 HBM 便宜得多
  2. 能效优势:移动芯片设计经验,功耗控制出色
  3. 推理专用:不追求训练性能,专注推理场景
  4. 机架规格:直接液冷,160kW 机架级功耗,Ethernet 互联

市场影响

  • 对标 NVIDIA H200:AI 200 推理性能接近 H200,但 TCO 低 30-40%
  • 倒逼 NVIDIA:可能促使 NVIDIA 推出推理专用芯片(如 Rubin CPX)
  • 多样化选择:打破 NVIDIA 在推理市场的垄断

2. AMD MI400 系列:三款型号精准定位

在 CES 2026(2026 年 1 月)上,AMD 正式揭晓了 MI400 系列 的三款型号,精准覆盖不同市场:

MI430X(HPC + 主权 AI)

特性规格
定位HPC + 主权 AI
FP32/FP64支持(这是关键区别)
适用场景科学计算、气候模拟、国家 AI 基础设施
竞争对手NVIDIA 不做 FP64 的 AI 卡

MI440X(企业服务器)

特性规格
定位企业 8-GPU 服务器
兼容性兼容现有数据中心基础设施
适用场景企业 AI、私有云、边缘推理
竞争优势比 MI455X 更便宜,更易部署

MI455X(旗舰 AI 训练)

特性规格
定位旗舰 AI 训练 + 推理
优化精度FP4/FP8/BF16
Helios 机架核心组件
竞争对手NVIDIA Rubin R200

Helios 机架级解决方案

AMD 在 CES 2026 同时发布了 Helios 机架级 AI 解决方案:

  • 18 颗 Zen 6 CPU(2nm 制程)
  • 72 颗 MI455X GPU
  • 直接液冷
  • 预计 2026 H2 出货

3. 华为三代路线图:950 → 960 → 970

华为在全联接大会 2025(2025 年 9 月)公布了三代芯片路线图,时间线非常清晰:

昇腾 950 系列(2026)

型号发布时间关键特性
950PR2026-Q1PR(推理优化),已量产
950DT2026-Q4DT(Decode + 训练),预计全面放量

技术亮点

  • 新增支持 FP8/MXFP8/MXFP4
  • 互联带宽 2TB/s(相比 910C 提升 2.5 倍)

昇腾 960(2027-Q4)

  • 算力翻倍:相比 950 系列,各项规格翻倍
  • FP8:预计 ~2 PFLOPS
  • 工艺:N+3(等效 5nm)
  • 定位:对标 NVIDIA B200

昇腾 970(2028-Q4)

  • 三代旗舰:目前仅公布时间线,规格待定
  • 意义:华为首个覆盖完整代际的路线图
  • 信号:中国国产 AI 芯片已进入"规划驱动"阶段

4. Intel Jaguar Shores:时间线存疑

原定计划

  • 发布时间:2026 年
  • 架构:Xe-HPC + Gaudi 融合
  • 制程:18A(Intel 最先进制程)
  • 内存:可能采用 HBM4E(而非原计划的 HBM4)

最新动态

  • 可能延迟:部分消息源显示可能推迟至 2027 年
  • 竞争对手:AMD MI400 已揭晓,NVIDIA Rubin 已量产
  • 市场压力:Intel 在 AI 芯片市场节节败退,Jaguar Shores 是最后机会

对路线图的影响

如果 Jaguar Shores 延迟至 2027 年,Intel 在 AI 芯片市场将基本出局。


5. NVIDIA Rubin 平台:已全面量产

Rubin R200(2026-Q2 全面量产)

特性规格
HBM288GB HBM4
算力50 PFLOPS FP4
NVLinkNVLink 6(1800 GB/s)
制程TSMC 4NP

Rubin NVL72 机柜(2026 H2 出货)

  • 72 颗 Rubin GPU
  • 36 颗 Vera CPU
  • 1.8 EFLOPS FP4
  • 直接液冷

Vera CPU(首次亮相)

  • 架构:自研 CPU,替代 Grace
  • 定位:与 Rubin GPU 深度协同
  • 意义:NVIDIA 从 GPU 公司转型为计算平台公司

6. Google TPU v8:训练/推理正式拆分

TPU 8t(训练) + TPU 8i(推理)

Google 在 Cloud Next 2026 宣布 TPU v8 将正式拆分为训练版和推理版:

特性TPU 8t(训练)TPU 8i(推理)
优化方向高算力、高带宽低延迟、低成本
互联光学互联以太网
发布时间20272027

意义

  • 行业趋势:训练/推理芯片专用化
  • 跟随者:Qualcomm AI 200 也是推理专用
  • NVIDIA 压力:是否需要推出推理专用芯片?

7. Cerebras WSE-4:晶圆级引擎再进化

核心规格

特性规格
晶体管1.4 万亿
算力125 PFLOPS FP8
发布时间2026 H2
制程TSMC 5nm

竞争优势

  • 超大模型训练:单颗 WSE-4 可训练 10T+ 参数模型
  • 低延迟推理:整个模型在单颗芯片上,无通信开销
  • 软件栈成熟:Cerebras 软件栈已支持 PyTorch、TensorFlow

8. 市场格局分析

训练市场

排名厂商产品市场份额(预估)
1NVIDIARubin R20070%
2AMDMI455X15%
3GoogleTPU v8t10%
4华为昇腾 9605%(中国为主)

推理市场(新战场)

排名厂商产品优势
1NVIDIAH200 / Rubin CPX生态成熟
2QualcommAI 200低 TCO
3AMDMI440X兼容性好
4IntelGaudi 4价格低廉

9. 关键趋势

趋势 1:推理专用芯片崛起

  • Qualcomm AI 200:移动芯片巨头入局
  • NVIDIA Rubin CPX:NVIDIA 首次推出推理专用芯片
  • Google TPU 8i:训练/推理正式拆分

趋势 2:机架级解决方案成为标配

  • NVIDIA NVL72:72 GPU + 36 CPU
  • AMD Helios:18 CPU + 72 GPU
  • Qualcomm 机架:160kW 液冷机架

趋势 3:中国国产芯片进入"规划驱动"阶段

  • 华为三代路线图:950 → 960 → 970
  • 时间线清晰:2026-Q1 → 2027-Q4 → 2028-Q4
  • 意义:从"追赶"到"规划"

趋势 4:HBM 产能成为瓶颈

  • SK 海力士:HBM4 产能已被 NVIDIA 预订
  • 三星:HBM4E 样品已交付 AMD
  • 影响:MI400、Rubin R200 出货量受 HBM 产能限制

10. 采购建议

如果您在 2026 H2 采购

  1. 训练场景

    • 首选:NVIDIA Rubin R200(性能最强)
    • 备选:AMD MI455X(性价比更高)
    • 国产:华为昇腾 950DT(中国客户)
  2. 推理场景

    • 首选:NVIDIA H200(生态成熟)
    • 性价比:Qualcomm AI 200(如果可用)
    • 成本敏感:AMD MI440X
  3. HPC 场景

    • 唯一选择:AMD MI430X(支持 FP64)

如果您在 2027 采购

  • 等待 Rubin Ultra:性能可能是 R200 的 2x
  • 关注 MI500:AMD 下一代产品
  • 评估 TPU v8:如果已在用 Google Cloud

结论

2026 H2 将是 AI 芯片市场有史以来最卷的半年

  • NVIDIA 继续领跑,但优势缩小
  • AMD 三款型号精准定位,市场份额将持续提升
  • Qualcomm 入局推理市场,低 TCO 策略可能颠覆市场
  • 华为 三代路线图清晰,国产替代加速
  • Intel Jaguar Shores 成败在此一举

对于采购决策者,现在是最难做决定的时刻——因为每个选项都有明显的优缺点。

对于技术从业者,这是最好的时代——芯片性能每年翻倍,架构创新层出不穷。


参考资料

  • AI 算力卡未来路线图 - MirrorFrog 实时更新
  • NVIDIA Rubin R200 深度解析(见本站相关文章)
  • AMD MI400 系列 CES 2026 发布(见本站相关文章)
  • Qualcomm AI 100 发布分析(即将发布)

最后更新:2026-06-20
作者:Charles Qing
标签:#路线图 #市场分析 #采购决策

Intel Gaudi 4 / Jaguar Shores 最新进展:重返AI竞赛,HBM4内存加持

· 7 min read
Industry Research Team

2026年3月18日,Intel在Intel AI Summit上正式发布:Habana Gaudi 4定制AI加速卡。这是Intel在Gaudi 3(2024年4月发布)之后的最新一代AI训练/推理芯片,专为大规模模型训练设计。

同时,Intel确认下一代Jaguar Shores GPU(数据中心GPU)正在研发中,将采用HBM4内存,预计2027年发布。这标志着Intel正式重返AI芯片竞赛。

核心亮点

  • Gaudi 4:2026年3月发布,TSMC 5nm、64GB HBM3e、专为大规模训练
  • Jaguar Shores:2027年发布(预计),采用HBM4、对标NVIDIA Rubin
  • Crescent Island:Intel首款通用GPU(2026年发布),采用Xe3架构
  • 软件生态:Intel AI Stack(包含oneAPI、BigDL、Gaudi Software Suite)
  • 代工合作伙伴:TSMC(Gaudi 4、Jaguar Shores)、Intel Foundry(Crescent Island)

Gaudi 4 详细规格

Gaudi 4是Intel旗下Habana Labs(2019年收购)设计的第四代AI加速卡。

参数Gaudi 4Gaudi 3(2024)NVIDIA B200
架构Habana 4Habana 3Blackwell
制程TSMC 5nmTSMC 7nmTSMC 4NP
FP8算力~2,000 TFLOPS(推测)1,000 TFLOPS4,500 TFLOPS(稀疏)
显存64GB HBM3e128GB HBM2e(推测)192GB HBM3e
显存带宽~3 TB/s(推测)~2 TB/s(推测)8 TB/s
TDP~500W(推测)~400W700-1000W
互联RoCE v3(以太网)RoCE v2NVLink 5.0
发布时间2026年3月2024年4月2024年3月
量产时间2026年Q3(推测)2024年Q42024年Q4

📌 :Gaudi 4具体规格尚未完全公开,上表部分为推测值。

Gaudi 4的关键特性

  1. 以太网原生支持:采用RoCE v3(RDMA over Converged Ethernet),无需专用互联协议(如NVLink)
  2. 大规模扩展优化:万卡集群扩展效率优于InfiniBand(成本更低)
  3. 稀疏化加速:MoE模型原生支持
  4. 多精度支持:FP8/FP16/FP32/INT8/INT4
  5. 开放生态:支持PyTorch、TensorFlow、JAX(通过第三方适配)

Jaguar Shores:Intel的下一代GPU

Jaguar Shores是Intel首款真正意义上的数据中心GPU(不是Gaudi那样的ASIC)。

为什么叫"Jaguar Shores"?

  • Jaguar:美洲豹,代表"速度"和"敏捷"
  • Shores:海岸,代表"开放"和"连接"(对标NVIDIA的"海岸"命名风格?)

Jaguar Shores 推测规格

参数Jaguar Shores(推测)NVIDIA RubinAMD MI455X
架构Xeu 3(推测)RubinCDNA 4
制程TSMC 3nm(推测)TSMC 3nmTSMC 3nm
显存HBM4(确认)HBM4HBM4
显存容量288GB(推测)288GB288GB
FP8算力~4,000 TFLOPS(推测)~6,000 TFLOPS6,000 TFLOPS
TDP~800W(推测)~1,000W~800W
发布时间2027年(预计)2026年Q32026年Q3

关键确认

  • HBM4内存:Intel已确认Jaguar Shores将采用SK海力士的HBM4内存
  • TSMC代工:Jaguar Shores将由TSMC生产(不是Intel Foundry)
  • oneAPI原生支持:Jaguar Shores将原生支持oneAPI编程模型

Crescent Island:Intel的首款通用GPU

Crescent Island是Intel在2025年10月公布的首款通用数据中心GPU,采用Xe3架构(Xe-HPG的升级版)。

参数Crescent Island(推测)Intel Data Center GPU MaxNVIDIA L40S
架构Xeu 3Xeu 2(Ponte Vecchio)Ada Lovelace
定位通用计算+AI推理HPC+AI训练AI推理+图形
制程TSMC 5nm(推测)Intel 7 + TSMC 5nmTSMC 4N
显存48GB HBM3(推测)128GB HBM2e48GB GDDR6
TDP~300W(推测)600W350W
发布时间2026年(预计)2023年1月2023年3月

定位

  • 通用GPU:既能做AI推理,也能做科学计算(HPC)
  • 低成本:价格比Gaudi 4更低,对标NVIDIA L40S
  • 开放标准:支持oneAPI、SYCL、Level Zero

Intel AI芯片路线图(2024-2027)

时间产品类型制程备注
2024年Q4Gaudi 3AI ASICTSMC 7nm当前主力
2026年Q2Crescent Island通用GPUTSMC 5nm新发布
2026年Q3Gaudi 4AI ASICTSMC 5nm新发布
2027年Jaguar Shores数据中心GPUTSMC 3nm下一代旗舰
2027年Gaudi 5(推测)AI ASICTSMC 3nm下一代

与竞品对比

Gaudi 4 vs NVIDIA B200

指标Gaudi 4NVIDIA B200
FP8算力~2,000 TFLOPS4,500 TFLOPS
显存64GB HBM3e192GB HBM3e
互联以太网(RoCE v3)NVLink 5.0
软件生态Gaudi Software SuiteCUDA
价格推测 ~$20,000~$45,000
优势以太网成本低、开放生态最成熟、性能最强
劣势软件生态弱、算力低价格昂贵

结论:Gaudi 4的定位是**"性价比训练方案"**,适合对成本敏感、且愿意投入软件适配的客户。

Jaguar Shores vs NVIDIA Rubin

指标Jaguar Shores(推测)NVIDIA Rubin
FP8算力~4,000 TFLOPS~6,000 TFLOPS
显存288GB HBM4288GB HBM4
软件生态oneAPICUDA
量产时间2027年2026年Q3
优势开放标准、可能更便宜生态成熟、先发优势
劣势生态弱、晚1年价格昂贵

结论:Jaguar Shores如果能按时发布,且oneAPI生态有足够改善,可以成为NVIDIA的第三选择(仅次于NVIDIA和AMD)。

软件生态:oneAPI的进步与挑战

oneAPI是什么?

oneAPI是Intel推出的开放、跨架构编程模型

  • 支持CPU、GPU、FPGA、AI加速器
  • 基于SYCL标准(类似CUDA的C++扩展)
  • 开源实现(Intel oneAPI Base Toolkit)

Intel AI Stack

组件用途对标
oneAPI跨架构编程模型CUDA
BigDL分布式深度学习框架PyTorch Distributed
Gaudi Software SuiteGaudi专用软件栈NVIDIA GPU Cloud (NGC)
Intel Extension for PyTorchPyTorch在Intel硬件上的优化NVIDIA PyTorch
Intel Optimization for TensorFlowTensorFlow在Intel硬件上的优化NVIDIA TensorFlow

✅ 进步

  • PyTorch 2.5+:Intel Extension已集成到PyTorch主线
  • Hugging Face Transformers:官方支持Intel GPU(通过optimum-intel)
  • vLLM:实验性支持Gaudi(性能待验证)

⚠️ 挑战

  • 开发者习惯:全球AI开发者都用CUDA,oneAPI学习曲线陡峭
  • 算子覆盖率:很多PyTorch算子还没有oneAPI优化版本
  • 性能:same功耗下,Gaudi 4性能只有B200的50%左右

行业影响

1. Intel能否重返AI竞赛?

挑战

  • 生态劣势:CUDA护城河太深,oneAPI难以撼动
  • 性能劣势:Gaudi 4性能只有B200的50%
  • 时间劣势:Jaguar Shores比Rubin晚1年

机会

  • 开放标准:不依赖CUDA,适合"反NVIDIA垄断"的客户
  • 以太网优势:RoCE v3在万卡集群上成本低于InfiniBand
  • ✅ ** Intel Foundry**:如果Jaguar Shores能用Intel自家工艺生产,成本更低

2. 对AMD的影响

Intel重返AI竞赛,对AMD是坏事:

  • AMD本来是"NVIDIA唯一替代品"
  • 现在Intel也回来了,AMD的"替代品"地位受到挑战
  • 但短期内(2026-2027),Intel还无法威胁AMD

3. 对国产芯片的影响

Intel Gaudi 4的发布,对国产芯片是参考案例:

  • 证明以太网路线(RoCE)可行
  • 证明开放生态(oneAPI)虽难但有必要
  • 证明性价比路线有市场(成本敏感客户)

相关芯片

参考资料


本文基于Intel官方公告及公开资料整理,部分规格为推测值,以Intel官方最终发布为准。