跳到主要内容

3 篇博文 含有标签「AI 基础设施」

AI 全栈基础设施(芯片+系统+网络)

查看所有标签

昇腾 950 超节点 Q4 上市,中兴、新华三、曙光全线跟进:国产超节点从概念走向交付

· 阅读需 6 分钟
Industry Research Team

芯片追不上,系统来补。这是国产算力过去一年最清晰的战略共识。2026 年下半年,国产超节点正式从"概念发布"进入"产品密集发布、联合适配和商业部署"阶段:华为 Atlas 950 SuperPoD 真机已亮相并计划 Q4 上市,中兴、新华三、中科曙光、壁仞、沐曦等一众厂商相继入局。


1. 华为 Atlas 950:业界最大 1024 卡超节点,Q4 上市

继 7 月 WAIC 2026 真机首秀后,华为昇腾 950 超节点的商用脚步持续加快。核心规格:

指标Atlas 950 SuperPoD
互联规模最大 1024 × 昇腾 950DT(灵衢高速互联)
AI 算力1 EFLOPS FP8/mxFP8/HiF8、2 EFLOPS FP4
全局内存256TB 统一编址,片上内存最大 1024 × 96GB @ 4.0TB/s
互联带宽单柜最大 64 × 1.68 TB/s(双向),3μs 超低 RTT
形态满配 128 计算柜 + 32 互联柜,占地约 1000㎡,8192 颗 950DT
供电散热全液冷,100kW 供电,380V AC/336V DC/240V DC
上市时间2026 年第四季度

在 WAIC 展台之外,两个数字更能说明商业化进度:昇腾 384 超节点已商用落地 750 多套,规模应用于互联网、运营商、金融、教育、医疗等行业,并且是国内唯一训练出 SOTA 模型的超节点;更远期规划中,Atlas 950 SuperCluster(超 50 万颗昇腾芯片)同样定于 2026 Q4,Atlas 960 SuperPoD(15488 卡)与 Atlas 960 SuperCluster(超 100 万卡)将于 2027 Q4 接力。

华为的路线图背后是"Tau Scaling Law"——在 EUV 光刻机受限的前提下,通过系统级扩展突破单芯片物理极限,并计划到 2031 年将晶体管密度推升至 1.4nm 级工艺水平。

2. 超节点赛道全面开花:三条技术路线

WAIC 之后,国产超节点形成了三类清晰的技术路线:

第一类:华为全栈自研。 同时掌握昇腾芯片、灵衢互联、Atlas 硬件、CANN 软件栈和 MindSpore 框架。CANN 已全面开源:社区上线 67 个项目、开源代码超 1244 万行、月活开发者突破 3500 人;昇腾开发者总数超 400 万。

第二类:中兴、新华三的兼容路线。 中兴发布 OEX 超节点新品,依托协议标准化与接口统一,全面兼容多元 GPU 生态;新华三 UniPoD S80000 系列可从 32 卡扩展至 1024 卡、最大支持 16384 卡互联,将 Scale-up/Scale-out 网络、液冷、供电、管理和故障恢复整合进同一套架构。

第三类:国产 GPU 联合创新。 中兴联合曦智、壁仞、沐曦、燧原、天数智芯等,基于 OEX+dOCS 架构打造国产高性能 Matrix 超节点;壁仞计划发布 BR20x 系列 GPU,基于自研 BLink 2.0 互联协议实现单超节点 1024 卡 Scale-up;沐曦推出"曦景"S 系列超节点。

在更大的 Scale-out 层面,中科曙光"曙光 8000(登峰)"全国产十万卡 AI 超集群已落成并接入国家超算互联网——它不是单体超节点,而是由大量计算节点、超节点和网络存储组成的超集群,检验的是国产算力的大规模调度、应用适配和工程交付能力。

3. 为什么"超节点"成了国产算力的主战场

根本原因在于衡量标准变了:国产算力的评价体系,正从"比较单颗芯片的峰值性能"转为"一整套系统能够调动多少有效算力"。华为副董事长徐直军对此直言:单芯片上英伟达仍领先且短期难以追赶,但在超节点和集群层面,华为有信心

这一转向的产业逻辑:

  • 出口管制下的现实选择:单卡制程受限 → 用高速互联把更多 NPU 组织成一台"大计算机";
  • 需求侧真实拉动:万亿参数 MoE 模型的训练与推理,天然需要大规模低时延互联,超节点恰是对症下药;
  • 生态护城河前移:CANN 开源 + MindSpore 兼容 PyTorch,把 CUDA 生态的竞争从"算子覆盖"层面拉回到"开发者规模"层面。

东兴证券指出,全球超节点赛道已聚集微软、Meta、亚马逊、三大运营商、阿里、字节、腾讯、百度、曙光、中兴、浪潮、新华三、海光、沐曦等数十家厂商——格局未定,但英伟达一家独大的局面正在被谷歌 TPU、AMD Helios、华为 Atlas 三股力量同时挑战。

4. 三道关卡:从"造出来"到"卖得动"

业内人士普遍认为,国产超节点距离真正成熟还有三道坎:

  1. 单芯片性能与单柜算力密度:受制程限制,单卡性能差距仍存,现阶段靠多柜互联和规模扩展另辟蹊径;
  2. 规模扩展效率:超节点扩展到一定规模后性能提升边际递减,通信复杂度、能耗和容错成本持续上升;
  3. 可验证的商业价值:下一阶段的比拼是有效算力利用率、单位 token 成本、模型适配广度与客户复购意愿。

一句话总结:2026 年是"中国超节点元年",2027 年见真章——届时 Atlas 950 与 Vera Rubin NVL 系列将在全球两个平行市场各自接受规模化交付的检验。


相关链接

参考资料


本文基于 WAIC 2026 现场报道、昇腾社区官方规格与公开研报整理。超节点性能数据均为厂商公布口径,独立第三方评测结果尚待观察。

Vera Rubin 全面量产:100% 全液冷 + 800V 直流供电,AI 数据中心基础设施范式重构

· 阅读需 6 分钟
Industry Research Team

2026 年 9 月初,供应链信息确认:英伟达 Vera Rubin 平台已于 8 月正式量产、9 月启动批量出货,无延期、无卡顿。与 Blackwell 迭代初期的产能波折不同,这次量产节奏异常平稳——谷歌云、微软 Azure、CoreWeave、甲骨文云等头部云厂商已启动机架部署。但真正值得产业记住的,不是"又一代 GPU 量产了",而是 Rubin 把液冷从"可选配置"变成了"硬性前置条件"


1. 量产节奏:史上最平稳的一次平台切换

根据产业链调研与券商跟踪信息:

  • 2026 年 8 月:Vera Rubin 正式量产;
  • 2026 年 9 月:批量出货启动;
  • 2026 下半年:CoreWeave、谷歌云、微软 Azure、甲骨文云机架部署落地;
  • 2026 年:上代 GB 架构机柜出货量有望达 6 万台(同比翻倍);
  • 2027 年:GB 与 Rubin 两代平台合计出货体量有望接近 10 万台,Rubin 新机柜远期产能目标为每天 1000 个 NVL72 机柜

需求侧同样在加码:华尔街报告披露,英伟达管理层表示 FY28 同比增长 70% 的目标并非需求上限——若供应不受限,增速可能超过 100%。当前主要约束已从需求端转向先进晶圆与 HBM 供应

2. 单卡 2300W:风冷时代的终结

Rubin 平台与前代最根本的差异不在算力,而在功耗密度:

指标H100GB300Rubin
单 GPU TDP700W~1400W2300W
机柜功耗~40kW~140kW190–230kW
散热方案风冷为主风液混合100% 全液冷
供电架构48V48V800V 高压直流

单芯片 TDP 从 700W 升至 2300W、单机柜功率密度突破风冷物理极限——这意味着 液冷不再是高端算力的选配升级,而是运行 Rubin 服务器的先决条件。英伟达官方将 Rubin 全液冷架构定义为"数据中心历史上最重要的能效突破之一",并已写入 DSX AI 工厂参考设计:所有跟随英伟达技术路线的云厂商和数据中心运营商,都必须采用全面液冷方案。

三个关键架构变化:

  1. 无风扇整机:GPU、CPU、交换机、DPU 全部器件强制采用直接冷板式液冷,45℃ 温水冷板成为出厂标配;
  2. 液冷边界延伸:散热覆盖范围从 GPU 冷板延伸至 CPU、DPU、交换机乃至光模块(液冷 Cage/鼠笼开始从"可选"变"刚需"),整套液冷系统价值量较 GB300 提升约 40%
  3. 800VDC 供电:替代传统 48V 机架配电,整机电源 BOM 价值增长 30% 以上,PSU 电源模块从 5.5kW 向 18.3kW 迭代,固态变压器、高压直流 CDU 成为数据中心新增核心设备。

3. 对产业链的三重传导

第一重:液冷从"配套"变"主角"。 2026 下半年以小规模部署验证为主,真正的放量窗口在 2027 年——Rubin 机架大规模铺货后,冷板、快速接头、CDU、液冷泵进入业绩兑现期。台系供应链 7 月数据已率先验证:AVC 奇鋐 7 月营收 185.9 亿新台币创历史新高(同比 +57.4%),双鸿、健策 7 月同比分别 +116.7%、+91.0%。

第二重:国产液冷供应链进入核心 BOM。 国内厂商由外围冷源和代工环节逐步进入芯片平台、服务器 ODM 和海外云厂商供应体系,替代路径从 Manifold、管路推进至高可靠快接头和冷板。英维克 26H1 海外收入占比 71.4%,飞龙股份液冷泵小功率平台订单超 5 万台——液冷全核心零部件自主可控正在成为现实。

第三重:供电与散热边界融合。 800VDC 架构下,电源模块、PDB 配电单元、高速交换芯片自身发热也达到很高水平,部分电源组件同样需要液冷辅助散热——电源与温控两条产业链正在合并成一条。

4. 需求矩阵扩容:云厂商之外,太空算力入场

Rubin 的客户矩阵已从传统云厂商扩展至三个层次:

  • 全球云厂商:谷歌云、Azure、甲骨文云、CoreWeave;
  • AI 科技巨头:马斯克公开披露 2027 年 8GW 超大规模 IDC 建设规划;SpaceX 将 Vera Rubin 架构定义为"最优 AI 计算架构",计划地面与太空双向部署,支撑 "Starmind" 卫星算力项目;
  • 主权与边缘:远期 Rubin Ultra 及 2027 年后更高功耗机型单机柜有望冲击 600kW+。

普华永道预计全球数据中心累计投资到 2035 年将达 31.6 万亿美元。AI 基础设施建设的确定性,已经从"是否建设"变成"多快建设"。

5. 对采购方的启示

  • 机房规划前置:2027 年起采购 Rubin 级算力,液冷改造(单千瓦改造成本较高)或按全液冷标准新建,必须在预算周期一开始就纳入;
  • 看 PUE 也看水温:45℃ 温水直冷允许更高进水温度,可利用自然冷源压低 PUE——选址时人工冷源依赖度成为新的评估维度;
  • 供应商组合即风险对冲:HBM 与先进封装供应是当前核心瓶颈(详见本站 HBM4 竞速分析),供应链多元化比单点性能更重要。

相关链接

参考资料


本文基于 2026 年 9 月初供应链调研、券商研报与英伟达官方披露整理。出货量与功耗数据为产业链预估口径,实际以英伟达及客户正式披露为准。

云巨头自研芯片浪潮 2026:OpenAI Jalapeño、Maia 200、MTIA、TPU v8 集体"去英伟达化"

· 阅读需 6 分钟
Industry Research Team

2026 年 8 月 Hot Chips 的周二下午 AI 专场,是本届最有历史意义的一场——不是因为某颗芯片多强,而是因为登台的几乎全是"超算厂商去 NVIDIA 化"的自研 ASIC:Google 第八代 TPU、OpenAI 首颗自研芯片、微软 Maia、Meta MTIA、Cerebras 晶圆级机架同台。当全球最大的 AI 算力买家开始把 GPU 当作"可选项之一",AI 硬件的权力结构正在松动。


1. OpenAI Jalapeño:9 个月造出一颗芯片

OpenAI 于 2026 年 6 月 24 日联合博通发布首款自研推理 ASIC Jalapeño,是"自研推理芯片俱乐部"的第五个成员。

维度Jalapeño
合作方博通(Broadcom)+ 台积电制造
定位推理专用 ASIC
设计周期端到端 9 个月(Greg Brockman 称借助 OpenAI 自有模型辅助设计)
成本目标较通用 GPU 栈 token 成本降约 50%
商用时间2026 年底首批部署,长期目标 10GW 自研芯片
合作规模与博通最高 100 亿美元战略合作(2029 年前部署加速器与网络)

演讲标题"You Can Just Build Things … Chips"本身就是信号:最大的 AI 算力买家不再默认 GPU 是唯一路径。


2. Google TPU v8:十年来最大架构转向——训练/推理分芯

Google 拥有最悠久的自研芯片历史(2016 至今),第八代 TPU 首次将产品线一分为二

型号代号合作方定位关键规格
TPU 8tSunfishBroadcom训练单 pod 9600 卡、121 FP4 ExaFLOPS、2PB 共享 HBM、ICI 带宽翻倍
TPU 8iZebrafishMediaTek推理288GB HBM、384MB 片上 SRAM(3× 上代)、ICI 19.2 Tb/s

产能方面,摩根士丹利基于供应链访谈估算 2026 年 Google TPU 产量可能超 300 万颗(券商预测,非官方目标)。Google 也是唯一实现自研芯片大规模部署并对外销售算力的厂商(Gemini 跑在 TPU 上)。


3. Meta MTIA:从推荐系统到 GenAI 双使命

Meta 的自研之路起点最清晰——MTIA 最初为推荐排序硬件而生,正被生成式 AI 拉向双使命

  • MTIA 300 已部署;400 / 450 / 500 计划在 2027 年前约每 6 个月推出一款;
  • 基于 RISC-V,Meta 称最高 25× 算力增益
  • 节点沿行业节奏演进:100(7nm)→ 200(5nm)→ 300 系列(3nm + CoWoS);
  • 博通合作,据称另一颗代号 Iris 的芯片已于 2026 年 7 月通过测试;
  • Meta 计划 2026 年 9 月启动其中一款的量产,以将其整体算力翻倍。

4. 微软 Maia 200/300:部署最领先

微软 Maia 200 于 2026 年 1 月 26 日发布,是四家中部署最先进的:

维度Maia 200
制程台积电 3nm,1400 亿+ 晶体管
算力10+ PFLOPS FP4 / 5 PFLOPS FP8
显存216GB HBM3E,7 TB/s
功耗750W
部署已在得梅因(Des Moines)数据中心运行,服务 OpenAI GPT-5.2 与 Microsoft 365 Copilot

微软称其在特定基准上约 3× 亚马逊 Trainium 性能。短期策略是"自研 Maia + 外购英伟达"双路线并行——自研芯片从设计到量产需要时间,英伟达成熟生态短期内无法替代。


5. 亚马逊 Trainium 3 与 Anthropic 自建团队

  • 亚马逊:Trainium 系列已商用,累计部署 140 万颗(官方披露),是数十亿美元业务;优势在 AWS 客户基数——企业可在英伟达 GPU 与自研芯片间选择。Trainium 3 延续这一路线。
  • Anthropic:2026 年 8 月宣布组建自建芯片团队,尚无 tape-out 或量产时间表,初期定位为补充(而非取代)与 NVIDIA/AMD/AWS/Google Cloud 的现有合作,目标是为 Claude 架构量身打造、摆脱对单一 GPU 的依赖。

6. NVIDIA 的回应:不是更快的 GPU,而是全栈

容易把叙事简化成"四家造芯片、英伟达防守 GPU"。但 NVIDIA 在 Hot Chips 拿了 6 个 slot:RISC-V 教程、Vera CPU、Rubin GPU、BlueField-4 DPU、Spectrum-X 多平面网络、以及 LPU 加速器。

一颗 hyperscaler ASIC 只替换了这五个支柱中的一个。如果 CPU、NIC、交换 fabric 与软件都来自同一家供应商,把加速器换掉省下的,比加速器那一行账单暗示的要少得多。Rubin 的打法是一个横跨七颗芯片、五种机柜的全栈 AI 工厂平台——竞争回应是"全栈位置",而非"更快的一颗芯"。


7. 趋势判断:推理去 GPU 化,训练仍 GPU 主导

  • 推理侧:CUDA 护城河明显变浅。推理在端点层面可并行、可替换,自研 ASIC 通过剪掉通用性税(只实现 LLM 实际执行的操作)换取更低 cost/token。Groq LPU、Cerebras、各家 TPU/ASIC 都在同一指标上竞争。
  • 训练侧:Foundation model 仍用 GPU 训练,短期内无人认真挑战。NVIDIA 在训练的三道护城河(最快硅 + NVLink + CUDA)依旧牢固。
  • 结论:自研芯片不是"替代英伟达",而是在推理这一最大、增长最快的战场上,给买家一个可信的谈判外部选项——这本身就足以重塑 AI 基础设施的经济学。

相关链接

参考资料


本文基于 2026 年 8 月 Hot Chips 现场报道、企业公告与行业分析整理。部分产能与性能为券商估算或厂商公布口径,实际以量产产品为准。