本期周报聚焦AI服务器供应链最新动态。过去一周,供应链核心节点呈现“冰火两重天”的态势:一方面,以H20为代表的特定GPU型号交期显著缩短,渠道库存有所松动;另一方面,围绕B200/GB200等下一代架构的HBM与先进封装产能争夺战愈演愈烈。随着超大规模云厂商(CSP)资本支出的持续落地,AI服务器出货量在Q3有望迎来实质性拐点。
当前GPU供应链正从“全面性短缺”向“结构性紧缺”演变,具体表现如下:
受美国出口管制新规影响,国内市场H20需求前期呈现报复性反弹,导致一季度交期一度拉长至16-20周。本周监测数据显示,H20交期已回落至8-10周,部分核心代理商甚至有少量现货敞口。价格方面,H20渠道溢价从峰值的30%回落至10%-15%区间。随着交期常态化,国内互联网大厂及智算中心的集采进度明显加快。
国际市场上,H100/H200的供应紧张局面大幅缓解,交期已稳定在8周左右。台积电(TSMC)正按计划将部分CoWoS产能向B200/GB200过渡。目前5nm/4nm先进制程产能充足,核心瓶颈依然在CoWoS封装端。台积电目标在今年底将CoWoS月产能提升至4万片以上,但短期内仍无法完全满足NVIDIA的激进需求。
B200/GB200的量产时间表成为本周供应链焦点。尽管NVIDIA宣称B系列将在Q4量产,但供应链上游反馈,12层堆叠HBM3e的良率仍是最大制约因素。SK海力士作为核心供应商,其HBM3e产能已被NVIDIA包圆,而三星的HBM3e良率尚未达到NVIDIA的认证要求。这导致B系列初期出货量可能低于预期,溢出效应或将拉长H200的生命周期。
GPU供应的边际改善直接传导至服务器整机出货端,本周ODM/OEM厂商的排产与拉货数据呈现以下特征:
广达、纬创、富士康等核心代工厂表示,自6月起AI服务器订单能见度已延伸至年底,Q3出货量环比增速预计将超过20%。微软、Meta、谷歌等北美CSP基于大模型训练与推理的庞大算力消耗,持续上调年度资本支出,成为出货量增长的核心引擎。国内市场,随着H20到货量增加,三大运营商及地方智算中心的AI服务器交付量也在稳步回升。
从HGX架构向GB200 NVL72机架架构的演进,使得AI服务器的交付模式发生根本性改变。本周供应链反馈,GB200机柜的组装、调试与液冷集成耗时远超传统机架。单柜72颗GPU的互联测试、微裂缝检测以及冷却液漏液测试,极大拉长了ODM的系统级交付周期。预计GB200从零部件齐套到最终交付CSP,需要额外增加2-3周的厂内验证时间。
随着单机柜功耗突破100kW,液冷已从“可选项”变为“必选项”。本周监测发现,冷板、CDU(冷量分配单元)及UQD(快插接头)的交期严重拉长。尤其是UQD接头,由于行业认证壁垒高,全球产能高度集中,当前交期已拉长至20周以上,成为制约高密度AI服务器按时交付的“卡脖子”环节。
在CSP定制化需求面前,白牌服务器(由广达、纬创等ODM直供)的市场份额进一步扩大,目前已占据全球AI服务器出货量的70%以上。传统品牌商(如Dell、HPE、联想)被迫将战场转移至企业级市场(Enterprise Market),主打软硬一体化的全栈解决方案及售后运维服务。
随着第一批大规模H100集群投入运营,运维端反馈的问题集中爆发。高负载下GPU的内存故障率(如ECC Error)、HBM过热降频以及NVLink通道挂死现象频发。实际运行中,万卡集群的有效算力利用率往往只有50%-60%。如何通过运维手段提升MTBF(平均故障间隔时间),成为渠道商向客户交付时的核心附加值。
针对当前供应链动态,对IT采购与渠道决策者提出以下建议: