资讯

英伟达Rubin Ultra缩水,SemiAnalysis:瓶颈在于每单位带宽成本,而非每单位容量成本

华尔街见闻·2026/9/6 03:35:28🔗 原文

📋总体概括

SemiAnalysis分析称,英伟达将Rubin Ultra的HBM堆叠从12-Hi下调至8-Hi,可减少约1/3的DRAM裸片用量,核心逻辑是AI推理的真正瓶颈在每单位带宽成本而非容量成本。由于HBM带宽主要由堆栈数量、接口宽度和速率决定,降低堆叠层数在维持带宽的同时缓解了紧张昂贵的HBM供应压力,标志着行业竞争从堆容量转向追求带宽经济性。

关键信息

  • 英伟达将Rubin Ultra的HBM从12-Hi下调至8-Hi,减少约1/3的DRAM裸片用量,缓解HBM供应压力
  • SemiAnalysis判断:当前AI推理受限的是每单位带宽成本($/bandwidth),而非每单位容量成本
  • HBM堆叠层数决定容量,总带宽取决于堆栈数量、接口宽度和传输速率,故降层数不损带宽
  • 推理负载需持续搬运模型权重和KV Cache,带宽重要性正在超越容量
  • HBM竞争逻辑转变:从「容量够不够」转向「每一美元能买到多少带宽」

🔥犀利点评

这次「缩水」其实是认知升级。行业此前被训练思维绑架,以为HBM就该无限堆容量;但推理时代真正烧钱的是搬运权重的带宽,不是躺着的存储空间。英伟达砍掉1/3裸片用量还能维持带宽,等于同时拿捏了HBM供应紧张和成本两条命脉——供应链议价权进一步向自己倾斜。倒是HBM厂商要警惕:客户开始按带宽性价比砍单,靠堆层数涨价的路线可能走到头了。

本文由本站自动聚合,以下为原始来源:前往 华尔街见闻 阅读全文