엔비디아 루빈 울트라 축소. SemiAnalysis: 병목 현상은 단위 용량당 비용이 아니라 단위 대역폭당 비용
• 엔비디아, 루빈 울트라 HBM을 12-Hi에서 8-Hi로 하향 조정한 핵심 이유는 단순히 용량 축소가 아님. 현재 AI 추론의 진짜 병목은 단위 용량당 비용($/capacity) 아닌 단위 대역폭당 비용($/bandwidth)이기 때문
• HBM 스택 수는 주로 용량 결정. 총 대역폭은 HBM 스택 수, 인터페이스 폭 및 전송 속도에 더 많이 의존. 이에 12-Hi에서 8-Hi로 낮추면 DRAM 다이 사용량을 약 1⁄3 로 줄일 수 있고, HBM 공급 압력 완화 가능. 스택 수 및 인터페이스 구성 변동없이 전체 대역폭 유지 혹은 향상 가능
• 엔비디아의 '더 적은 HBM 용량으로 더 높은 대역폭 경제성 교환'하려는 적극적인 움직임을 시사
• 메모리 대역폭 중요성 확대. 추론 위주의 AI 워크로드의 경우 모델은 단순히 ‘더 많은 데이터를 담는 것’만이 아닌 모델 가중치와 KV 캐시를 지속적이고 빠르게 운반해야 하기 때문
• Rubin Ultra의 조정은 HBM 경쟁 논리가 변화하고 있음을 반영. AI칩은 더 이상 단순히 HBM 용량 키우는 것이 아닌 제한된 DRAM, 전력 소모 및 비용 제약 속 가능한 최고의 유효 대역폭 추구를 목표
• HBM의 핵심 병목 현상은 ‘용량이 충분한가’에서 ‘1달러에 얼마나 많은 대역폭을 살 수 있는가’로 전환
英伟达Rubin Ultra缩水,SemiAnalysis:瓶颈在于每单位带宽成本,而非每单位容量成本
SemiAnalysis表示,英伟达 将 Rubin Ultra 的 HBM 从 12-Hi 下调至 8-Hi,核心原因并非单纯降低容量,而是当前 AI 推理真正受限的是 每单位带宽成本($/bandwidth),而非每单位容量成本($/capacity)。
HBM 堆叠层数主要决定容量,而总带宽更多取决于 HBM 堆栈数量、接口宽度和传输速率。因此,从 12-Hi 降至 8-Hi,可以减少约 1⁄3 的 DRAM 裸片用量,缓解当前紧张且昂贵的 HBM 供应压力,同时在堆栈数量和接口配置不变的情况下,仍可维持甚至提高整体带宽。
这意味着 英伟达 正在主动用更少的 HBM 容量换取更高的带宽经济性。对于越来越以推理为主的 AI 工作负载而言,模型并不只是需要“装下更多数据”,更需要持续、快速地搬运模型权重和 KV Cache,因此内存带宽的重要性正在上升。
Rubin Ultra 的调整反映出 HBM 竞争逻辑正在发生变化:AI 芯片追求的已经不再是单纯堆高 HBM 容量,而是在有限的 DRAM、功耗和成本约束下,获得尽可能高的有效带宽。HBM 的核心瓶颈正在从“容量够不够”,转向“每一美元能买到多少带宽”。
https://wallstreetcn.com/charts/41959768
Wallstreetcn
英伟达Rubin Ultra缩水,SemiAnalysis:瓶颈在于每单位带宽成本,而非每单位容量成本 - 华尔街见闻
SemiAnalysis表示,英伟达 将 Rubin Ultra 的 HBM 从 12-Hi 下调至 8-Hi,核心原因并非单纯降低容量,而是当前 AI 推理真正受限的是 每单位带宽成本($/bandwidth),而非每单位容量成本($/capacity)。
HBM 堆叠层数主要决定容量,而总带宽更多取决于 HBM 堆栈数量、接口宽度和传输速率。因此,从 12-Hi 降至 8-Hi,可以减少约 1⁄3 的 DRAM 裸片用量,缓解当前紧张且昂贵的 HBM 供应压力,同时在堆栈数量和接口配置不变的情况下,仍可维持甚至提高整体带宽。…

3September 6, 2026 2K 63