NVIDIA Vera Rubin đang cho thấy một xu hướng đáng chú ý trong hạ tầng AI thế hệ mới: bộ nhớ ngày càng chiếm tỷ trọng lớn trong tổng chi phí hệ thống. Theo phân tích BOM từ UBS, bộ nhớ trên nền tảng Vera Rubin chiếm tới 62% chi phí, tăng từ 53% trên Grace Blackwell. Đáng chú ý, chi phí bộ nhớ đã tăng khoảng 2,5 lần chỉ sau một thế hệ.
Một rack NVIDIA Vera Rubin NVL72 có tổng cộng 74,7 TB bộ nhớ HBM4 và LPDDR5X, tương đương lượng DRAM được sử dụng trong khoảng 4.500 smartphone.
Bộ nhớ trở thành thành phần chi phí lớn nhất trên Vera Rubin
Các hệ thống NVIDIA Vera Rubin được thiết kế để phục vụ những workload AI và HPC quy mô lớn, với lượng GPU, CPU và bộ nhớ ngày càng tăng. Theo dữ liệu được UBS phân tích, bộ nhớ chiếm khoảng 62% tổng chi phí của nền tảng Vera Rubin. Đây là mức tăng đáng kể so với tỷ lệ 53% trên các hệ thống Grace Blackwell trước đó.
Tổng chi phí của Vera Rubin được ước tính cao hơn khoảng 2,1 lần so với thế hệ tiền nhiệm. Tuy nhiên, riêng chi phí dành cho bộ nhớ đã tăng tới 2,5 lần. Điều này cho thấy khi AI accelerator ngày càng mạnh và workload AI ngày càng phức tạp, bộ nhớ đang trở thành một trong những yếu tố quan trọng nhất quyết định chi phí của toàn bộ hệ thống.
NVIDIA Vera Rubin NVL72 có gì bên trong?
NVIDIA Vera Rubin NVL72, có tên mã Oberon, được xây dựng với 72 GPU Rubin và 36 CPU Vera.
Một tray Vera Rubin gồm 4 GPU Rubin và 2 CPU Vera. Hai GPU cùng một CPU được tích hợp trên một bo mạch chủ, tạo thành một Superchip.
Toàn bộ rack NVL72 bao gồm 36 Superchip, tương ứng với:
72 GPU Rubin
36 CPU Vera
Mỗi GPU Rubin được trang bị 288 GB HBM4, cung cấp băng thông bộ nhớ lên tới 22 TB/s.
Trong khi đó, mỗi CPU Vera sử dụng giải pháp SOCAMM2 LPDDR5X với dung lượng lên tới 1,5 TB.
Tính trên toàn bộ rack, hệ thống có:
20,7 TB HBM4
54 TB LPDDR5X
Tổng cộng 74,7 TB bộ nhớ
Ngoài hệ thống bộ nhớ, một rack Vera Rubin NVL72 còn bao gồm các thành phần quan trọng khác như networking, interconnect, hệ thống cấp điện và giải pháp làm mát.

Chi phí của một Vera Rubin Superchip
Theo phân tích của UBS, mỗi Vera Rubin Superchip có chi phí ước tính khoảng 38.902 USD.
Trong số này, riêng HBM4 và SOCAMM2 đã chiếm khoảng 24.297 USD.
Chi phí ước tính của các thành phần chính gồm:
Rubin chip: khoảng 9.247 USD, bao gồm GPU, HBM4, packaging, interposer và các linh kiện ngoại vi.
Vera chip: khoảng 20.059 USD, bao gồm CPU, SOCAMM2 LPDDR5X và khoảng 350 USD cho các linh kiện khác trên bo mạch.
HBM4 trên GPU Rubin: khoảng 4.943 USD.
SOCAMM2 trên CPU Vera: khoảng 19.355 USD.
Đáng chú ý, HBM4 chiếm khoảng 53,4% chi phí của riêng Rubin chip và 12,7% tổng chi phí của một Superchip. Trong khi đó, SOCAMM2 chiếm khoảng 96,4% chi phí của Vera chip và gần 49,8% tổng chi phí Superchip. Nếu loại bỏ chi phí bộ nhớ, riêng CPU Vera được ước tính chỉ có giá khoảng 704 USD. Những con số này cho thấy bộ nhớ đang đóng vai trò rất lớn trong cấu trúc chi phí của hệ thống AI thế hệ mới.
Vera Rubin và Grace Blackwell: chi phí bộ nhớ tăng mạnh
Sự khác biệt giữa Vera Rubin và Grace Blackwell không chỉ nằm ở hiệu năng mà còn ở lượng bộ nhớ được tích hợp vào hệ thống. Trên các hệ thống Grace Blackwell, CPU Grace được trang bị 480 GB bộ nhớ. GPU Blackwell trên GB200 cung cấp 192 GB HBM3E, trong khi GB300 có thể đạt tới 288 GB HBM3E.
Với Vera Rubin, mỗi GPU Rubin được nâng lên 288 GB HBM4, trong khi mỗi CPU Vera có tới 1,5 TB LPDDR5X. Kết quả là tổng dung lượng bộ nhớ trên một rack Vera Rubin NVL72 đạt 74,7 TB.
Nếu quy đổi theo dung lượng DRAM trên smartphone, một rack Vera Rubin tương đương lượng bộ nhớ của khoảng 4.500 smartphone. Và NVIDIA dự kiến sẽ triển khai hàng nghìn rack như vậy trên toàn cầu để phục vụ AI data center, cloud provider, doanh nghiệp và các hệ thống HPC.
Vì sao nhu cầu AI đang gây áp lực lên thị trường DRAM?
Vera Rubin chỉ là một trong nhiều nền tảng AI đang làm gia tăng nhu cầu về bộ nhớ hiệu năng cao.
AMD cũng đang phát triển nền tảng Helios với khả năng cung cấp tới 432 GB HBM4 trên mỗi GPU. Các server thế hệ tiếp theo của AMD cũng được kỳ vọng sử dụng lượng LPDDR5X lớn, tiếp tục làm tăng nhu cầu đối với DRAM.
Bên cạnh NVIDIA và AMD, nhiều công ty công nghệ lớn cũng đang phát triển accelerator và server platform dành cho các workload AI thế hệ mới, bao gồm Agentic AI.
Khi số lượng AI accelerator được triển khai trên toàn cầu tăng lên, nhu cầu đối với HBM, LPDDR5X và các loại bộ nhớ hiệu năng cao khác cũng tăng theo.
Điều này đang tạo thêm áp lực lên chuỗi cung ứng DRAM toàn cầu. Các nhà sản xuất bộ nhớ lớn cũng đang ưu tiên khách hàng AI thông qua những thỏa thuận cung ứng dài hạn.
AI đang chuyển từ cuộc đua GPU sang cuộc đua hạ tầng
Vera Rubin cho thấy một thay đổi quan trọng trong cấu trúc của hệ thống AI. Trước đây, GPU thường được xem là thành phần trung tâm của AI infrastructure. Tuy nhiên, khi các accelerator ngày càng mạnh và lượng dữ liệu xử lý ngày càng lớn, bộ nhớ đang trở thành một phần không thể tách rời của hiệu năng và chi phí hệ thống.
Một rack AI hiện đại không chỉ cần nhiều GPU hơn. Nó còn cần dung lượng bộ nhớ lớn hơn, băng thông cao hơn, networking nhanh hơn, nguồn điện lớn hơn và hệ thống làm mát hiệu quả hơn. Với 74,7 TB bộ nhớ trong một rack, Vera Rubin là một ví dụ rõ ràng cho xu hướng này.
Đối với các doanh nghiệp và data center, bài toán triển khai AI vì thế không còn đơn thuần là lựa chọn accelerator nào mạnh hơn. Các yếu tố như memory capacity, bandwidth, power consumption, cooling, networking, rack density và khả năng mở rộng toàn hệ thống cũng ngày càng quan trọng. Sự gia tăng nhanh chóng của nhu cầu bộ nhớ cho AI có thể sẽ tiếp tục tác động đến chi phí và nguồn cung của toàn bộ ngành hạ tầng AI trong những năm tới.



good
Awesome
Nice