HBF: Dung Lượng Gấp 14 Lần, Nhưng Băng Thông Chỉ Bằng 60% HBM
HBF đang tiến gần hơn tới thương mại hóa, mang lại dung lượng bộ nhớ lớn hơn nhiều lần HBM với chi phí tương đương. Nhưng đổi lại, băng thông thấp hơn đáng kể khiến HBF khó thay thế HBM trong các workload AI cần throughput cao.
HBF đang nổi lên như một công nghệ bộ nhớ mới đáng chú ý, hứa hẹn dung lượng lớn hơn đáng kể so với HBM với mức chi phí tương đương. Tuy nhiên, vai trò của HBF có thể bị giới hạn hơn so với kỳ vọng ban đầu.
Theo Tom’s Hardware, tại Hot Chips 2026, công ty GPU IP OXMIQ Labs cho rằng High Bandwidth Flash (HBF) khó có thể thay thế High Bandwidth Memory (HBM) trong phần lớn các workload. Reuters cho biết OXMIQ được thành lập bởi Raja Koduri, cựu kiến trúc sư trưởng của Intel và lãnh đạo tại AMD, đồng thời phát triển kiến trúc chip và phần mềm có thể cấp phép nhằm giảm chi phí tính toán AI.
Dung lượng của HBF tăng mạnh nhưng phải đánh đổi bằng băng thông
Theo Tom’s Hardware, HBF được xây dựng trên nền tảng 3D NAND, với lợi thế chính nằm ở dung lượng thay vì hiệu năng. HBF có thể cung cấp dung lượng cao hơn HBM khoảng 8–16 lần với chi phí tương đương.
Vì vậy, OXMIQ cho rằng HBF nên được xem là một công nghệ bộ nhớ dung lượng cao, thay vì một giải pháp thay thế HBM với chi phí thấp hơn. Lợi thế của HBF tập trung vào những workload cần lượng bộ nhớ rất lớn nhưng không đòi hỏi băng thông quá cao.
OXMIQ minh họa sự đánh đổi này bằng mô hình một rack gồm 72 GPU chạy mô hình Kimi-K2 với 1 nghìn tỷ tham số ở FP4.
Với cùng chi phí và mức tiêu thụ điện, thay HBM bằng HBF giúp tăng dung lượng bộ nhớ khoảng 14 lần, từ 20,7 TB lên 294,9 TB. Tuy nhiên, tổng băng thông chỉ đạt khoảng 0,6 lần, tương đương 922 TB/s so với 1.584 TB/s của HBM.
Dung lượng lớn hơn của HBF có thể giúp giảm đáng kể số lượng GPU cần thiết chỉ để chứa các mô hình rất lớn. Theo mô hình của OXMIQ, một GPU sử dụng HBF có thể đảm nhiệm về mặt dung lượng tương đương khoảng 8 GPU sử dụng HBM.
Tuy nhiên, khi throughput inference tăng lên, băng thông thấp hơn của HBF sẽ trở thành nút thắt. OXMIQ ước tính rằng trong trường hợp này, HBM cuối cùng có thể mang lại chi phí trên mỗi token thấp hơn.

HBF có thể được dùng vào đâu và thách thức nằm ở đâu?
Thay vì xem HBF là một phiên bản HBM chậm hơn, OXMIQ hình dung HBF như một tầng bộ nhớ dung lượng cao dành cho dữ liệu ít được truy cập, trong khi dữ liệu được sử dụng thường xuyên vẫn nằm trong HBM.
Theo Tom’s Hardware, các ứng dụng tiềm năng bao gồm:
Lưu trữ các expert pool lớn nhưng ít được truy cập trong các mô hình MoE.
Lưu trữ KV cache.
Các workload cần dung lượng bộ nhớ rất lớn nhưng không liên tục yêu cầu băng thông cao.
Tuy nhiên, việc sử dụng HBF song song với HBM sẽ đòi hỏi những thay đổi đáng kể đối với phần mềm inference hiện nay.
OXMIQ cho biết các framework như vLLM sẽ cần hỗ trợ HBF riêng để quản lý việc phân bổ dữ liệu và prefetching, đồng thời phải tính đến giới hạn về độ bền ghi (write endurance) của HBF.
Điều này cũng đặt ra câu hỏi về khả năng được áp dụng rộng rãi. Vì HBF chỉ mang lại lợi ích rõ rệt cho một số workload nhất định, AMD và NVIDIA có thể không có nhiều động lực để hỗ trợ HBF trên diện rộng, do việc quản lý nhiều tầng bộ nhớ sẽ làm tăng độ phức tạp của hệ thống.
HBF đang tiến gần hơn tới thương mại hóa
Phân tích này xuất hiện trong bối cảnh HBF đang tiến gần đến giai đoạn thương mại hóa.
Sandisk và SK hynix đã công bố đặc tả HBF mở đầu tiên thông qua Open Compute Project (OCP) vào tháng 8, hỗ trợ dung lượng lên tới 512 GB và băng thông lên tới 3,0 TB/s.
Theo StorageReview, tại Investor Day tháng 8, Sandisk cũng tiết lộ rằng memory die HBF đầu tiên đã hoàn tất tape-out, với các mẫu sản phẩm HBF dành cho inference dự kiến được cung cấp vào năm 2027.
Điểm đáng chú ý: HBF có thể không phải là “HBM giá rẻ”. Vai trò thực tế của nó có thể nằm ở việc trở thành một tầng memory mới nằm giữa HBM và NAND/SSD — ưu tiên dung lượng lớn hơn là băng thông cực cao.
Chia sẻ bài viết
Bình luận
( 0 bình luận )Bình luận của bạn
Tin tức liên quan
