Công nghệ lưu trữ mới đang định hình lại hạ tầng AI

Công nghệ lưu trữ mới đang định hình lại hạ tầng AI
Sở thích|Lưu trữ & mạng

Lưu trữ trở thành điểm nghẽn chiến lược của hạ tầng AI

Lưu trữ AI infrastructure là tập hợp kiến trúc phần cứng và phần mềm dùng để lưu trữ, di chuyển và xử lý các bộ dữ liệu khổng lồ phục vụ huấn luyện, suy luận và tác vụ đa tác nhân trong hệ thống trí tuệ nhân tạo, trong đó tốc độ đưa dữ liệu vào bộ nhớ GPU quan trọng không kém sức mạnh tính toán của chính GPU. Bùng nổ mô hình nền tảng, cửa sổ ngữ cảnh dài và AI tác nhân đang kéo nhu cầu dữ liệu vượt xa dung lượng DRAM truyền thống. Thêm ổ cứng không còn là lời giải: câu hỏi bây giờ là làm sao biến lưu trữ từ chỗ “kho chứa thụ động” thành một lớp bộ nhớ mở rộng, đủ nhanh để đi kịp GPU và đủ an toàn cho các luồng dữ liệu song song ở cấp độ hàng nghìn tác nhân. Các cuộc trình bày tại FMS cho thấy một đồng thuận rõ ràng: AI chỉ mở rộng được nếu ta tái kiến trúc toàn bộ lớp lưu trữ, từ SSD NVMe công suất lớn đến bộ nhớ tích hợp sát HBM.

NVMe SSD công suất lớn: giải bài toán dung lượng, chưa giải xong bài toán băng thông

Sự xuất hiện của DapuStor R6060 512TB E2 NVMe SSD tại FMS khiến nhiều người giật mình về mức độ táo bạo trong thiết kế dung lượng cho lưu trữ AI infrastructure. Một khay máy chủ với 36 khe E2 có thể đạt tới 16PB dung lượng trong một hệ thống đơn lẻ, giảm số khung máy, bo mạch và mô-đun bộ nhớ phải triển khai. Đây là câu trả lời trực diện cho nhu cầu QLC NAND dung lượng cao để chứa dữ liệu huấn luyện, cache suy luận, video và âm thanh, nơi dung lượng quan trọng không kém hiệu năng. Tuy vậy, nếu chỉ nhìn NVMe SSD công suất lớn như một ổ chứa giá rẻ thì là bỏ lỡ cơ hội. Bài toán thực sự là làm sao đưa 512TB đó gần hơn với GPU memory bandwidth, giảm số “lần vượt rào” giữa các tầng lưu trữ để mỗi byte lưu trên flash đều có cơ hội được truy cập ở thang thời gian micro giây, không phải mili giây.

Một điểm thú vị là chuẩn E2 cho phép đặt thêm NAND so với E3.L nhờ tăng chút chiều sâu và chiều rộng thiết bị. Nhưng nếu kiến trúc hệ thống vẫn xem SSD là hàng xa xỉ, bị giới hạn bởi CPU và tầng I/O cũ kỹ, dung lượng khổng lồ sẽ trở thành “di sản bất động” hơn là tài sản AI. Đây chính là lý do ngành bắt đầu nói nhiều hơn đến tính gần (proximity) giữa flash và HBM, thay vì chỉ nói về TB trên nhãn sản phẩm.

Công nghệ lưu trữ mới đang định hình lại hạ tầng AI

zHBM, zNAND-O và BV-NAND: đưa flash lên sát đầu GPU

Nếu DapuStor giải quyết bài toán “nhiều dữ liệu hơn”, thì zHBM Samsung technology lại nhắm vào bài toán “dữ liệu đi nhanh hơn”. Với zHBM, thay vì đặt HBM cạnh AI accelerator, bộ nhớ được xếp chồng thẳng đứng lên trên bộ tăng tốc. Đây là tuyên bố kiến trúc táo bạo: rút ngắn đường truyền, tăng băng thông, cải thiện hiệu suất năng lượng và giảm nhiệt trở hơn một nửa so với HBM5, với hiệu năng có thể cao gấp tối đa 8 lần. Câu nói đáng trích ở đây là: "Hệ thống thế hệ mới ứng dụng zHBM có thể đạt hiệu năng cao gấp tối đa 8 lần so với HBM5, với hiệu suất năng lượng tăng tối đa 3 lần".

Song song, zNAND-O dùng đóng gói 3D tích hợp 4 hoặc 8 chip, dựa trên xếp chồng V-NAND và V10 BV-NAND hơn 400 lớp. Đây không chỉ là cuộc chơi số lớp; nó là cách đẩy flash lại gần bộ tăng tốc, tạo một lớp lưu trữ có tính chất “bộ nhớ dai dẳng” ngay cạnh GPU. Khi flash nằm sát HBM, độ trễ giảm mạnh và GPU memory bandwidth được nuôi bằng dữ liệu đến từ flash trong thang thời gian micro giây, thay vì phụ thuộc hoàn toàn vào DRAM đắt đỏ. Chiến lược IDM “one-stop solution” giúp hãng điều phối từ thiết kế đến đóng gói, rút ngắn thời gian phát triển và tối ưu đồng thời hiệu năng lẫn hiệu suất năng lượng.

Công nghệ lưu trữ mới đang định hình lại hạ tầng AI

MonTitan và kiến trúc lưu trữ cho AI tác nhân: SSD trở thành lớp bộ nhớ dai dẳng

Làn sóng Agentic AI đang đưa yêu cầu lưu trữ lên cấp độ mới: tác nhân AI suy luận liên tục, giữ ngữ cảnh dài, tương tác công cụ bên ngoài và tạo ra đủ kiểu dữ liệu với mẫu truy cập thay đổi nhanh. Trong bối cảnh đó, Silicon Motion giới thiệu MonTitan SSD Reference Design Kit với PerformaShape, nhắm thẳng vào lưu trữ AI infrastructure. Thông điệp quan trọng: enterprise SSD phải trở thành lớp bộ nhớ dai dẳng, hỗ trợ KV cache offload và tác nhân AI tự trị, thay vì chỉ là nơi “ghi log cho xong”.

PerformaShape mang lại Multi-Dimensional Shaping, kết hợp giám sát hiệu năng và API NVMe TP4176 để đảm bảo QoS có thể dự đoán dưới các tải multi-tenant và multi-agent phức tạp. Công nghệ này đã được tích hợp vào controller SM8366 PCIe 5.0 và SM8466 PCIe 6.0. Điều đáng nói không phải là thông số PCIe, mà là việc SSD được thiết kế ngay từ đầu để chịu các tải ghi liên tục, độ trễ phải ổn định và hiệu năng duy trì dưới các mô hình truy cập khó lường. Đây là bước chuyển từ "SSD lưu trữ" sang "SSD làm bộ nhớ", giúp nhà sản xuất có nền tảng mở rộng giải pháp lưu trữ cho AI server và data center, rút ngắn chu kỳ phát triển và thời gian đưa ứng dụng Agentic AI ra thị trường.

NVIDIA, Storage-Next và cuộc tái kiến trúc đường đi của dữ liệu

Lưu trữ không thể tự mình tái tạo mà cần được gắn chặt với GPU. Tại FMS, NVIDIA nhấn mạnh rằng bước tiến tiếp theo của AI không chỉ phụ thuộc vào năng lực tính toán, mà còn vào hạ tầng lưu trữ cấp dữ liệu cho tăng tốc tính toán. GPU giờ đã có thể trực tiếp gửi yêu cầu lưu trữ và tạo hàng nghìn tác vụ song song, khiến tầng dịch vụ dữ liệu như mã hóa, nén, kiểm tra và tái tạo trở thành nguy cơ nghẽn. Trong benchmark, NVIDIA Vera CPU trong hệ thống Vera BlueField-4 STX cho throughput cao gấp 3,21 lần CPU x86 trong pipeline nén–mã hóa hai tầng. Đây là minh chứng rõ ràng rằng tính toán tăng tốc dành riêng cho đường dữ liệu là cần thiết, không chỉ tăng tốc mạng hay suy luận.

Việc mở mã cuFile API – lớp GPU Direct Storage cho phép GPU đọc/ghi dữ liệu từ thiết bị lưu trữ trong thang micro giây nhờ hàng trăm nghìn luồng GPU và bộ nhớ băng thông cao – cho thấy dữ liệu và GPU đang được nối với nhau bằng một stack phần mềm thống nhất theo thực hành tốt của Linux. Sáng kiến Storage-Next tập hợp hơn 40 nhà cung cấp lưu trữ và flash để tối ưu chung bộ nhớ và lưu trữ, biến các tiến bộ thành chuẩn mở có tính tương tác. Cùng với các nền tảng như MonTitan trong data center storage optimization và các thiết kế dung lượng cực lớn như DapuStor 512TB E2, bức tranh rõ ràng: tương lai hiệu năng AI sẽ được quyết định bởi tốc độ và cách dữ liệu đi đến GPU, hơn là số lượng GPU trên rack.

Công nghệ lưu trữ mới đang định hình lại hạ tầng AI

Sammfy nhận hoa hồng khi bạn mua sắm qua liên kết của chúng tôi, bạn không phải trả thêm chi phí.

You May Also Like

Comments
Viết gì đó...
Chưa có bình luận nào. Hãy là người đầu tiên chia sẻ suy nghĩ!