Lưu trữ AI bước sang kỷ nguyên dung lượng khổng lồ và độ trễ thấp
Lưu trữ AI cỡ lớn là lớp hạ tầng dữ liệu dùng SSD dung lượng khổng lồ và hệ thống NAS tích hợp AI để giữ, truy cập và xử lý bộ dữ liệu huấn luyện cũng như suy luận với độ trễ thấp, bảo đảm băng thông liên tục cho GPU và agent AI, đồng thời tối ưu chi phí vận hành trung tâm dữ liệu. Những năm trước, câu chuyện AI chủ yếu xoay quanh sức mạnh GPU; bây giờ, tại FMS 2026 công nghệ lưu trữ mới cho thấy nút thắt thực tế nằm ở khả năng nuốt trọn kho dữ liệu huấn luyện, KV cache và nội dung đa phương tiện đang tăng theo cấp số nhân. Nhìn từ góc độ người làm sản phẩm AI, vấn đề không còn là “có đủ nhanh không” mà là “có đủ chỗ và đủ ổn định để chạy 24/7 hay không”.
DapuStor R6060 512TB: đẩy trần dung lượng cho hạ tầng trung tâm dữ liệu AI
Trong bối cảnh nhiều hãng bắt đầu giảm tốc cuộc đua tăng dung lượng SSD, DapuStor lại đi ngược dòng với mẫu R6060 E2 NVMe đạt tới 512TB trên một ổ duy nhất. Đây là SSD dung lượng khổng lồ hướng thẳng vào hạ tầng trung tâm dữ liệu AI: với 36 khay E2 trong một máy chủ, tổng dung lượng có thể chạm mốc 16PB trên một hệ thống đơn lẻ. Về mặt kiến trúc, chuẩn EDSFF E2 cho phép đặt nhiều NAND hơn E3.L nhờ kích thước sâu và rộng hơn, biến mỗi khay thành một “kho dữ liệu” thay vì chỉ là thiết bị lưu trữ thông thường. Với nhu cầu giữ toàn bộ bộ dữ liệu huấn luyện, cache suy luận và video, audio doanh nghiệp trong cùng một cụm, cách tiếp cận này hợp lý hơn việc dàn trải hàng loạt node nhỏ vừa tốn khung máy, bo mạch, vừa làm phức tạp quản lý dung lượng.
Đáng chú ý, DapuStor chọn QLC NAND dung lượng cao vì nhận ra rằng với workload AI hiện tại, yếu tố quyết định không phải là IOPS đỉnh mà là khả năng ôm trọn dữ liệu trong cùng một không gian lưu trữ. Đây là quyết định mang tính thực dụng: các cụm GPU cho huấn luyện mô hình lớn đang bị giới hạn bởi dung lượng hơn là tốc độ, và việc gom dung lượng về ít khay hơn cũng giúp giảm số thanh RAM, chassis và bo mạch chủ cần thiết để đưa toàn bộ hệ thống vào hoạt động. Ai đang xây cụm GPU cho LLM, RAG hay multi-modal mà vẫn nghĩ dùng nhiều server 2U với SSD 256TB là tối ưu, cần nhìn lại: 512TB trên mỗi khay E2 đang mở ra một trật tự mới cho thiết kế trung tâm dữ liệu.
| Thông số | Giá trị | Góc nhìn AI |
|---|---|---|
| Dung lượng mỗi ổ | 512TB (E2 NVMe) | Giảm số lượng ổ để đạt tới vài petabyte |
| Dung lượng tối đa trên 1 hệ thống | 16PB với 36 khay E2 | Đủ chỗ cho nhiều bộ dữ liệu huấn luyện cỡ web-scale |
| NAND sử dụng | QLC dung lượng cao | Ưu tiên dung lượng và chi phí cho workload AI đọc ghi hỗn hợp |

MonTitan SSD RDK: NVMe tối ưu AI và lớp "bộ nhớ bền" cho agent
Song song cuộc đua dung lượng, câu hỏi quan trọng không kém là làm sao để SSD NVMe tối ưu AI chịu được các yêu cầu QoS khắt khe của agent AI luôn bật 24/7. MonTitan SSD Reference Design Kit của Silicon Motion trả lời bài toán này bằng PerformaShape, một kiến trúc phần cứng mới hỗ trợ Multi-Dimensional Shaping để kiểm soát workload chính xác hơn. Theo Silicon Motion, “PerformaShape™ đã được tích hợp vào cả hai controller SSD enterprise SM8366 PCIe 5.0 và SM8466 PCIe 6.0”. Mục tiêu không phải là thêm vài phần trăm hiệu năng mà là biến SSD enterprise thành lớp bộ nhớ bền (persistent memory) có thể gánh KV cache, ngữ cảnh dài và trạng thái của nhiều agent AI đồng thời.
Khác với ứng dụng AI truyền thống vốn chủ yếu suy luận một lần rồi trả kết quả, agent AI liên tục suy nghĩ, hành động, giữ ngữ cảnh và tương tác với công cụ bên ngoài, tạo ra các kiểu dữ liệu đa dạng cùng pattern truy cập thay đổi nhanh. Điều này ép hạ tầng trung tâm dữ liệu phải đảm bảo throughput cao, độ trễ ổn định, QoS dự đoán được và độ bền ghi đủ cho workload luôn ghi liên tục. MonTitan RDK được xây trên nền tảng đó, cung cấp bộ khung để nhà sản xuất SSD phát triển dòng sản phẩm mới cho server và data center AI, rút ngắn vòng đời phát triển và đưa giải pháp Agentic AI ra thị trường nhanh hơn. Nếu coi GPU là "bộ não" thì các SSD theo chuẩn này đang trở thành "bộ nhớ dài hạn" mà AI logic có thể tin cậy khi mở rộng quy mô lên hàng nghìn agent.
OmniCore: lưu trữ AI NAS all-SSD, ưu tiên tốc độ và quyền riêng tư cho người dùng
Ở phía người dùng cuối và nhóm sáng tạo, Digiera giới thiệu OmniCore như một lưu trữ AI NAS all-flash, dùng hoàn toàn M.2 NVMe SSD, nhắm tới bất kỳ ai cần kiểm soát dữ liệu riêng tư với tốc độ cao. Chỉ riêng việc bỏ hoàn toàn ổ cứng quay đã giúp tốc độ truyền tải bền vững nhanh hơn khoảng năm lần so với các hệ thống NAS dùng HDD tương đương. OmniCore có ba cấu hình: Base 56TB, Pro và Ultra; hai phiên bản sau hỗ trợ tới 176TB với 11 khe SSD, mỗi ổ lên tới 16TB dung lượng, đủ cho thư viện media cá nhân lẫn các workflow sản xuất nhiều người dùng. Đây không chỉ là một hộp lưu trữ; toàn bộ bộ tính năng AI – từ AI Search, AI Album tới AI Chat, AI Knowledge Base, AI Transcription và AI File Assistant – đều chạy trực tiếp trên NAS bằng năng lực AI tích hợp trên thiết bị.
Nhờ xử lý AI cục bộ, dữ liệu luôn nằm trên thiết bị, không bị gửi ra máy chủ ngoài khi dùng các tính năng tìm kiếm, phân tích, tóm tắt hay sáng tạo nội dung. Điểm cộng khác là OmniCore dùng chuẩn M.2 NVMe phổ biến và hỗ trợ SSD của nhiều hãng, không khóa vào ổ độc quyền hay giới hạn dung lượng bằng phần mềm. Về kết nối, Base có mạng dual 2.5GbE, trong khi Pro và Ultra nâng lên dual 10GbE, thêm Thunderbolt 4, USB-C 4.0 và HDMI 8K/60Hz, phù hợp workflow dựng phim 4K, 8K và máy ảo, container. Bản Ultra dùng CPU Intel Core Ultra X7 358H với 16 nhân, khoảng 180 TOPS AI và 64GB LPDDR5, đủ để chạy suy luận LLM cục bộ ngay trên NAS. OmniCore sẽ sớm ra mắt thông qua một chiến dịch Kickstarter và còn dự định bổ sung gói Cloud AI với nhiều mô hình từ bên thứ ba kèm hạn mức token miễn phí.

Từ petabyte trong rack đến NAS trong phòng làm việc: bức tranh lưu trữ AI mới
Khi nhìn tổng thể, ba hướng phát triển tại FMS 2026 công nghệ lưu trữ cho AI cho thấy một bức tranh rõ nét: ở tầng trung tâm dữ liệu, SSD dung lượng khổng lồ như DapuStor R6060 giúp gom hàng chục petabyte vào ít node hơn, giảm phức tạp hạ tầng và làm cho việc giữ toàn bộ bộ dữ liệu huấn luyện trong một cluster trở nên khả thi. Ở tầng logic và QoS, MonTitan RDK đẩy NVMe tối ưu AI trở thành lớp bộ nhớ bền cho agent, đảm bảo độ trễ và độ bền ghi cho hàng loạt KV cache và trạng thái dài hạn. Ở tầng gần người dùng, OmniCore chứng minh lưu trữ AI NAS có thể vừa nhanh, vừa thông minh, vừa tôn trọng quyền riêng tư, bằng cách xử lý AI ngay trên thiết bị với toàn bộ SSD.
Điểm chung của các giải pháp này là cùng hướng tới xử lý khối lượng dữ liệu lớn với độ trễ thấp, phục vụ nhu cầu huấn luyện và suy luận mô hình AI ngày càng dày đặc. Nếu bạn đang thiết kế hạ tầng cho nhiều agent, LLM dài ngữ cảnh hay hệ thống video, audio khổng lồ, câu hỏi không còn là "có thêm GPU hay không" mà là: tầng lưu trữ đã kịp tiến hóa để trở thành đối tác ngang hàng với tầng tính toán chưa. FMS năm nay gửi một thông điệp khá thẳng thắn: những ai vẫn coi SSD và NAS là "ổ cứng cao cấp" thay vì thành phần chiến lược trong kiến trúc AI sẽ bị bỏ lại phía sau nhanh hơn mình nghĩ.






