Lưu trữ AI quy mô lớn: vấn đề không còn là GPU mà là dữ liệu
Lưu trữ AI quy mô lớn là cách doanh nghiệp thiết kế và vận hành hạ tầng lưu trữ để xử lý, giữ lại và khai thác các bộ dữ liệu từ petabyte đến exabyte, nơi chi phí lưu trữ dữ liệu, độ tin cậy và khả năng mở rộng trở thành yếu tố quyết định ngang với hiệu năng tính toán. Ngày AI chỉ là vài mô hình thử nghiệm trên vài petabyte dữ liệu thì mọi thứ khá dễ thở; nhưng khi doanh nghiệp bước vào giai đoạn quản lý dữ liệu exabyte, chiến lược lưu trữ sai đồng nghĩa với một khoản nợ hạ tầng AI enterprise âm thầm phình to. Nghiên cứu do một hãng lưu trữ lớn tài trợ cho thấy cuộc tranh luận chi phí đang dịch chuyển từ compute sang dữ liệu tạo ra và tiêu thụ bởi AI, và đó mới là nơi doanh nghiệp phải bắt đầu tính toán.
Theo dự báo Global DataSphere của IDC, thế giới sẽ tạo ra 274 zettabyte dữ liệu trong năm 2026 và tăng lên hơn 718 zettabyte vào năm 2030. Trong khi đó, tổng dung lượng lưu trữ đã cài đặt mới khoảng 13 zettabyte hôm nay và chỉ dự kiến hơn 26 zettabyte vào cùng mốc thời gian. Khoảng cách khổng lồ giữa dữ liệu tạo ra và dữ liệu có thể giữ lại cho thấy: chúng ta không thể đối xử với mọi byte như dữ liệu nóng đặt trên flash cao cấp. Các lãnh đạo CNTT đang buộc phải nhìn nhận câu hỏi “giữ dữ liệu nào, ở đâu” như một quyết định phân bổ vốn chiến lược, không còn là việc vận hành hạ tầng thường ngày nữa.
Vì sao kiến trúc all-flash đơn tầng sụp đổ ở quy mô exabyte
Kiến trúc all-flash từng là “giấc mơ hồng” của giới hạ tầng AI enterprise: một tầng flash duy nhất cho mọi thứ, từ dữ liệu huấn luyện đến log suy luận. Nhưng mô hình này chỉ ổn khi bộ dữ liệu nóng nhỏ, và sụp đổ nhanh chóng khi dữ liệu giữ lại tăng nhanh hơn dữ liệu đang hoạt động. AI chạm vào một số dữ liệu trong vài mili giây rồi quên đi, nhưng lại cần giữ vô số bản ghi cho huấn luyện lại, kiểm toán, tuân thủ, và phục hồi sau sự cố. Khi tất cả sống trên cùng tầng flash, doanh nghiệp trả mức giá cao nhất cho dữ liệu gần như không bao giờ được đọc lại trong thời gian thực.
Trong pipeline huấn luyện, các shard mới, feature store, checkpoint, log prompt, trace an toàn, embedding và bản copy thử nghiệm liên tục chảy vào hệ thống. Chỉ một lát mỏng trong số đó đang nuôi GPU tại bất kỳ thời điểm; phần còn lại chờ tới khi tái huấn luyện, yêu cầu kiểm toán hoặc sự cố buộc phải khôi phục. Benchmark thường chỉ đo độ trễ đọc và throughput huấn luyện, nên chi phí sản xuất xuất hiện muộn, sau khi dữ liệu đã sinh ra nhiều bản copy cho tinh chỉnh, an toàn và giữ chân khách hàng. Lúc này, lựa chọn “tất cả trên flash” không còn là quyết định thiết bị đơn giản mà trở thành chính sách dữ liệu ngầm: bạn đang buộc mọi loại dữ liệu phải trả hóa đơn như dữ liệu nóng.

Kiến trúc hybrid storage: khi HDD và SSD mỗi thứ làm đúng việc của mình
Giải pháp không phải là từ bỏ flash, mà là đặt nó vào đúng vị trí trong kiến trúc hybrid storage đa tầng. Nghiên cứu do IDC và một nhà sản xuất lưu trữ phối hợp thực hiện kết luận rằng câu chuyện không phải HDD đấu với SSD, mà là một hệ thống tiered được tối ưu từ sử dụng điện, hiệu quả GPU cho tới từng lớp lưu trữ. Ở đó, SSD/flash dành cho tập dữ liệu hoạt động, yêu cầu độ trễ thấp để giữ GPU luôn bận; HDD đảm nhận dữ liệu “ấm”, lịch sử và nội dung tham chiếu, nơi chi phí trên mỗi dung lượng quan trọng hơn vài micro giây độ trễ.
Kiến trúc hybrid storage có một lợi thế ít được nói tới: nó cải thiện cả tổng chi phí sở hữu (TCO) lẫn hành vi phục hồi sau thảm họa. Trong mô hình tiered, dữ liệu nóng được cache tạm thời trên SSD gần compute, nhưng được bảo vệ toàn diện ở tầng HDD phía sau. Điều này cho phép thiết kế tầng SSD hoàn toàn cho tốc độ, không cần thêm cấu trúc redundancy phức tạp vì dữ liệu đã được bảo vệ sẵn ở HDD. Tier rules được đặt ra từ sớm – flash cho nơi latency mang lại giá trị, HDD cho nơi retention tích lũy – giúp đội hạ tầng giữ kỷ luật capex, đảm bảo phương án rollback, và duy trì khả năng truy cập vào dữ liệu lịch sử cần thiết để cải thiện mô hình về lâu dài.
Quản lý dữ liệu exabyte: từ câu chuyện kỹ thuật sang quyết định vốn
Khi doanh nghiệp bước vào quản lý dữ liệu exabyte, mọi sai lầm kiến trúc sẽ nhân lên theo cấp số nhân. Các kế hoạch neocloud – những nền tảng AI cloud thế hệ mới – cần có tầng lưu trữ rõ ràng trước khi chạm tới exabyte đầu tiên. Một người trả lời khảo sát IDC ước tính rằng với mỗi đơn vị compute mới, tổ chức cần nhiều gấp hai đến ba lần dung lượng lưu trữ so với trước đây, và đó không phải yêu cầu tương lai mà là thực tế ngay lập tức. Nếu tiếp tục all-flash đơn tầng, mỗi lệnh giữ dữ liệu vì tuân thủ, mỗi đợt replay mô hình và mỗi kho lưu trữ khách hàng sẽ phình ra đúng phần đắt đỏ nhất trong stack lưu trữ.
Ở quy mô đó, hạ tầng AI enterprise không thể được lên kế hoạch tách biệt khỏi hạ tầng cloud nói chung nữa. Dữ liệu AI vừa là input huấn luyện, ngữ cảnh truy xuất, bản ghi tuân thủ, vừa là tài nguyên cho các use case chưa được định nghĩa. Lựa chọn media vì thế trở thành câu hỏi chiến lược dài hạn: làm sao giữ dữ liệu luôn truy cập được mà không phải định giá mỗi byte như dữ liệu cần phản hồi tức thời. “Dữ liệu nguội” không vô giá trị – nó là nguyên liệu cho tinh chỉnh, đánh giá độ an toàn, và kiểm chứng quyết định của mô hình – nhưng nó xứng đáng được đặt trên HDD thay vì chiếm chỗ flash và bào mòn biên lợi nhuận của dịch vụ AI.
Khi nào nên chọn all-flash, khi nào phải chuyển sang tiered cho môi trường AI production
Doanh nghiệp không cần cực đoan. All-flash vẫn có chỗ, nhưng chỉ trong những trường hợp rất cụ thể. Mô hình all-flash đơn tầng phù hợp với môi trường thử nghiệm, POC hoặc dịch vụ có tập dữ liệu nóng nhỏ, thời gian lưu trữ ngắn, ít yêu cầu giữ lại lịch sử và bản ghi tuân thủ. Ở đây, bộ dữ liệu hoạt động gần bằng bộ dữ liệu giữ lại, nên việc trả giá flash cho mọi byte không gây méo mó chi phí. Ngược lại, khi pipeline huấn luyện, dịch vụ suy luận sản xuất, RAG, trợ lý tiêu dùng và công cụ code bắt đầu sinh ra log phiên, prompt, phản hồi và metadata an toàn mỗi ngày, phần dữ liệu “ấm” và “lạnh” sẽ nhanh chóng lấn át dữ liệu nóng. Đây là lúc all-flash chuyển từ câu chuyện hiệu năng sang vấn đề biên lợi nhuận.
Hướng đi lành mạnh cho môi trường AI production khá rõ ràng: áp dụng tiered storage ngay từ đầu, thay vì chờ chi phí bùng nổ rồi mới chữa cháy. Tiered storage hoạt động tốt vì dữ liệu AI thường trải qua các trạng thái khác nhau theo thời gian: khởi đầu là dữ liệu nóng, sau đó trở thành dữ liệu tham chiếu, rồi cuối cùng là lịch sử giữ lại nhưng vẫn phải truy cập được. Kế hoạch vững chắc là: đặt flash ở nơi độ trễ thấp mang lại giá trị trực tiếp cho huấn luyện và suy luận; dùng media dung lượng – chủ yếu là HDD – cho nơi dung lượng tích lũy theo năm tháng; và quan trọng nhất, định nghĩa rõ luồng di chuyển dữ liệu trước khi “điền đầy” kho dữ liệu, để không bị mắc kẹt trong kiến trúc all-flash mà bạn không còn đủ ngân sách để duy trì.






