CXL bộ nhớ mở rộng: Định nghĩa lại chi phí bộ nhớ cho AI
CXL bộ nhớ mở rộng là cách dùng chuẩn Compute Express Link để gắn thêm các tầng bộ nhớ như DRAM hoặc NAND vào hệ thống thông qua bus PCIe có tính đồng bộ cache, giúp trung tâm dữ liệu AI gia tăng dung lượng và linh hoạt kiến trúc bộ nhớ mà không phụ thuộc hoàn toàn vào mô-đun DDR truyền thống. Đây không chỉ là cải tiến kỹ thuật; đó là nỗ lực rõ ràng nhằm phá vỡ thế độc quyền chi phí của DRAM trong bối cảnh thiếu RAM và nhu cầu AI tăng phi mã. DRAM đang khan hiếm, RDIMM bị đẩy giá lên cao, buộc ngành phải đi tìm lối thoát trong đó CXL nổi lên như đường vòng thông minh: bộ nhớ mở rộng nhưng không nhất thiết phải là DDR5 mới đắt đỏ. Chính sự kết hợp giữa tiêu chuẩn CXL 3.x và các phương tiện bộ nhớ khác nhau đang mở ra cơ hội kiến trúc mới, nơi hiệu năng và giá thành được cân bằng theo từng lớp dữ liệu nóng – lạnh.

Astera Labs Leo 2 và Leo X: Bộ điều khiển bộ nhớ CXL cho kiến trúc rackscale
Trong cuộc chơi CXL bộ nhớ mở rộng, Astera Labs lựa chọn tấn công trực diện bằng thế hệ bộ điều khiển bộ nhớ CXL Leo 2 và Leo X mới. Leo 2 nâng cấp từ PCIe Gen5/CXL 2.x lên PCIe Gen6/CXL 3.2, đồng nghĩa băng thông mỗi lane được nhân đôi, giảm một trong các điểm yếu lớn của bộ nhớ mở rộng qua CXL: tổng băng thông PCIe/CXL của CPU luôn thấp hơn DRAM trực tiếp. Để không bị nghẽn ở phía sau, Leo 2 còn tăng số kênh bộ nhớ từ 2 lên 4, cho phép mỗi bộ mở rộng hỗ trợ tới 768GB DDR4 hoặc 4TB DDR5."Mỗi bộ mở rộng Leo 2 có thể gắn tới 4TB DDR5, đẩy giới hạn bộ nhớ của một máy chủ vượt xa thiết kế 16 DIMM truyền thống". Quan trọng hơn, Astera không né vấn đề kinh tế: DDR5 mới đắt, trong khi DDR4 từ hệ thống về hưu lại rẻ và dư thừa; Leo 2 sinh ra để tái sử dụng lượng DDR4 khổng lồ đó, biến phế liệu thành tài sản bộ nhớ cho trung tâm dữ liệu AI. Leo X đi xa hơn: thay vì chỉ gắn vào CPU, nó biến vùng DRAM phía sau Leo thành một pool bộ nhớ gắn trực tiếp vào fabric rackscale cùng với các switch PCIe Scorpio, cho phép accelerator AI truy cập bộ nhớ mở rộng mà không phải vòng qua CPU.

Kioxia XL1 XL-FLASH: NAND thay thế DRAM cho vùng dữ liệu lạnh
Nếu Astera Labs muốn tiết kiệm bằng cách tái dùng DDR4, Kioxia lại đặt cược rằng NAND thay thế DRAM ở một phần không nhỏ dung lượng bộ nhớ trung tâm dữ liệu AI. Thiết bị XL1 CXL XL-FLASH là một Type 3 CXL 2.0 với 512GB dung lượng, hoạt động như bộ mở rộng bộ nhớ chứ không phải SSD NVMe truyền thống. Trong thử nghiệm, XL1 đạt gần 1GB/s với độ trễ khoảng 755ns, tương đương gần 2 triệu IOPS cho tải 512B."XL1 512GB trên giao thức CXL 2.0 hoạt động ở gần 1GB/s với độ trễ 755ns, đủ nhanh cho nhiều vùng bộ nhớ lạnh trong hệ AI". Sức mạnh của XL-FLASH nằm ở độ bền ghi cao và độ trễ thấp hơn hẳn TLC, QLC, khiến NAND này tiến sát vùng xám giữa DRAM và lưu trữ. Kioxia đánh trúng thực tế rằng hầu hết workload AI chỉ có một phần nhỏ dữ liệu cực nóng cần DRAM, trong khi khối lượng lớn tham số, bảng tra cứu, trang bộ nhớ lạnh hoàn toàn có thể nằm trên NAND CXL để giảm chi phí mà vẫn đủ nhanh cho mô hình.

Vì sao trung tâm dữ liệu AI cần kiến trúc bộ nhớ nhiều tầng
Các trung tâm dữ liệu AI đang bị kẹt giữa hai lực kéo đối nghịch: mô hình ngày càng lớn yêu cầu dung lượng bộ nhớ khổng lồ, trong khi DRAM khan hiếm và đắt khiến mở rộng theo kiểu cũ gần như không khả thi. Astera Labs thẳng thắn định vị Leo 2 và Leo X cho thị trường AI, nơi KV cache cực lớn, cơ sở dữ liệu in-memory và bộ nhớ ngữ cảnh của accelerator là những điểm nghẽn sống còn. Leo 2 cho phép giữ cache khóa–giá trị (KV) khổng lồ bên cạnh CPU, còn Leo X đẩy pool DRAM ra fabric rackscale, rút ngắn khoảng cách giữa accelerator và dữ liệu. Song song, XL1 đưa NAND tốc độ cao vào không gian bộ nhớ, tạo thêm một tầng cho dữ liệu lạnh thay vì buộc tất cả phải ở trên DRAM. Cấu trúc đa tầng này – DRAM trực tiếp, DRAM CXL, NAND CXL – không phải là sự xa xỉ, mà là đáp án kinh tế duy nhất khi chi phí mỗi GB DRAM vượt tầm chịu đựng của mô hình AI thế hệ mới.

Tương lai: DRAM mất ngôi độc tôn, CXL trở thành trục bộ nhớ
Điểm chung của Leo 2, Leo X và XL1 là một thông điệp: DRAM sẽ không còn là trung tâm duy nhất của kiến trúc bộ nhớ; CXL mới là trục kết nối cho các loại phương tiện nhớ khác nhau. Leo 2 chứng minh rằng ta có thể kéo dài tuổi thọ DDR4 qua CXL mà vẫn đảm bảo RAS, nhờ engine kiểm tra phần cứng, soft-ECC chồng lên ECC sẵn có, và khả năng giữ DIMM lỗi trong dịch vụ. Leo X chứng minh rằng bộ nhớ mở rộng có thể trở thành tài nguyên dùng chung ở cấp rackscale, trực tiếp phục vụ accelerator AI thông qua fabric cùng switch Scorpio. XL1 chứng minh NAND tốc độ cao đủ nhanh để trở thành tầng bộ nhớ, chứ không chỉ là lưu trữ, mở ra mô hình dữ liệu nóng–ấm–lạnh dựa trên giá thành mỗi GB. Nếu DRAM tiếp tục khan hiếm, ngành sẽ không còn lựa chọn: hoặc chấp nhận CXL và NAND như những mảnh ghép bộ nhớ chính thống, hoặc dừng lại ở quy mô mô hình nhỏ hơn. Và trong kỷ nguyên nơi quy mô quyết định lợi thế AI, lựa chọn thứ hai gần như không có chỗ đứng.







