Cơ sở hạ tầng AI: cuộc đua vượt ngoài GPU và những điểm nghẽn mới
Cơ sở hạ tầng AI là tập hợp kiến trúc máy chủ, lưu trữ, mạng trung tâm dữ liệu và phần mềm điều phối được thiết kế hiện đại và tách rời, nhằm giữ dữ liệu luôn sẵn sàng, di chuyển liên tục giữa các tài nguyên tính toán để phục vụ huấn luyện và suy luận AI ở quy mô lớn.
Trọng tâm của cuộc khủng hoảng hiện nay không còn là chuyện “thiếu GPU” đơn thuần, mà là việc cả chuỗi máy chủ, bộ nhớ, lưu trữ và mạng bị kéo căng bởi nhu cầu AI toàn cầu. AI không còn dừng ở vài dự án thử nghiệm; nó đang trở thành chương trình chuyển đổi quy trình làm việc ở cấp doanh nghiệp. Khi các tổ chức dồn lực cho agentic AI, mô hình suy luận liên tục và ứng dụng gắn chặt với dữ liệu thời gian thực, họ phát hiện GPU chỉ nhanh bằng chiếc mạng và hệ thống lưu trữ đằng sau nó. Khi dữ liệu không kịp “chạy”, mọi đầu tư vào chip tăng tốc đều bị mất ý nghĩa.

Tắc nghẽn cung ứng lưu trữ: DRAM, NAND và chuỗi cung ứng bị kéo căng
Các nhà cung cấp hạ tầng truyền thống đang phải đối mặt với tắc nghẽn cung ứng lưu trữ ở mức cấu trúc, chứ không chỉ là vài quý thiếu hàng mang tính chu kỳ. Một lãnh đạo hạ tầng lớn mô tả ngắn gọn những ràng buộc hiện tại là “DRAM, DRAM, DRAM, rồi đến NAND, NAND, NAND”, với tình trạng thiếu CPU và ổ đĩa xuất hiện rải rác và các giới hạn kéo dài xuyên suốt chuỗi cung ứng, từ vi điều khiển đến ổ đĩa và transistor. Đây không phải là một cú sốc đơn lẻ, mà là dấu hiệu cho thấy cơ sở hạ tầng AI hiện đại đòi hỏi lượng bộ nhớ động và flash khổng lồ để giữ dữ liệu “đang chuyển động” trong các cụm tính toán.
Các tập đoàn lớn trên thế giới muốn nhận hệ thống ngay nếu có hàng, nhưng nhà sản xuất thừa nhận họ bị giới hạn bởi năng lực sản xuất mỗi quý và ở tình trạng “supply constrained” trên những gì có thể lắp ráp. Ở phía khác, một nhà cung cấp lưu trữ chuyên dụng ghi nhận doanh thu sản phẩm tăng mạnh, với lượng giao dịch AI và data lake lên tới hàng trăm hợp đồng trong một quý, đồng thời mô tả “một cải thiện mang tính cấu trúc” trong nhu cầu hạ tầng dữ liệu. Tắc nghẽn cung ứng lưu trữ vì vậy không chỉ là thiếu hàng; nó phản ánh sự chuyển dịch dài hạn sang các kiến trúc dữ liệu phục vụ AI.
Nhu cầu AI toàn cầu đẩy HPE và NetApp lên đỉnh, nhưng thành công bị phanh bởi hạ tầng
Nhu cầu AI toàn cầu đang kéo theo những con số tăng trưởng ấn tượng cho các nhà cung cấp cơ sở hạ tầng AI. Lãnh đạo một tập đoàn hạ tầng cho biết “AI-driven networks” cùng sự quan tâm rộng khắp tới AI đã thúc đẩy kết quả kinh doanh, khi khách hàng ngày càng chuyển từ thử nghiệm sang triển khai sản xuất, dùng cả máy chủ truyền thống cho agentic AI và suy luận. Theo cùng nguồn này, đơn hàng hệ thống AI đạt mức tăng trên 30% theo quý, trong đó nhu cầu từ khách hàng doanh nghiệp hơn gấp đôi, phản ánh việc chi tiêu hạ tầng được đẩy lên khi AI trở thành ưu tiên ở cấp hội đồng quản trị.
Ở phía lưu trữ thuần túy, một nhà cung cấp khác ghi nhận quý đầu năm tài chính với doanh thu kỷ lục, tăng 30% so với cùng kỳ, đồng thời tăng lợi nhuận ròng hơn 60%, nhờ “nhu cầu hạ tầng lưu trữ thúc đẩy bởi AI và đám mây”. CEO của họ khẳng định: “AI không còn là khát vọng tương lai; đó là yêu cầu kinh doanh. Khi tổ chức vận hành hóa AI, thách thức không chỉ là tính toán, mà là mức độ sẵn sàng của dữ liệu”. Tuy vậy, cả các nhà sản xuất máy chủ lẫn nhà cung cấp hạ tầng thừa nhận môi trường chi phí linh kiện khó khăn và năng lực cung ứng hạn chế vẫn đang kìm hãm đà tăng trưởng.

Mạng trung tâm dữ liệu: GPU cluster mạnh đến mấy cũng thua một mạng yếu
Trong khi dư luận tập trung vào số lượng GPU, những người vận hành cơ sở hạ tầng AI đã chuyển ánh nhìn sang mạng trung tâm dữ liệu. Một số bộ định tuyến được dùng để tạo lớp biên, đưa lưu lượng từ trung tâm dữ liệu tới khách hàng, dịch vụ và mạng bên ngoài, với yêu cầu về quy mô bảng định tuyến, năng lực và tính sẵn sàng rất cao. Một dòng switch khác lại vận hành ở nhiều lớp của “fabric” trung tâm dữ liệu khu vực, đồng thời đóng vai trò xương sống mạng hậu trường cho các cụm AI lớn, cung cấp mật độ kết nối cao, cân bằng tải động và quản lý tắc nghẽn cho mạng RoCEv2.
Một tập đoàn hạ tầng công bố kế hoạch mở rộng mạng cho cơ sở hạ tầng AI toàn cầu của một nhà cung cấp đám mây, sử dụng bộ sản phẩm mạng chung để phủ từ biên, fabric khu vực tới mạng hậu trường GPU. Mục tiêu là xử lý rủi ro tắc nghẽn trong các GPU cluster mạng ở quy mô “gigawatt”, một thuật ngữ mô tả kích thước hạ tầng hơn là mức tiêu thụ điện. Khi hàng loạt bộ tăng tốc cùng chạy một bài toán phân tán, việc dữ liệu đến chậm có thể khiến GPU phải chờ dù năng lực tính toán vẫn sẵn sàng, làm hiệu suất cả cụm bị bóp nghẹt. Nói cách khác, trong kỷ nguyên agentic AI, băng thông và độ trễ mạng quyết định xem GPU là động cơ phản lực hay chỉ là cỗ máy nổ bị kìm chân.
Gigawatt-scale AI và bài toán tắc nghẽn: vì sao mạng trở thành điểm yếu chí tử
Thỏa thuận mở rộng mạng AI toàn cầu nói trên nhấn mạnh một thực tế khó chịu: ở quy mô “gigawatt”, mạng dễ dàng trở thành điểm nghẽn lớn nhất. Thuật ngữ này không phải công bố về điện năng, mà là cách mô tả số lượng bộ tăng tốc khổng lồ cùng tham gia một hạ tầng AI duy nhất. Khi một GPU hoàn thành bước tính toán nhưng gói dữ liệu cần thiết từ nút khác chưa kịp đến, nó buộc phải chờ, dù năng lực xử lý vẫn rảnh. Hiệu suất cụm vì thế không còn do tốc độ GPU quyết định, mà do việc dữ liệu có đi kịp qua mạng hay không.
Mạng RoCEv2 được dùng để mang lưu lượng truy cập bộ nhớ có độ trễ thấp trên Ethernet, nhưng bản thân nó không loại bỏ được tắc nghẽn. Các đợt bùng nổ lưu lượng có thể lấp đầy bộ đệm trên switch, làm hàng đợi kéo dài; nếu cân bằng tải không đủ thông minh để rải dòng lưu lượng lên những đường còn trống, một số đường sẽ quá tải trong khi các đường khác vẫn nhàn rỗi. Khi một liên kết hay thành phần quang lỗi mà hệ thống không phát hiện và chuyển hướng kịp thời, sự cố cục bộ có thể lan thành lỗi diện rộng. “Darboğaz” – điểm nghẽn mạng – vì thế không phải kết quả đo hiệu năng hiện tại, mà là rủi ro mà thỏa thuận mở rộng mạng này muốn chủ động giải quyết. Nếu không coi mạng là hạng mục chiến lược trong cơ sở hạ tầng AI, mọi tham vọng agentic AI đều có nguy cơ dừng lại trên giấy.






