Từ giấc mơ siêu trung tâm dữ liệu AI đến thực tế thiếu công suất
Cuộc chạy đua xây dựng trung tâm dữ liệu AI là quá trình các công ty công nghệ đẩy mạnh đầu tư hạ tầng tính toán để cung cấp năng lực xử lý AI khổng lồ cho huấn luyện và triển khai mô hình ngôn ngữ, song song với việc tìm kiếm cấu trúc trung tâm dữ liệu linh hoạt hơn, phân tán hơn để thích ứng với các ràng buộc về điện năng, đất đai và nhu cầu suy luận đang tăng vọt trên toàn cầu. Trong giai đoạn đầu bùng nổ AI tạo sinh, công thức thành công tưởng như rất rõ ràng: cứ xây các tổ hợp trung tâm dữ liệu khổng lồ, càng gần gigawatt càng tốt, rồi lấp đầy bằng CPU và GPU. Nhưng 2025–2030 đang hé lộ sự thật khó chịu: giấc mơ siêu quy mô đang đụng trần về lưới điện, giấy phép và cả sự kiên nhẫn của khách hàng. Microsoft là ví dụ điển hình của mặt trái đó. Tập đoàn này đã phải đối mặt tình trạng thiếu hụt máy chủ, trở thành trở ngại lớn nhất cho đà mở rộng dịch vụ đám mây và AI. Nút thắt bắt nguồn từ quyết định tạm dừng một số dự án hạ tầng vào đầu năm 2025 của Giám đốc Tài chính Amy Hood vì lo ngại thi công vượt quá nhu cầu thực tế. Sự thận trọng về tài chính hóa ra lại gây ra cái giá cơ hội khổng lồ: khách hàng phải chờ đợi, năng lực xử lý AI bị giới hạn và các đối thủ có cơ hội chen chân.
Microsoft “tất tay” mở rộng hạ tầng tính toán – nhưng vẫn bị ràng buộc bởi mô hình siêu lớn
Để thoát thế bí, Microsoft đang quay đầu tăng tốc và gần như “tất tay” cho hạ tầng tính toán. Theo kế hoạch nội bộ, quy mô công suất hạ tầng toàn cầu của hãng dự kiến vượt mốc 38 gigawatt vào năm 2032, tăng gần gấp ba so với khoảng 12 gigawatt hiện tại. Đây là mức điện năng còn cao hơn cả tiêu thụ giờ cao điểm của một bang lớn ở Mỹ, cho thấy tham vọng chiếm ưu thế trung tâm dữ liệu AI. Tổng giám đốc Satya Nadella khẳng định Microsoft đang khẩn trương đưa lượng công suất mới vào vận hành và tối ưu phần cứng sẵn có để cải thiện hiệu quả sinh lời. Cụm East US 3 tại khu vực Atlanta là minh chứng vật chất cho chiến lược siêu lớn: dự án này được kỳ vọng bổ sung 300 megawatt công suất ngay trong năm hiện tại, rồi vượt mốc hơn 1 gigawatt sau vài năm. Tuy nhiên, ngay cả khi công suất tăng mạnh, cấu trúc hạ tầng vẫn mang dấu ấn “one big bet”: nhiều năng lực xử lý AI bị dồn vào vài cụm khổng lồ, khiến mỗi trục trặc kỹ thuật hay chậm trễ thi công đều tạo ra tác động dây chuyền.
Anthropic và OpenAI: chọn trung tâm dữ liệu AI nhỏ để tránh cái bẫy siêu dự án
Trong khi Microsoft tiếp tục bơm vốn vào các tổ hợp siêu lớn, Anthropic và OpenAI đang âm thầm vẽ một đường đi khác cho trung tâm dữ liệu AI. Cả hai bắt đầu tìm kiếm các khu trung tâm dữ liệu nhỏ hơn, với công suất khoảng 20–30 megawatt, bên ngoài các dự án hạ tầng AI khổng lồ hiện hữu. Mục tiêu rất thực tế: tiếp cận năng lực tính toán hiện có nhanh hơn để đáp ứng nhu cầu suy luận mô hình ngày càng tăng, thay vì chờ đợi vài năm cho một siêu dự án hoàn tất đấu nối lưới điện và giấy phép. Anthropic đã tiếp cận các dự án tại Anh và Bắc Âu, trong khi OpenAI cũng khảo sát cơ hội tương tự tại Bắc Âu và thảo luận các công suất tương đương ở Mỹ. Quan trọng hơn, đây không phải dấu hiệu rút lui khỏi mô hình siêu lớn mà là bổ sung các nguồn năng lực xử lý AI linh hoạt bên cạnh những hợp đồng trung tâm dữ liệu hàng trăm megawatt hoặc gigawatt. Khi OpenAI cho biết họ đang xây dựng danh mục năng lực tính toán đa dạng hơn để phục vụ nhiều loại khối lượng công việc và thời hạn bàn giao khác nhau, đó là cách nói ngoại giao cho việc thừa nhận giới hạn của chiến lược “tất cả dồn vào vài tổ hợp khổng lồ”.

Vì sao mô hình phân tán nhỏ gọn đang thắng thế trong triển khai mô hình ngôn ngữ
Động lực chính kéo Anthropic và OpenAI về phía các trung tâm dữ liệu AI nhỏ không nằm ở lý thuyết, mà ở bản chất công việc họ đang phục vụ. Huấn luyện các mô hình ngôn ngữ lớn cần cụm GPU tập trung, mật độ chip cao và kết nối nội bộ cực nhanh, nên siêu dự án vẫn là lựa chọn hợp lý. Nhưng sau huấn luyện, thế giới thực lại xoay quanh suy luận: chatbot, trợ lý AI, ứng dụng doanh nghiệp xử lý hàng tỷ yêu cầu người dùng mỗi ngày. Những tác vụ này có thể chia nhỏ, chạy song song trên nhiều cụm rải khắp khu vực khác nhau, không cần dồn toàn bộ năng lực xử lý AI vào một cơ sở duy nhất. Các khảo sát cho thấy nhiều trung tâm dữ liệu tại Mỹ đang gặp phản đối từ cộng đồng địa phương vì lo ngại tiếng ồn và áp lực lên lưới điện sinh hoạt, trong khi các thị trường truyền thống ở châu Âu bị giới hạn bởi đất đai, nguồn điện và năng lực truyền tải. Trong bối cảnh đó, việc đảm bảo hàng chục megawatt tại các địa điểm đã có sẵn điện, rồi tích lũy thành nhiều cụm nhỏ, trở nên thực tế hơn nhiều so với việc chờ một tổ hợp gigawatt đi vào vận hành hoàn toàn. Đồng thời, hạ tầng phân tán này giúp trung tâm dữ liệu AI nằm gần người dùng hơn, giảm độ trễ mạng và đáp ứng các yêu cầu tuân thủ dữ liệu theo khu vực.
Tương lai hạ tầng AI: kết hợp siêu dự án với kiến trúc phân tán, nếu không muốn bị bỏ lại phía sau
Nhìn từ cả Microsoft lẫn Anthropic và OpenAI, bức tranh tương lai của hạ tầng tính toán cho AI đã khá rõ: không có một mô hình trung tâm dữ liệu AI duy nhất thắng cuộc. Microsoft vẫn cần các cụm trên 1 gigawatt để tránh lặp lại khủng hoảng thiếu máy chủ, đồng thời nâng tỷ trọng công suất dành riêng cho chip xử lý AI từ khoảng 2 trong 12 gigawatt hiện tại lên gần một phần ba khi đạt 38 gigawatt. Nhưng nếu chỉ dựa vào siêu dự án, mọi hãng đều sẽ bị trói buộc bởi chu kỳ đấu nối lưới điện và giấy phép kéo dài. Ngược lại, Anthropic và OpenAI chấp nhận một chiến lược hạ tầng lai: duy trì các tổ hợp lớn để huấn luyện những mô hình tiên tiến, trong khi xây dựng mạng lưới nhiều cụm 20–30 megawatt cho triển khai mô hình ngôn ngữ và suy luận phân tán. Theo các phân tích về xu hướng tính toán, khi tỷ trọng khối lượng công việc suy luận tăng, hạ tầng AI sẽ khó có thể đặt tất cả cược vào vài siêu trung tâm dữ liệu. Sự kết hợp khéo léo giữa quy mô khổng lồ và phân tán nhỏ gọn mới là cách duy trì năng lực xử lý AI đủ nhanh, đủ gần khách hàng, và đủ linh hoạt để không bị mắc kẹt bởi điểm nghẽn hạ tầng hay phản ứng của cộng đồng.






