AMD – Taalas: bước ngoặt sang silicon theo mô hình để tối ưu suy luận AI
AMD Taalas mua lại là thương vụ trong đó một nhà sản xuất chip lớn tích hợp công nghệ chip AI chuyên dụng của một startup, nơi các mô hình trí tuệ nhân tạo được mã hóa trực tiếp vào silicon để tối ưu suy luận AI, cải thiện đáng kể tốc độ, chi phí và hiệu quả năng lượng cho hạ tầng AI cạnh tranh ở giai đoạn bùng nổ ứng dụng hiện nay. Điều đáng nói ở thương vụ này không phải là một cái tên startup mới, mà là việc AMD công khai chọn con đường silicon tối ưu cho từng mô hình thay vì phụ thuộc hoàn toàn vào GPU đa dụng. Thỏa thuận mua lại Taalas, công bố ngày 6/8/2026, đưa công nghệ “Mô Hình Cứng” – model-specific integrated circuits (MSIC) – vào lộ trình tăng tốc AI của AMD. Đây là tuyên bố chiến lược: muốn cạnh tranh trực tiếp với NVIDIA về suy luận, AMD sẽ không chỉ nâng cấp GPU mà còn thiết kế chip AI chuyên dụng gắn chặt với các mô hình được dùng nhiều nhất.
Taalas và "Mô Hình Cứng": tăng tốc bằng cách khắc mô hình vào silicon
Khác với GPU truyền thống dựa vào HBM để chứa trọng số mô hình, chip của Taalas khắc luôn trọng số vào silicon, biến chúng thành MSIC – model-specific integrated circuits. Về bản chất, đây là chip AI chuyên dụng cho từng mô hình: bộ xử lý được hoàn thiện ở vài lớp kim loại cuối cùng khi mô hình đã được cố định, thay vì để phần cứng phục vụ mọi loại mạng nơ-ron. Sản phẩm đầu tiên của Taalas là con chip thiết kế cứng cho Llama 3.1 8B của Meta, đạt khoảng 17.000 token mỗi giây cho mỗi người dùng theo dữ liệu nội bộ – gần 10 lần nhanh hơn hiện trạng, chi phí xây dựng thấp hơn 20 lần, điện năng thấp hơn 10 lần. Một bài đo độc lập khác ghi nhận mức 16.960 token mỗi giây, nhanh hơn 48 lần so với GPU NVIDIA và 8,5 lần so với các bộ tăng tốc khác. Đây không còn là ý tưởng trên slide; đó là hiệu năng suy luận thực tế khiến GPU đa dụng bắt đầu trông lạc hậu trong các tác vụ lặp lại, khối lượng rất lớn.
Vì sao AMD chấp nhận rủi ro mô hình cố định để cạnh tranh hạ tầng AI
Gần bốn năm sau cú bùng nổ AI, mô hình mới xuất hiện gần như mỗi tháng, tạo áp lực đổi mới liên tục trên hạ tầng. Đến nay, cuộc chơi vẫn xoay quanh GPU đa dụng – nơi NVIDIA thống trị. Để phá thế độc quyền đó, AMD chọn hướng ngược lại: thay vì chỉ tăng thêm công suất GPU, họ đưa vào lộ trình những chip AI chuyên dụng được tối ưu suy luận AI cho từng mô hình. Theo mô tả của AMD, công nghệ Taalas "tối ưu hóa luồng dữ liệu suy luận, giảm đáng kể các nút thắt về tính toán và bộ nhớ liên quan đến kiến trúc chung". Nói thẳng: khi khối lượng suy luận tăng lên đến mức gigawatt, lợi ích kinh tế của việc ghép đúng silicon với đúng khối lượng công việc bắt đầu vượt qua sự tiện lợi của phần cứng chung. Chiến lược này giống cách các hãng mô hình hàng đầu xây đội silicon riêng, chỉ khác là AMD đi từ phía phần cứng, dùng Taalas để kéo khách hàng ra khỏi hệ sinh thái NVIDIA.
Bài toán đánh đổi: linh hoạt mô hình vs tốc độ, chi phí và chất lượng suy luận
Sức mạnh của "Mô Hình Cứng" đi kèm một nhược điểm rõ ràng: một khi chip được triển khai, bạn gần như bị khóa với mô hình đó. Bất kỳ thay đổi nào lớn hơn mức tinh chỉnh bằng adapter như LoRA sẽ cần quay lại nhà máy để làm lại chip – tốn thời gian và chi phí. Trong bối cảnh mô hình thay mới hàng tháng, việc chấp nhận khắc một phiên bản cố định lên silicon là quyết định mang tính cá cược. Thế nhưng với khối lượng suy luận khổng lồ của các trợ lý mã, tác nhân AI hay hệ thống trò chuyện, sự đánh đổi này có lý. Taalas từng ước tính việc khắc trọng số mô hình vào silicon rẻ hơn huấn luyện một mô hình biên khoảng 100 lần. Nếu AMD thực sự có thể giảm chi phí trên mỗi token đồng thời tăng tốc độ đầu ra 10–20 lần, các nhà phát triển có thể kéo dài thời gian suy nghĩ của mô hình (nhiều bước lập luận hơn) mà không làm đội chi phí, từ đó giảm ảo giác và nâng chất lượng kết quả. Người dùng cuối sẽ nhận được câu trả lời "chậm mà nhanh" hơn: hệ thống có thể suy luận lâu hơn nhưng vẫn phản hồi tổng thể nhanh hơn.
Tương lai: rack Helios, thế hệ HC2 và cuộc đối đầu NVIDIA – AMD trên mặt trận suy luận
AMD không có ý định để chip Taalas đứng một mình. Công ty dự tính tích hợp công nghệ này vào hệ thống rackscale Helios, song song với GPU Instinct MI400, CPU EPYC và phần mềm ROCm. Kiến trúc nhiều khả năng sẽ tách hai giai đoạn: xử lý prompt nặng tính toán trên GPU, và sinh token tốc độ cao trên các bộ tăng tốc dựa trên Taalas – một dạng hạ tầng AI cạnh tranh, đánh thẳng vào "premium inference" mà NVIDIA đang kiếm lợi. Về phía Taalas, thế hệ chip HC2 dự kiến ra mắt mùa hè này với khả năng chứa 20 tỷ tham số mỗi chip. Trọng số của mô hình lớn hơn được phân chia qua nhiều bộ tăng tốc bằng pipeline song song; ở mức 20 tỷ tham số, chỉ cần khoảng 50 chip để hỗ trợ một mô hình 1 nghìn tỷ tham số, điều này hoàn toàn nằm trong khả năng thiết kế hệ thống rack của AMD. Thỏa thuận mua lại phải vượt qua các điều kiện và phê duyệt quy định thông thường trước khi công nghệ Taalas chính thức bước vào sản phẩm thương mại. Kết luận thẳng thắn: trong cuộc đua suy luận AI, AMD đã chọn đánh vào điểm yếu về chi phí và hiệu năng của GPU đa dụng – nếu khách hàng dám cố định mô hình, AMD sẵn sàng cung cấp tốc độ vượt trội.






