Khám phá sở thích, cùng nhau

Deal thật, đánh giá chân thực và câu chuyện mua sắm từ những người cùng sở thích với bạn — mỗi ngày trên Sammfy.

Khám phá sở thích, cùng nhauDeal thật, đánh giá chân thực và câu chuyện mua sắm từ những người cùng sở thích với bạn — mỗi ngày trên Sammfy.

Chip AI Jalapeño của OpenAI nhanh hơn 1,9 lần: cú hích mới đối với Nvidia

Chip AI Jalapeño của OpenAI nhanh hơn 1,9 lần: cú hích mới đối với Nvidia
Sở thích|Khám phá ứng dụng AI

Jalapeño là gì và vì sao 1,9 lần hiệu năng lại quan trọng?

Chip AI Jalapeño là bộ tăng tốc ASIC do OpenAI thiết kế cùng Broadcom để tối ưu riêng cho suy luận mô hình ngôn ngữ lớn, với mục tiêu cung cấp nhiều công việc AI hơn trên mỗi watt điện năng, giảm độ trễ phản hồi và cho phép người dùng lựa chọn giữa chi phí hạ tầng thấp hơn hoặc tốc độ phản hồi nhanh hơn trong các dịch vụ AI quy mô lớn. Động lực của bài viết này đơn giản: Jalapeño không chỉ là một con chip mới, mà là tuyên ngôn rằng kỷ nguyên "GPU làm tất" đang bị thách thức. OpenAI xác nhận các mẫu thử nghiệm kỹ thuật đầu tiên của chip AI Jalapeño đã được bàn giao và đang thử nghiệm trong phòng lab, đánh dấu lần đầu công ty sở hữu một OpenAI chip tùy chỉnh do mình thiết kế, thay vì phụ thuộc hoàn toàn vào GPU của bên thứ ba. Theo OpenAI, Jalapeño đạt hiệu suất trên mỗi watt cao hơn 1,5–1,9 lần so với một số hệ thống chip AI Nvidia trong các bài thử suy luận LLM mà họ công bố. Nếu số liệu này giữ vững khi triển khai thực tế, trật tự hiệu năng chip Nvidia trong trung tâm dữ liệu sẽ phải viết lại.

Chip AI Jalapeño của OpenAI nhanh hơn 1,9 lần: cú hích mới đối với Nvidia

Thiết kế ASIC “tờ giấy trắng”: lợi thế thực so với GPU Nvidia

Khác với GPU đa dụng, Jalapeño là một ASIC được thiết kế gần như từ tờ giấy trắng để phục vụ riêng các mô hình transformer và LLM. OpenAI hợp tác Broadcom và Celestica để tạo nên một bộ tăng tốc tập trung vào hai trụ cột: lưu lượng cao và độ trễ thấp trong cùng một kiến trúc, thay vì phải đánh đổi như đa số hệ thống hiện tại. Theo OpenAI, chip AI Jalapeño đạt 1,5–1,9 lần “AI work per watt” ở mức throughput đỉnh so với các hệ thống tham chiếu trên benchmark InferenceX, đồng thời giảm độ trễ đầu–cuối 1,7–3,6 lần; với các tải công việc tương tác cao, hiệu năng tổng thể tăng 2,1–4,1 lần. Một câu nói đáng trích dẫn là: "Jalapeño delivers both higher throughput and lower latency with one architecture". Cốt lõi của lợi thế này nằm ở cách chip giảm tối đa di chuyển dữ liệu: OpenAI nhấn mạnh vấn đề của LLM hiện nay không chỉ là TFLOPs, mà là dữ liệu phải di chuyển bao xa trong hệ thống. Trong các thử nghiệm nội bộ, Jalapeño đạt hiệu suất trên mỗi watt vượt một số sản phẩm Nvidia, dù hiệu năng FP4 và FP8 chỉ gần tương đương các chip như GB200 và GB300. Điểm đáng chú ý là Jalapeño chỉ tiêu thụ khoảng một nửa năng lượng so với chip AI GB300 trong cùng điều kiện, nghĩa là cùng lượng điện, hệ thống có thể phục vụ nhiều yêu cầu hơn. Đây không phải cú đấm hạ knock-out về sức mạnh tuyệt đối, mà là đòn tấn công thẳng vào điểm yếu lớn nhất của GPU: hiệu suất trên mỗi watt.

Suy luận LLM nhanh hơn, rẻ hơn: người dùng được lợi như thế nào?

OpenAI thiết kế Jalapeño xoay quanh bài toán suy luận LLM nhanh, thay vì huấn luyện. Đây là giai đoạn hệ thống dùng mô hình đã huấn luyện để trả lời người dùng, vốn chiếm phần lớn chi phí vận hành dịch vụ AI. Richard Ho cho biết Jalapeño cân bằng giữa lưu lượng xử lý và tốc độ phản hồi, cho phép phục vụ nhiều người dùng hơn với chi phí thấp hơn, đồng thời giảm thời gian chờ cho các tác vụ yêu cầu thời gian thực. Trong thử nghiệm, Jalapeño không chỉ làm nhiều việc hơn trên mỗi watt mà còn giảm độ trễ đáng kể trong các yêu cầu từ GPT-OSS-120B, Kimi K2.5 1T và DeepSeek R1 670B. Nói cách khác, cùng một trung tâm dữ liệu, OpenAI có thể chọn: hoặc giảm chi phí hạ tầng bằng cách phục vụ cùng lượng người dùng với ít điện hơn, hoặc giữ chi phí tương đương nhưng cho trải nghiệm nhanh hơn rõ rệt. Với người dùng cuối, điều này có nghĩa là các phiên chat dài, sinh mã siêu phản hồi hoặc công cụ tìm kiếm AI có thể trở nên mượt mà hơn, ít “quay vòng tròn” chờ đợi. Trong ngắn hạn, chúng ta có thể thấy những gói dịch vụ rẻ hơn hoặc các tính năng tương tác phong phú hơn, vì mỗi yêu cầu suy luận LLM giờ tiêu tốn ít tài nguyên hơn.

Chi phí hạ tầng, lộ trình triển khai và tương lai cạnh tranh với Nvidia

Một thông điệp quan trọng từ Broadcom là: với những khối lượng công việc AI thông thường, Jalapeño có thể giảm khoảng 50% chi phí vận hành so với các GPU AI phổ biến. Công suất khoảng 700 watt giúp chip này tiết kiệm điện cho trung tâm dữ liệu, và chính yếu tố năng lượng mới là nơi cuộc chiến chip AI trở nên khốc liệt. Việc tối ưu xử lý và tiêu thụ điện cho suy luận giúp OpenAI phục vụ nhiều người dùng hơn mà không phải tăng mức tiêu thụ điện tương ứng. Về lộ trình, các mẫu kỹ thuật đang thử nghiệm, bản chính thức dự kiến triển khai tới trung tâm dữ liệu của Microsoft và đối tác từ cuối năm nay, sau đó OpenAI lên kế hoạch đưa chip vào hệ thống của mình từ cuối 2026, với đợt ramp lớn hơn vào 2027. Tuy vậy, Jalapeño sẽ cùng tồn tại với phần cứng Nvidia trong đội tàu hạ tầng của OpenAI, không thay thế hoàn toàn. Một điểm cần tỉnh táo là những số liệu hiện tại đều là thử nghiệm nội bộ và không so với thế hệ Vera Rubin mới nhất của Nvidia; Jalapeño cũng chưa dùng cho huấn luyện, nên OpenAI vẫn phụ thuộc vào GPU Nvidia trong mảng này trong tương lai gần. Nói cách khác, Jalapeño là đòn bẩy giảm chi phí suy luận, chứ chưa phải chìa khóa "thoát Nvidia".

Kết luận: Jalapeño là bước ngoặt, nhưng không phải điểm kết thúc

Jalapeño là bước ngoặt vì lần đầu OpenAI chứng minh rằng một OpenAI chip tùy chỉnh có thể đánh bại hiệu năng chip Nvidia trên mỗi watt trong các bài test suy luận LLM cụ thể, với mức chênh lệch lên tới 1,9 lần. Nhưng đây mới là hiệp một của cuộc chơi. Các kết quả hiện chỉ phản ánh một số cấu hình, chưa qua triển khai thương mại quy mô lớn, và tập trung vào suy luận chứ không phải huấn luyện. Từ góc nhìn người dùng, chiến thắng quan trọng nhất không phải là bảng xếp hạng benchmark, mà là việc Jalapeño giúp suy luận LLM nhanh và rẻ hơn, mở đường cho AI phổ biến hơn, ít bị giới hạn bởi chi phí hạ tầng. Trong vài năm tới, OpenAI sẽ vừa chạy Jalapeño, vừa sống chung với GPU Nvidia. Sự cạnh tranh này có thể khiến các hãng chip phải tăng tốc đổi mới, còn doanh nghiệp và người dùng sẽ hưởng lợi từ hạ tầng AI linh hoạt, rẻ và phản hồi nhanh hơn. Nếu Jalapeño chứng minh được hiệu quả 1,9 lần ở thế giới thực, câu hỏi không còn là "OpenAI có cần GPU Nvidia không", mà là "Nvidia phải thay đổi bao nhiêu để không bị Jalapeño và các chip ASIC tương lai vượt mặt".

Sammfy nhận hoa hồng khi bạn mua sắm qua liên kết của chúng tôi, bạn không phải trả thêm chi phí.

Related Products

You May Also Like

Comments
Viết gì đó...
Chưa có bình luận nào. Hãy là người đầu tiên chia sẻ suy nghĩ!