Khám phá sở thích, cùng nhau

Deal thật, đánh giá chân thực và câu chuyện mua sắm từ những người cùng sở thích với bạn — mỗi ngày trên Sammfy.

Khám phá sở thích, cùng nhauDeal thật, đánh giá chân thực và câu chuyện mua sắm từ những người cùng sở thích với bạn — mỗi ngày trên Sammfy.

GPT-6 Astra và Android Bench 2.0: khi AI gặp thực tế

GPT-6 Astra và Android Bench 2.0: khi AI gặp thực tế
Sở thích|Khám phá ứng dụng AI

AI đa tác vụ: từ lời hứa tự động hóa đến va vấp thực tế

GPT-6 Astra và Android Bench 2.0 đại diện cho thế hệ kiểm tra hiệu suất AI mới, nơi mô hình ngôn ngữ lớn không chỉ trả lời câu hỏi mà phải xử lý tác vụ web đa bước, thao tác trên máy tính và hoàn thành công việc phát triển phần mềm với nhiều bước liên tiếp, qua đó bộc lộ khoảng cách giữa lời quảng cáo “tự động hóa mọi thứ” và khả năng ứng dụng thực tế trong đời sống và công việc hàng ngày.

OpenAI giới thiệu GPT-6 Astra như một trợ lý biết dùng máy tính, chuyển qua lại giữa trình duyệt và phần mềm để xử lý các tác vụ web nhiều bước, từ đăng ký bồi thường rò rỉ dữ liệu đến đặt vé tàu lễ Chuseok. Đồng thời, Google tung Android Bench 2.0 để kiểm tra hiệu suất AI trên các nhiệm vụ phát triển Android phức tạp, có thể kéo dài nhiều ngày. Hai động thái này không còn là màn trình diễn công nghệ, mà là tuyên bố: AI đã sẵn sàng bước vào những quy trình quen thuộc nhưng lắt léo mà người dùng luôn ngại đụng đến.

GPT-6 Astra: mạnh ở thao tác lặp lại, yếu ở điểm ma sát người dùng

Bài thử nghiệm Astra được thiết kế theo một tiêu chí rất đời thường: AI giúp giảm bớt cảm giác phiền toái của người dùng đến mức nào. Mỗi tác vụ được chấm trên thang 10 điểm từ góc nhìn cá nhân, và chính thang điểm chủ quan này lại nói nhiều hơn mọi benchmark kỹ thuật: người dùng không đánh giá độ thông minh của mô hình, họ quan tâm mình phải can thiệp bao nhiêu.

Ở tác vụ đăng ký bồi thường rò rỉ dữ liệu của một nền tảng OTT, Astra được 8/10 điểm: tự tìm đúng trang, tóm tắt điều kiện, dẫn từng bước xác minh và chọn gói bồi thường. Tuy nhiên, mọi thứ khựng lại ở bước đăng nhập, nơi người dùng quên tài khoản lẫn mật khẩu. Astra có thể tìm trang đặt lại mật khẩu, nhưng những thao tác xác thực qua điện thoại và tạo mật khẩu mới vẫn là vùng cấm tâm lý: rủi ro bảo mật vượt lợi ích tiện lợi. Với hủy tài khoản một dịch vụ y tế thẩm mỹ, điểm rơi xuống 3/10 vì người dùng phải cung cấp thêm dữ liệu cá nhân để tiếp tục và cuối cùng vẫn phải tự mở ứng dụng di động để hoàn tất quy trình. Astra xử lý rất tốt phần thao tác lặp lại trên web, nhưng lại bất lực trước những "nút ma sát" gắn với danh tính, bảo mật và chính sách nền tảng.

Android Bench 2.0: AI coding bước vào bài thi dài ngày

Nếu Astra đang học cách sống trong thế giới biểu mẫu, mã xác thực và quy trình người dùng, Android Bench 2.0 đặt các mô hình ngôn ngữ lớn vào thực tế khác: công việc phát triển Android dài ngày. Google mô tả đây là bản cập nhật benchmark AI mới, chuyển từ các thay đổi nhỏ sang những nhiệm vụ dài hơi như nâng cấp dependency, thêm tính năng lớn và xây ứng dụng từ đầu. Nói thẳng, đây là lần hiếm hoi các mô hình phải chịu trách nhiệm trước những việc mà lập trình viên vẫn làm trong nhiều ngày, không phải vài dòng trong REPL.

Android Bench 2.0 dùng cách chấm điểm liên tục, không chỉ đúng hoặc sai, để đo mức độ hoàn thành và chất lượng kết quả. Theo bảng xếp hạng mới, GPT-6 Astra đang dẫn đầu với tỉ lệ vượt bài là 28%, trong khi Gemini 3.8 Flash chỉ đạt 8%. Đây là một câu nói đáng trích dẫn: "GPT-6 Astra currently sits at the top of the benchmark with a 28% pass rate, while Gemini 3.8 Flash scored just 8%." Con số nghe có vẻ thấp, nhưng lại thực tế hơn nhiều so với các demo "AI viết app trong vài phút". Google thẳng thắn thừa nhận rằng việc kiểm tra trên tập tác vụ dài ngày giúp họ hiểu rõ điểm mạnh, điểm yếu của từng mô hình, đồng thời cho lập trình viên cái nhìn thực tế về mô hình nào phù hợp cho loại nhiệm vụ nào.

Hiệu suất loang lổ và khoảng cách giữa quảng cáo và đời sống

Điểm chung của Astra trên web và các mô hình trong Android Bench 2.0 là hiệu suất không hề đồng đều. Một số tác vụ web cho kết quả vượt kỳ vọng, như tra cứu lịch hội thảo Quốc hội hay xử lý ảnh GIF để đăng bài – những việc lặp lại, quy tắc rõ ràng, ít liên quan đến danh tính. Nhưng khi bước sang săn giá rẻ trên nền tảng mua sắm, AI gặp ngay mã bảo mật, chính sách hạn chế kiểu truy cập giống macro và những giới hạn token, khiến việc "jailbreak" để lách rào còn mất công hơn người dùng tự thao tác.

Trong phát triển Android, kết quả Android Bench 2.0 cũng cho thấy bức tranh tương tự: cùng một bộ nhiệm vụ dài ngày, mô hình dẫn đầu chỉ hoàn thành được khoảng một phần tư, phần còn lại là nửa vời hoặc thất bại. Điều này phá vỡ kỳ vọng rằng một mô hình AI hàng đầu sẽ "giỏi đều" ở mọi mặt. Thay vào đó, chúng ta đang có những mô hình chuyên biệt: Astra tỏ ra hữu dụng với tác vụ web đa bước có cấu trúc, các mô hình khác có thể tốt hơn ở phần sinh mã hoặc phân tích lỗi. Khoảng cách giữa khả năng được quảng cáo và kết quả thực tế không phải là bi kịch, mà là lời nhắc rằng AI cần được xem như công cụ – mỗi công cụ có phạm vi hiệu quả, chứ không phải là phép màu toàn năng.

Từ kỳ vọng "AI làm hộ tất cả" đến chiến lược sử dụng thực tế

Hai câu chuyện – Astra trên web và Android Bench 2.0 trong lập trình – đang vẽ lại đường biên giữa mơ tưởng và sử dụng thực tế. Trong thử nghiệm web, nếu trạng thái đăng nhập đã được lưu sẵn, người dùng hầu như không cần can thiệp thêm và AI có thể gần như hoàn tất quy trình. Ở phía coding, bảng xếp hạng Android Bench 2.0 sẽ còn được mở rộng với thêm mô hình và kết quả mới, cho phép các nhóm phát triển chọn mô hình phù hợp thay vì tin vào một cái tên duy nhất.

Điều chúng ta cần lúc này không phải là thêm video quảng cáo mà là thói quen kiểm tra hiệu suất AI trong bối cảnh riêng: một doanh nghiệp nên hỏi mô hình này làm được gì với hệ thống hiện có, chính sách bảo mật và quy trình nội bộ ra sao; một người dùng cá nhân nên xác định mình muốn AI gánh những phần việc nào, đặc biệt là những khâu gây cảm giác phiền toái nhưng ít rủi ro. Khi coi GPT-6 Astra và các mô hình khác như những trợ lý chuyên trách thay vì "người máy vạn năng", khoảng cách giữa kỳ vọng và thực tế sẽ thu hẹp lại, không phải vì AI đột ngột trở nên toàn năng, mà vì chúng ta sử dụng nó đúng việc, đúng chỗ.

Sammfy nhận hoa hồng khi bạn mua sắm qua liên kết của chúng tôi, bạn không phải trả thêm chi phí.

You May Also Like

Comments
Viết gì đó...
Chưa có bình luận nào. Hãy là người đầu tiên chia sẻ suy nghĩ!