Gemini Robotics 2: Bước ngoặt đưa robot ra khỏi phòng thí nghiệm

Gemini Robotics 2: Bước ngoặt đưa robot ra khỏi phòng thí nghiệm
Sở thích|Khám phá ứng dụng AI

Gemini Robotics 2 là gì và vì sao đây là bước ngoặt

Gemini Robotics 2 là một hệ thống robot AI control đa mô hình, kết hợp thị giác, ngôn ngữ và hành động để cho phép robot suy luận, lập kế hoạch và điều khiển chuyển động toàn thân trong môi trường thực, đồng thời thích ứng với cấu hình robot mới trong thời gian được tính bằng giờ thay vì tuần hoặc tháng.

Google ngày 31/7 công bố Gemini Robotics 2 như bộ mô hình AI cốt lõi cho robot thế hệ mới, còn nhóm nghiên cứu giới thiệu hệ thống này như bộ não điều khiển toàn bộ cơ thể robot hình người ngày 30/7. Nói cách khác, đây không phải chỉ là một bản nâng cấp phần mềm mà là một nền tảng deep learning robotics mới, nơi robot không còn phụ thuộc hoàn toàn vào kịch bản lập trình thủ công. Thông điệp quan trọng ở đây: Google đang muốn biến AI thành “trí tuệ hiện thân”, nghĩa là hiểu và hành động trong thế giới vật lý, chứ không chỉ nằm sau màn hình. Và khi robot có thể học cấu hình mới trong vài giờ, bài toán triển khai ngoài đời thực thay đổi hoàn toàn.

Gemini Robotics 2: Bước ngoặt đưa robot ra khỏi phòng thí nghiệm

Ba mô hình, ba tầng trí tuệ: từ suy luận đến điều khiển trên thiết bị

Điểm đáng nói nhất của Gemini Robotics 2 là kiến trúc ba mô hình AI chuyên biệt nhưng liên kết chặt chẽ: Gemini Robotics 2 (VLA), Gemini Robotics ER 2 (VLM cho suy luận hiện thân) và Gemini Robotics On-Device 2. Đây là cách Google tách bài toán robot AI control thành ba tầng: lên kế hoạch chuyển động ở mức cao, điều phối nhiệm vụ nhiều bước và điều khiển động cơ theo thời gian thực trên robot.

Gemini Robotics 2 là mô hình thị giác–ngôn ngữ–hành động điều khiển cả robot hình người toàn thân, từ chân đến tay, lẫn robot hai tay. Gemini Robotics ER 2 chịu trách nhiệm suy luận hiện thân, theo dõi hình ảnh từ camera, chia tác vụ thành nhiều bước, kiểm tra tiến độ và điều chỉnh nếu robot làm sai. Cuối cùng, Gemini Robotics On-Device 2 là mô hình VLA tối ưu để chạy trực tiếp trên phần cứng robot, giảm phụ thuộc vào kết nối Internet và cho phép tinh chỉnh cho một robot mới chỉ với vài giờ dữ liệu. Đây là kiến trúc robot adaptation technology có tính thực dụng: mỗi tầng xử lý một lớp phức tạp, khiến việc triển khai không còn phụ thuộc vào một siêu mô hình duy nhất khó bảo trì.

Từ mô phỏng tới đời thực: robot biết suy nghĩ trước khi hành động

Thế mạnh của Gemini Robotics 2 không nằm ở vài video demo “ngầu” mà ở cách nó kết hợp quan sát, suy luận và hành động trong cùng một nhiệm vụ. Khi nhận lệnh bằng ngôn ngữ tự nhiên, robot có thể quan sát môi trường, xác định vị trí đồ vật rồi tự lập kế hoạch các bước. Để cất một món đồ vào ngăn thấp, robot phải tự di chuyển đến vị trí phù hợp, cúi người, điều chỉnh trọng tâm, nhặt đồ và giữ thăng bằng trong suốt quá trình.

Theo Google, các hệ thống này được huấn luyện bằng mô phỏng, video mẫu và dữ liệu thu thập khi con người trực tiếp điều khiển robot. Nói cách khác, đây là một dạng autonomous robot learning: robot học từ thế giới ảo và từ hành vi con người, rồi tự tổng hợp thành chính sách kiểm soát trong thế giới thực. Các bài thử nghiệm cho thấy robot có thể đi bộ, ngồi thấp, vươn người, thu dọn đồ trên kệ, đóng túi nhựa, buộc túi rác hay tháo bóng đèn trong không gian chật hẹp hoặc lộn xộn. Câu chuyện không còn là robot làm một động tác lặp lại, mà là robot suy nghĩ trước khi hành động.

Khả năng thích ứng đa cấu hình: từ humanoid đến robot công nghiệp

Điểm đột phá về robot adaptation technology nằm ở khả năng thích ứng nhanh với cấu hình robot mới. Google nhấn mạnh năng lực “trí tuệ hiện thân” cho phép hệ thống thích ứng với cấu hình robot mới chỉ trong vài giờ; Gemini Robotics On-Device 2 có thể nhanh chóng thích ứng với các cấu hình hoàn toàn mới bằng lượng dữ liệu thu thập trong khoảng thời gian tương tự. Nghĩa là cùng một bộ não AI có thể được tinh chỉnh để điều khiển nhiều kiểu robot khác nhau, thay vì bị khóa cứng vào một phần cứng duy nhất.

Gemini Robotics 2 cũng mở rộng khả năng điều khiển bàn tay: hệ thống vận hành bàn tay năm ngón SharpaWave với 22 bậc tự do và vẫn tương thích với kẹp hai ngón phổ biến trên robot công nghiệp. Đây là bước tiến quan trọng với deep learning robotics, vì cùng một hệ thống phải kết hợp reasoning với motor control trên cả robot hình người và robot công nghiệp. Tuy nhiên, các con số hiện tại cho thấy hành động tinh vẫn khó: trên robot Apollo 2, tỉ lệ thành công đạt 92% khi tháo bóng đèn nhưng chỉ 36% khi lắp bóng đèn, 44% khi buộc túi rác và 40% khi đóng túi khóa kéo. "Tỉ lệ thành công 92% khi tháo bóng đèn nhưng dưới 50% cho một số thao tác tinh cho thấy AI vẫn cần cải thiện trước khi robot được triển khai rộng rãi".

Tương lai triển khai: ích lợi cho người dùng và những giới hạn còn đó

Với người dùng cuối, câu hỏi không phải là robot có “ngầu” hay không, mà là có an toàn và hữu ích hay không. Gemini Robotics ER 2 được thiết kế để phát hiện khi có người tiến lại gần, đưa robot về trạng thái dừng an toàn và chỉ tiếp tục khi khu vực đã thông thoáng. Điều này cho thấy Google cố gắng đưa an toàn vào kiến trúc ngay từ đầu, nhất là khi robot AI control bắt đầu làm việc sát bên con người. Tuy vậy, môi trường ngoài đời luôn đầy bất ngờ: đồ vật lệch khỏi vị trí, sàn trơn, ánh sáng thay đổi, người xuất hiện đột ngột. Chỉ một lỗi trong nhận biết hay lập kế hoạch có thể thành tai nạn.

Hiện Gemini Robotics 2 chưa được thương mại hóa dưới dạng robot tiêu dùng; hệ thống trước mắt là nền tảng AI cho nghiên cứu, phát triển và tích hợp của các nhà sản xuất robot. Mô hình On-Device 2 mới cung cấp cho một số đối tác thử nghiệm. Dù vậy, việc AI mở rộng từ ứng dụng trên màn hình sang điều khiển robot trong thế giới thực cho thấy hướng đi đã rõ. Trước khi robot hình người làm việc phổ biến bên cạnh con người, các bài toán về tốc độ, độ chính xác, chi phí và đặc biệt là an toàn vẫn cần thêm thời gian để giải quyết. Gemini Robotics 2 vì thế vừa là bước tiến lớn, vừa là lời nhắc rằng cuộc đua đưa robot ra khỏi phòng thí nghiệm vẫn còn dài.

Sammfy nhận hoa hồng khi bạn mua sắm qua liên kết của chúng tôi, bạn không phải trả thêm chi phí. Bài viết này được tạo bằng AI từ các nguồn đã công bố và dữ liệu sản phẩm.

You May Also Like

Comments
Viết gì đó...
Chưa có bình luận nào. Hãy là người đầu tiên chia sẻ suy nghĩ!