Khám phá sở thích, cùng nhau

Deal thật, đánh giá chân thực và câu chuyện mua sắm từ những người cùng sở thích với bạn — mỗi ngày trên Sammfy.

Khám phá sở thích, cùng nhauDeal thật, đánh giá chân thực và câu chuyện mua sắm từ những người cùng sở thích với bạn — mỗi ngày trên Sammfy.

Google Gemini 3.8 Live with Live Avatar: trợ lý có khuôn mặt cho doanh nghiệp AI tương tác

Google Gemini 3.8 Live with Live Avatar: trợ lý có khuôn mặt cho doanh nghiệp AI tương tác
Sở thích|Khám phá ứng dụng AI

Gemini 3.8 Live with Live Avatar là gì và vì sao đáng chú ý?

Gemini 3.8 Live with Live Avatar là giải pháp kết hợp mô hình hội thoại giọng nói thời gian thực với video avatar AI tạo sinh, cho phép doanh nghiệp xây dựng trợ lý khách hàng AI có khuôn mặt, biết lắng nghe bằng âm thanh, quan sát qua camera và phản hồi bằng giọng nói cùng biểu cảm gắn khớp chuyển động miệng, tạo cảm giác đối thoại tự nhiên hơn nhiều so với chatbot văn bản truyền thống. Điểm mấu chốt: Google không còn muốn trợ lý số chỉ là ô chat; họ muốn biến avatar AI Gemini thành “nhân viên tuyến đầu” trên nền tảng doanh nghiệp AI tương tác. Mỹ Google đã công bố Gemini 3.8 Live with Live Avatar ngày 24/9, đưa tính năng này vào gói Gemini Enterprise để các tổ chức dùng trong môi trường sản xuất chứ không chỉ trong demo. Đây là bước đi mang tính tuyên bố: giao diện của dịch vụ khách hàng tương lai sẽ có mặt, giọng và cảm xúc – dù phía sau là thuật toán.

Kết hợp hội thoại thời gian thực, hình ảnh và công cụ: trợ lý không bị “đứng hình”

Khác với thế hệ bot đọc – trả lời đơn điệu, Gemini 3.8 Live with Live Avatar dùng mô hình hội thoại giọng nói 3.8 Live kết hợp streaming video độ trễ thấp. Avatar AI lắng nghe tiếng nói, xem luồng camera hoặc chia sẻ màn hình, rồi phản hồi bằng hình ảnh nhân vật đang nói với chuyển động miệng khớp lời và biểu cảm thay đổi liên tục. Đây là tổng hợp giọng nói AI gắn liền hình ảnh, tạo trải nghiệm liền mạch giữa âm thanh, thị giác và ngữ nghĩa. Điểm đặc biệt, 3.8 Live hỗ trợ gọi công cụ bất đồng bộ: avatar vẫn trò chuyện trong khi phía sau tự động chạy quy trình, chẳng hạn xử lý thủ tục check-in khách sạn hoặc tra cứu thông tin xe cho khách mà không làm gián đoạn cuộc đối thoại. Về ngôn ngữ, hệ thống hỗ trợ tới 97 ngôn ngữ và có thể đổi ngôn ngữ giữa chừng mà vẫn giữ chất lượng hình ảnh cùng độ khớp môi và biểu cảm. Đây là nền tảng khá phù hợp cho trợ lý khách hàng AI phục vụ tập khách đa ngôn ngữ.

Google Gemini 3.8 Live with Live Avatar: trợ lý có khuôn mặt cho doanh nghiệp AI tương tác

Tổng hợp giọng nói AI: từ thư viện 2.000 giọng đến thiết kế “nhân viên thương hiệu”

Hình ảnh sinh động sẽ trở nên giả tạo nếu giọng nói vẫn đều đều như máy; Google rõ ràng hiểu điều đó khi tung song song Gemini 3.8 Flash TTS và Flash-Lite TTS – hai mô hình chuyển văn bản thành giọng nói mới trong dòng Gemini 3.8. Flash TTS hướng tới thiết kế nhân vật, cho phép tạo giọng nói hoàn toàn mới từ lệnh ngôn ngữ tự nhiên, kiểm soát vai trò, giọng điệu, tốc độ, phương ngữ và cả âm thanh đệm trên hơn 100 ngôn ngữ. Flash-Lite TTS thì tối ưu cho khối lượng lớn và tiết kiệm chi phí, phù hợp với lồng tiếng quy mô lớn và tác nhân giọng nói biểu cảm. Theo Google, Gemini 3.8 Flash TTS đạt 71,4 điểm trên Voice Design Benchmark của Hume AI và đứng vị trí số 1 cùng số 2 trên Overall Quality Index. Đây là tuyên bố dữ liệu khá mạnh: họ không chỉ tạo được giọng nói, mà còn dẫn đầu về độ biểu cảm. Cộng thêm thư viện hơn 2.000 giọng nói với nhiều biến thể khu vực như Tây Ban Nha Mexico, Pháp Quebec, Anh Scotland, doanh nghiệp có thể chọn hoặc thiết kế một “nhân viên thương hiệu” mang giọng riêng chứ không bị giới hạn vào vài giọng tổng đài cũ kỹ.

Ứng dụng thực tế: từ kiosk bán lẻ đến trợ lý mua xe trên Autotrader

Google định vị Gemini 3.8 Live with Live Avatar như lớp giao diện cho doanh nghiệp AI tương tác, chứ không phải công cụ chơi cho người dùng cá nhân. Dịch vụ hiện mở cho khách hàng doanh nghiệp qua console đám mây và Live API để tích hợp vào hệ thống riêng. Các tình huống được nhắm tới là trợ lý khách hàng AI trên web, ứng dụng di động, kiosk tại cửa hàng bán lẻ, hoặc “hướng dẫn viên” dạng hội thoại cho các quy trình phức tạp. Ở đó, avatar AI Gemini sẽ vừa nghe, vừa nhìn, vừa thao tác công cụ ngầm để dẫn khách đi qua từng bước. Trong một ví dụ triển khai, Cox Automotive đã xây dựng trợ lý avatar trên trang thông tin xe Autotrader, cho phép người dùng trò chuyện trong khi hệ thống hướng dẫn tìm, so sánh xe và tư vấn khoản vay. Đây là kiểu tương tác mà chatbot văn bản khó đạt được: khách hàng có cảm giác đang hỏi một nhân viên, chứ không “gõ lệnh” vào một ô nhập liệu. Bên cạnh đó, các đối tác khác tích hợp mô hình TTS như Figma, HeyGen, Linguana, Wondercraft, 99.co và Ollang để mở rộng ra lồng tiếng toàn cầu, bản địa hóa nội dung và vận hành tác nhân giọng nói hội thoại ở quy mô lớn.

Rào chắn an toàn và giới hạn: avatar AI Gemini vẫn là trợ lý, không phải bản sao con người

Việc cho phép tạo avatar từ hình ảnh cá nhân luôn kéo theo nguy cơ giả mạo; Google dường như chọn giải pháp kiểm soát chặt thay vì mở tự do. Doanh nghiệp chỉ có thể tạo avatar tùy chỉnh – ví dụ từ nhân viên được cấp phép hoặc người đại diện thương hiệu – nếu nằm trong danh sách cho phép và qua quy trình xác minh nghiêm ngặt. Với tổng hợp giọng nói AI, khi tái tạo giọng nói từ đoạn âm thanh 30 giây, hệ thống yêu cầu bản ghi âm đồng thuận của chủ sở hữu giọng khớp với người nói tham chiếu, kèm watermark SynthID và chứng chỉ C2PA để đảm bảo tính minh bạch. SynthID được gắn vào mọi âm thanh và video do mô hình tạo, như một dấu ẩn giúp nhận diện nội dung do AI sinh ra, nhằm giảm nguy cơ thông tin sai lệch và giả mạo. Dù Live Avatar có thể tạo avatar từ một ảnh tham chiếu duy nhất và mẫu âm thanh để sinh video với chuyển động đầu tự nhiên và biểu cảm đồng bộ phát lời, Google vẫn giới hạn phiên đối thoại ở mức vài phút, không thiết kế cho việc dùng liên tục hàng giờ. Thông điệp ngầm khá rõ: đây là trợ lý khách hàng AI cho từng phiên tương tác, không phải bản sao số sống cùng người dùng 24/7.

Sammfy nhận hoa hồng khi bạn mua sắm qua liên kết của chúng tôi, bạn không phải trả thêm chi phí.

You May Also Like

Comments
Viết gì đó...
Chưa có bình luận nào. Hãy là người đầu tiên chia sẻ suy nghĩ!