Khám phá sở thích, cùng nhau

Deal thật, đánh giá chân thực và câu chuyện mua sắm từ những người cùng sở thích với bạn — mỗi ngày trên Sammfy.

Khám phá sở thích, cùng nhauDeal thật, đánh giá chân thực và câu chuyện mua sắm từ những người cùng sở thích với bạn — mỗi ngày trên Sammfy.

Google Gemini 3.8 Flash TTS: bước nhảy lớn của tạo giọng nói AI

Google Gemini 3.8 Flash TTS: bước nhảy lớn của tạo giọng nói AI
Sở thích|Khám phá ứng dụng AI

Từ TTS đọc chữ sang “diễn xuất” bằng giọng nói AI

Google Gemini TTS là bộ mô hình text to speech mới, trong đó Gemini 3.8 Flash và Flash-Lite biến văn bản thành giọng nói AI có khả năng diễn xuất, kiểm soát cảm xúc và tông giọng chi tiết bằng ngôn ngữ tự nhiên, hỗ trợ đa ngôn ngữ và cho phép tạo giọng nói từ con số 0 thay vì chỉ chọn trong danh sách có sẵn. Google giới thiệu Gemini 3.8 Flash TTS và Gemini 3.8 Flash-Lite TTS ngày 23/09/2026 như những mô hình tạo âm thanh biểu cảm nhất của họ cho đến nay. Đây không phải là một bản nâng cấp nhỏ: nó là lời tuyên bố rằng TTS đã bước khỏi vai trò “máy đọc chữ” để trở thành công cụ thiết kế nhân vật âm thanh. Việc chấp nhận đầu vào tới 8K token và trả ra tới 64K token cho phép tạo nội dung audio dạng dài với chất lượng ổn định, từ podcast cho tới sách nói nhiều giờ. Với Flash-Lite, Google đồng thời nhắm vào các kịch bản sản xuất khối lượng lớn như lồng tiếng và trợ lý giọng nói, nơi chi phí và độ ổn định quan trọng hơn từng sắc thái diễn xuất.

Zero-shot voice: khi giọng nói được “viết” bằng prompt

Điểm khác biệt mang tính bước ngoặt của Gemini 3.8 Flash TTS là khả năng tạo giọng nói từ không có sẵn (zero-shot) thay vì chỉ chọn trong một tập giọng cố định. Trước đây, nhà phát triển bị giới hạn trong khoảng 30 giọng mặc định; nay họ có thể mô tả vai trò, accent, chất giọng bằng ngôn ngữ tự nhiên và mô hình tạo ra một nhân vật âm thanh hoàn toàn mới. Theo thông tin công bố, thư viện đã mở rộng lên hơn 2.000 giọng nói sẵn sàng sản xuất, bao gồm các biến thể vùng miền như Tây Ban Nha Mexico hay Pháp Quebec, tất cả dựa trên nền Gemini 3 Pro và hỗ trợ hơn 100 ngôn ngữ, phương ngữ. Đây là sự thay đổi mô hình: AI voice generation không còn là câu chuyện chọn giọng nam/nữ, nhanh/chậm; nó trở thành quá trình thiết kế nhân vật tương tự thiết kế nhân vật game hay thương hiệu, với khả năng lưu và quản lý giọng tùy chỉnh để dùng xuyên suốt dự án. Sắp tới, tính năng “trộn giọng” cho phép chỉnh âm sắc, cao độ, tốc độ và accent trên giọng trong thư viện sẽ tiếp tục đẩy xa ranh giới sáng tạo giọng nói.

Kiểm soát diễn xuất và cảm xúc: lợi thế thực tế so với TTS truyền thống

Khả năng kiểm soát chi tiết diễn xuất là nơi Gemini 3.8 Flash TTS vượt xa thế hệ TTS truyền thống. Người dùng có thể viết chỉ dẫn như lời dẫn sân khấu cho từng dòng thoại: yêu cầu nhân vật nói chậm lại, căng thẳng, nhẹ nhàng hay mỉa mai, tất cả bằng ngôn ngữ tự nhiên. Mô hình còn hiểu các tag phi ngôn ngữ như <laughs>, <sigh>, <gasp> hay các lời đệm “mhm”, “yeah”, tạo cảm giác trò chuyện sống động hơn hẳn kiểu đọc chữ đều đều trước đây. Theo đánh giá trên thước đo thiết kế giọng nói của Hume AI, Flash TTS đứng đầu tổng thể với điểm 71,4 và dẫn đầu ở hạng mục accent với 60,8, trong khi Flash-Lite xếp thứ hai về chất lượng tổng thể. Việc mô hình giữ được chất giọng, nhịp điệu và âm sắc nhân vật ổn định suốt hàng giờ audio dạng dài giải quyết đúng nỗi đau của audiobook, podcast và đào tạo nội bộ, nơi TTS cũ thường bị “trôi” nhân vật hoặc nghe mệt mỏi theo thời gian. Các đánh giá mù trên Voice Arena cũng cho thấy hai mô hình đứng đầu ở nhiều ngôn ngữ, trong đó có tiếng Nhật, tiếng Việt và tiếng Tây Ban Nha Mexico, khẳng định tiềm năng ứng dụng toàn cầu.

Đa ngôn ngữ, bảo mật bằng SynthID và đường đi cho nhà phát triển

Về phạm vi sử dụng, Gemini 3.8 Flash TTS hỗ trợ 130 ngôn ngữ còn Flash-Lite TTS hỗ trợ 101 ngôn ngữ, cả hai đều hỗ trợ tiếng Nhật và nhiều ngôn ngữ chính khác. Đáng chú ý, mọi đoạn audio tạo ra đều được nhúng watermark SynthID “không nghe thấy” để có thể nhận diện âm thanh do AI tạo, nhằm giảm nguy cơ giả mạo giọng nói và hỗ trợ truy vết nội dung. Tính năng sao chép giọng nói từ mẫu 30 giây được bảo vệ bằng quy trình xác minh đồng thuận bằng lời và chứng chỉ C2PA, nhưng bị giới hạn tại một số khu vực trên thế giới trong AI Studio. Từ góc nhìn nhà phát triển, việc cả hai mô hình đều được cung cấp qua Gemini API và AI Studio ngay thời điểm ra mắt nghĩa là có thể nhanh chóng tích hợp vào hệ thống hiện có. Flash TTS đã xuất hiện trong Gemini Notebook, Flash-Lite TTS trong dịch vụ tạo video Google Vids, và quyền truy cập doanh nghiệp qua Gemini Enterprise sẽ sớm mở để xây dựng các trợ lý giọng nói, hệ thống lồng tiếng và trải nghiệm tương tác quy mô lớn. Nhiều nền tảng phát triển và dịch vụ sáng tạo đã bắt đầu tích hợp, báo hiệu một hệ sinh thái tạo giọng nói AI đang hình thành quanh Gemini 3.8.

Ý nghĩa cho doanh nghiệp và nhà phát triển: từ thử nghiệm đến chiến lược

Nếu coi TTS truyền thống là công cụ phụ trợ, Gemini 3.8 Flash TTS đang biến tạo giọng nói AI thành một lớp chiến lược trong sản phẩm số. Với zero-shot voice và điều khiển diễn xuất bằng ngôn ngữ tự nhiên, nhà phát triển có thể thiết kế nhân vật giọng nói phù hợp từng thương hiệu, từng chiến dịch, thay vì chấp nhận một giọng “na ná” đối thủ. Flash-Lite, trong khi ít linh hoạt hơn về diễn xuất, lại mở cửa cho các kịch bản tự động hóa khối lượng lớn: đọc tin cho app, lồng tiếng đa ngôn ngữ, trợ lý giọng nói trong chăm sóc khách hàng. Điểm đáng nói là Google tuy khẳng định Gemini 3.8 Audio không bộc lộ khả năng mới đáng kể về rủi ro an toàn so với 3.7 Flash, nhưng việc gắn SynthID bắt buộc cho mọi âm thanh cho thấy họ hiểu rất rõ mặt tối tiềm ẩn của voice replication và deepfake. Kết luận, đối với doanh nghiệp và nhà phát triển nghiêm túc về trải nghiệm âm thanh, câu hỏi không còn là “có nên dùng TTS hay không”, mà là “thiết kế chiến lược giọng nói như thế nào trong kỷ nguyên Gemini 3.8 Flash?”.

Sammfy nhận hoa hồng khi bạn mua sắm qua liên kết của chúng tôi, bạn không phải trả thêm chi phí.

You May Also Like

Comments
Viết gì đó...
Chưa có bình luận nào. Hãy là người đầu tiên chia sẻ suy nghĩ!