Từ AI tạo video tới mô hình thế giới AI: ByteDance đổi luật chơi
Mô hình thế giới AI là loại mô hình trí tuệ nhân tạo không chỉ tạo ra các đoạn video tĩnh mà mô phỏng một môi trường ảo liên tục, có khả năng thay đổi theo thời gian thực để phản hồi lại hành động, chuyển động và lời nói của người dùng như một thế giới sống động đang vận hành. ByteDance đang đặt cược lớn vào hướng này: thay vì để người dùng ngồi xem clip được tạo sẵn, công ty muốn AI dựng nên một không gian ảo liên tục thay đổi theo hành động và lời nói của người dùng trong thời gian thực. Nói cách khác, đây không còn là cuộc đua AI tạo video thông thường, mà là tham vọng chiếm lĩnh lớp hạ tầng mô phỏng thế giới số. Theo các nguồn tin, mô hình mới chuyên về khởi tạo video không gian theo thời gian thực và có thể ra mắt trong vài tuần tới, đối đầu trực tiếp Meta và Alphabet.
Vai trò của Trương Nhất Minh: khi người sáng lập tự cầm lái mảng AI
Điểm báo hiệu đây là canh bạc chiến lược chứ không phải một thử nghiệm nhỏ là việc Trương Nhất Minh trực tiếp giám sát dự án mô hình thế giới AI này. Ông không chỉ “xem báo cáo” mà đang tự tay điều phối nguồn lực giữa các đơn vị kinh doanh, dồn tài nguyên AI và năng lực tính toán của toàn tập đoàn cho nỗ lực này. Về bản chất, đây là một quyết định tái định vị ByteDance từ công ty sản phẩm giải trí sang công ty hạ tầng AI tạo sinh. Trương Nhất Minh AI không còn gắn với hình ảnh TikTok mà với tham vọng tham gia nhóm tinh hoa nghiên cứu mô hình thế giới đang bùng nổ, cùng các hướng tiếp cận thị giác do những cái tên như Fei-Fei Li và Yann LeCun theo đuổi. Khi CEO sáng lập xuống tay vào kiến trúc kỹ thuật, thông điệp gửi tới cả Meta lẫn Google là: ByteDance không muốn đi sau ở thế hệ AI tiếp theo.
Không gian ảo liên tục: khác gì so với AI tạo video hiện nay?
Khác với các hệ thống AI tạo video hiện tại, nơi người dùng nhập câu lệnh rồi chờ một clip vài giây xuất hiện, mô hình thế giới AI mà ByteDance theo đuổi nhằm xây dựng một không gian ảo liên tục có thể tiếp tục vận động và phản ứng với người sử dụng. Khi bạn đeo kính VR, bước tới, quay đầu, nói chuyện hay cử động tay, mô hình này sẽ ngay lập tức tạo phần tiếp theo của thế giới ảo phù hợp với hành động đó. Theo nguồn tin nội bộ, hệ thống hướng tới khả năng xuất hình khoảng 20 khung hình mỗi giây với độ trễ khoảng 0,05 giây. Nếu đạt trong điều kiện thực tế, trải nghiệm sẽ chuyển từ “xem video AI” sang “sống trong thế giới AI”: người dùng hành động và thế giới phản hồi gần như tức thì. Đây là bước nhảy định tính cho toàn bộ cuộc đua AI tạo video, nâng trần kỳ vọng thị trường từ nội dung tuyến tính lên tương tác thời gian thực.
ByteDance AI tạo sinh: ghép Seedance, đám mây và Pico thành hệ sinh thái
Một lý do khiến nước đi này nguy hiểm với đối thủ là ByteDance không xuất phát từ con số 0. Mô hình mới xây dựng trên Seedance, dòng mô hình tạo video điện ảnh đã trở thành biểu tượng thành công về AI của ByteDance và đang là nền tảng cho CapCut, Doubao cùng nhiều sản phẩm khác. Dù ByteDance vẫn bị đánh giá là chậm chân hơn một số đối thủ nội địa trong AI tạo sinh, Seedance giúp họ có nền tảng video mạnh để bước vào cuộc chơi mô hình thế giới AI. Hơn nữa, công ty sở hữu cả hạ tầng điện toán đám mây, mạng lưới nền tảng nội dung khổng lồ lẫn mảng phần cứng kính VR/XR Pico. Mô hình thế giới thời gian thực có thể trở thành “bánh đà” nối các tài sản này lại với nhau: AI tạo nội dung, đám mây xử lý nặng, Pico hiển thị, và TikTok cùng các nền tảng khác phân phối trải nghiệm. Khi đó, ByteDance AI tạo sinh không còn là vài tính năng lẻ, mà là một hệ sinh thái đóng trọn chuỗi giá trị.
Đối đầu Google, Meta và tương lai cuộc đua AI tạo thế giới
Việc ByteDance bước vào mô hình thế giới AI diễn ra đúng lúc video trở thành trung tâm trong nỗ lực mô phỏng môi trường vật lý cho các tác tử AI của cả ngành. Hệ thống này sẽ trực tiếp đối đầu với Genie của Google – mô hình dựng thế giới thời gian thực – và đặt ByteDance vào thế cạnh tranh với Meta, Alphabet về công nghệ world model, trong khi Apple là đối thủ quan trọng ở thiết bị điện toán không gian. Nếu mô hình mới thực sự giúp tạo không gian ảo liên tục, phản hồi theo giọng nói hoặc chuyển động của người đeo kính Pico với độ trễ khoảng 0,05 giây ở tốc độ 20 khung hình/giây, chiến trường có thể dịch chuyển khỏi cuộc tranh cãi “màn hình, chip ai đẹp hơn” sang câu hỏi “AI của ai tạo ra thế giới ảo hấp dẫn và rẻ hơn”. Ở góc độ người dùng phổ thông, điều này có nghĩa là livestream, phim ngắn, game và sau đó là robot, xe tự hành sẽ ngày càng vận hành trong các không gian do AI sinh ra. Nhưng cần nhớ: ByteDance chưa công bố sản phẩm, mọi mốc thời gian và thông số hiện vẫn ở mức nội bộ và có thể thay đổi.






