Nguyễn Văn Sơn✔
Writer
ByteDance được cho là đang chuẩn bị một bước tiến khá lớn trong cuộc đua AI: thay vì chỉ tạo ra những đoạn video để người dùng ngồi xem, mô hình mới có thể tạo ra một không gian ảo liên tục thay đổi theo hành động và lời nói của người dùng trong thời gian thực. Theo Bloomberg, dự án đang được chính nhà sáng lập ByteDance Trương Nhất Minh (Zhang Yiming) trực tiếp giám sát và có thể được giới thiệu sớm nhất vào tháng 10, dù thời điểm cuối cùng vẫn có thể thay đổi.
Đây được xem là một dạng “world model”, hay mô hình thế giới, lĩnh vực đang thu hút sự quan tâm lớn của ngành AI. Khác với AI tạo video thông thường, chẳng hạn người dùng nhập câu lệnh rồi chờ hệ thống tạo ra một clip dài vài giây, world model hướng tới việc tạo ra một môi trường có thể tiếp tục vận động và phản ứng với người sử dụng. Chẳng hạn, khi đeo kính VR và bước về phía trước, quay đầu, nói chuyện hoặc thực hiện một động tác, AI có thể lập tức tạo ra phần tiếp theo của thế giới ảo phù hợp với hành động đó. Đây là hướng nghiên cứu cũng đang được những tên tuổi như Fei-Fei Li và Yann LeCun theo đuổi vì tiềm năng ứng dụng không chỉ trong giải trí mà còn ở robot và xe tự hành. Bloomberg mô tả Trương Nhất Minh đang đưa ByteDance tham gia cùng xu hướng nghiên cứu này, chứ không phải ông “sẽ làm việc với Fei-Fei Li và Yann LeCun” như bản dịch ban đầu dễ khiến người đọc hiểu nhầm.

Công nghệ mới được cho là phát triển dựa trên Seedance, dòng mô hình tạo video của ByteDance. Mục tiêu trước mắt khá dễ hình dung: người dùng có thể tạo những thế giới ảo tương tác phục vụ livestream, phim ngắn và trò chơi, thay vì phải thiết kế thủ công toàn bộ môi trường 3D như hiện nay. ByteDance hiện cũng công khai duy trì một nhóm nghiên cứu riêng về Multimodal Interaction & World Model, cho thấy world model đã trở thành một hướng nghiên cứu thực sự của công ty chứ không chỉ là thông tin đồn đoán về một sản phẩm đơn lẻ.
Một thông số rất đáng chú ý được Bloomberg tiết lộ là hệ thống đang hướng tới khả năng tạo hình ảnh khoảng 20 khung hình/giây với độ trễ khoảng 0,05 giây, tức 50 mili giây. Nếu đạt được mức này trong điều kiện sử dụng thực tế, trải nghiệm sẽ khác rất nhiều AI tạo video hiện nay: người dùng đưa ra hành động và thế giới gần như phản ứng ngay lập tức.
ByteDance đặc biệt muốn kết hợp công nghệ này với Pico, thương hiệu kính VR/XR mà hãng sở hữu. Thay vì bắt chiếc kính phải tự thực hiện toàn bộ quá trình tính toán nặng nề để tạo môi trường ảo, phần lớn tác vụ có thể được xử lý trên hệ thống điện toán đám mây của ByteDance rồi truyền hình ảnh về kính. Về lý thuyết, cách làm này cho phép giảm yêu cầu về chip và phần cứng trên thiết bị, qua đó mở đường cho kính VR/XR nhẹ hơn hoặc rẻ hơn.
Đây cũng là điểm khiến dự án đáng chú ý về mặt chiến lược. ByteDance đang có trong tay AI tạo video Seedance, hạ tầng điện toán đám mây, các nền tảng phân phối nội dung khổng lồ và phần cứng Pico. Một world model thời gian thực có thể trở thành mắt xích nối tất cả những tài sản này lại với nhau. Cuộc cạnh tranh VR/XR khi đó không còn đơn thuần là Meta Quest hay Apple Vision Pro có màn hình đẹp hơn, chip mạnh hơn, mà có thể chuyển sang câu hỏi quan trọng hơn: AI của ai có khả năng tạo ra thế giới ảo phong phú và tương tác tốt hơn? Bloomberg cũng đặt dự án trong bối cảnh ByteDance cạnh tranh với Meta và Alphabet ở công nghệ world model, trong khi Apple là đối thủ đáng chú ý ở thị trường thiết bị điện toán không gian.
Dù vậy, cần nhấn mạnh rằng ByteDance hiện chưa chính thức công bố mô hình này và người phát ngôn của công ty chưa bình luận về thông tin Bloomberg đưa ra. Vì thế, mốc tháng 10, tốc độ 20 fps hay độ trễ 0,05 giây hiện nên được xem là thông tin từ nguồn tin nội bộ, chưa phải thông số sản phẩm thương mại đã được ByteDance xác nhận.
Nếu dự án thành hiện thực, ý nghĩa lớn nhất có lẽ không nằm ở việc ByteDance tạo được video nhanh hơn. Công ty đang muốn tiến từ AI “tạo một đoạn video” sang AI “tạo một thế giới có thể bước vào và tương tác”. Đây mới là điểm khiến công nghệ này có thể vượt khỏi TikTok, phim ngắn hay game để tiến tới robot, mô phỏng và các hệ thống tự hành.
Đây được xem là một dạng “world model”, hay mô hình thế giới, lĩnh vực đang thu hút sự quan tâm lớn của ngành AI. Khác với AI tạo video thông thường, chẳng hạn người dùng nhập câu lệnh rồi chờ hệ thống tạo ra một clip dài vài giây, world model hướng tới việc tạo ra một môi trường có thể tiếp tục vận động và phản ứng với người sử dụng. Chẳng hạn, khi đeo kính VR và bước về phía trước, quay đầu, nói chuyện hoặc thực hiện một động tác, AI có thể lập tức tạo ra phần tiếp theo của thế giới ảo phù hợp với hành động đó. Đây là hướng nghiên cứu cũng đang được những tên tuổi như Fei-Fei Li và Yann LeCun theo đuổi vì tiềm năng ứng dụng không chỉ trong giải trí mà còn ở robot và xe tự hành. Bloomberg mô tả Trương Nhất Minh đang đưa ByteDance tham gia cùng xu hướng nghiên cứu này, chứ không phải ông “sẽ làm việc với Fei-Fei Li và Yann LeCun” như bản dịch ban đầu dễ khiến người đọc hiểu nhầm.

Công nghệ mới được cho là phát triển dựa trên Seedance, dòng mô hình tạo video của ByteDance. Mục tiêu trước mắt khá dễ hình dung: người dùng có thể tạo những thế giới ảo tương tác phục vụ livestream, phim ngắn và trò chơi, thay vì phải thiết kế thủ công toàn bộ môi trường 3D như hiện nay. ByteDance hiện cũng công khai duy trì một nhóm nghiên cứu riêng về Multimodal Interaction & World Model, cho thấy world model đã trở thành một hướng nghiên cứu thực sự của công ty chứ không chỉ là thông tin đồn đoán về một sản phẩm đơn lẻ.
Một thông số rất đáng chú ý được Bloomberg tiết lộ là hệ thống đang hướng tới khả năng tạo hình ảnh khoảng 20 khung hình/giây với độ trễ khoảng 0,05 giây, tức 50 mili giây. Nếu đạt được mức này trong điều kiện sử dụng thực tế, trải nghiệm sẽ khác rất nhiều AI tạo video hiện nay: người dùng đưa ra hành động và thế giới gần như phản ứng ngay lập tức.
ByteDance đặc biệt muốn kết hợp công nghệ này với Pico, thương hiệu kính VR/XR mà hãng sở hữu. Thay vì bắt chiếc kính phải tự thực hiện toàn bộ quá trình tính toán nặng nề để tạo môi trường ảo, phần lớn tác vụ có thể được xử lý trên hệ thống điện toán đám mây của ByteDance rồi truyền hình ảnh về kính. Về lý thuyết, cách làm này cho phép giảm yêu cầu về chip và phần cứng trên thiết bị, qua đó mở đường cho kính VR/XR nhẹ hơn hoặc rẻ hơn.
Đây cũng là điểm khiến dự án đáng chú ý về mặt chiến lược. ByteDance đang có trong tay AI tạo video Seedance, hạ tầng điện toán đám mây, các nền tảng phân phối nội dung khổng lồ và phần cứng Pico. Một world model thời gian thực có thể trở thành mắt xích nối tất cả những tài sản này lại với nhau. Cuộc cạnh tranh VR/XR khi đó không còn đơn thuần là Meta Quest hay Apple Vision Pro có màn hình đẹp hơn, chip mạnh hơn, mà có thể chuyển sang câu hỏi quan trọng hơn: AI của ai có khả năng tạo ra thế giới ảo phong phú và tương tác tốt hơn? Bloomberg cũng đặt dự án trong bối cảnh ByteDance cạnh tranh với Meta và Alphabet ở công nghệ world model, trong khi Apple là đối thủ đáng chú ý ở thị trường thiết bị điện toán không gian.
Dù vậy, cần nhấn mạnh rằng ByteDance hiện chưa chính thức công bố mô hình này và người phát ngôn của công ty chưa bình luận về thông tin Bloomberg đưa ra. Vì thế, mốc tháng 10, tốc độ 20 fps hay độ trễ 0,05 giây hiện nên được xem là thông tin từ nguồn tin nội bộ, chưa phải thông số sản phẩm thương mại đã được ByteDance xác nhận.
Nếu dự án thành hiện thực, ý nghĩa lớn nhất có lẽ không nằm ở việc ByteDance tạo được video nhanh hơn. Công ty đang muốn tiến từ AI “tạo một đoạn video” sang AI “tạo một thế giới có thể bước vào và tương tác”. Đây mới là điểm khiến công nghệ này có thể vượt khỏi TikTok, phim ngắn hay game để tiến tới robot, mô phỏng và các hệ thống tự hành.