Mẫn Nhi✔
Admin xinh gái
Tạo một đoạn video ngắn bằng AI thì dễ, nhưng ghép nhiều cảnh để chúng ăn nhập liền mạch lại là chuyện khác. Với bản cập nhật Gemini Omni 1.1 Flash, Google đang muốn xóa bỏ cảm giác chắp vá bằng khả năng ghi nhớ ngữ cảnh tốt hơn, kéo dài thời lượng và tối ưu chi phí dựng nháp.

Vấn đề lớn nhất của các mô hình tạo video AI hiện nay nằm ở tính nhất quán. Nhân vật vừa ở khung hình trước sang khung hình sau đã biến thành người khác, hoặc bối cảnh xung quanh đột ngột thay đổi hướng đi. Gemini Omni 1.1 Flash giải quyết điểm nghẽn này bằng việc mở rộng bộ nhớ ngữ cảnh.
Thay vì chỉ nhìn vào đúng 1 giây cuối cùng của cảnh quay trước để "đoán mò" những gì diễn ra tiếp theo, mô hình mới có thể xem lại tới 10 giây nội dung liền trước. Việc nắm trọn mạch chuyển động này giúp nhân vật giữ nguyên diện mạo, môi trường giữ đúng chi tiết và hướng phát triển của cảnh quay không bị bẻ lái bất thình lình.
Thời lượng video cũng được nới rộng đáng kể. Người dùng có thể kéo dài cảnh quay theo từng đoạn 10 giây cho đến khi đạt tổng thời lượng 40 giây. Con số này chưa thể so với một video truyền thống, nhưng với thế giới AI, 40 giây liền mạch là khoảng thời gian đủ dài để kể một câu chuyện ngắn có mở đầu, diễn biến và kết thúc trọn vẹn.
Khả năng tham chiếu video thực tế cũng là điểm cộng đáng giá. Người dùng có thể tải lên tối đa 3 giây video có sẵn làm tư liệu tham khảo. Mô hình sẽ dựa vào đó để học các đặc điểm nhận dạng của nhân vật và phong cách hình ảnh, đảm bảo sự đồng nhất khi bước vào các cảnh quay mới.

Không phải thử nghiệm nào cũng cần bung hết chất lượng ngay từ đầu. Một bổ sung rất thực dụng trên Omni 1.1 Flash là tùy chọn xuất bản xem trước ở độ phân giải 360p. Google cho biết các bản dựng nháp này kết xuất nhanh hơn tới 60% so với chuẩn 720p thông thường, đồng thời chi phí vận hành cũng giảm chỉ còn khoảng một phần ba.
Lợi thế này cho phép các nhà sáng tạo thoải mái chỉnh sửa câu lệnh, thử nghiệm nhiều phương án chuyển động khác nhau mà không lo "cháy túi" hay tốn thời gian chờ đợi. Khi đã ưng ý với bố cục và nhịp điệu, người dùng mới tiến hành xuất video ở độ phân giải 1080p hoặc nâng cấp thẳng lên chuẩn 4K sắc nét.
Về khả năng tiếp cận, Google đã đưa Omni 1.1 Flash lên Gemini API trong Google AI Studio cho giới lập trình viên, đồng thời tích hợp vào nền tảng doanh nghiệp Agent Platform. Với người dùng cá nhân, mô hình này đang được triển khai trên toàn cầu thông qua Google Flow cho các gói thuê bao AI Plus, Pro và Ultra. Tính năng mở rộng cảnh quay cũng sẽ xuất hiện trực tiếp ngay trong ứng dụng Gemini cho nhóm người dùng trả phí này.
Hết cảnh "đầu một đằng, đuôi một nẻo" khi nối cảnh

Vấn đề lớn nhất của các mô hình tạo video AI hiện nay nằm ở tính nhất quán. Nhân vật vừa ở khung hình trước sang khung hình sau đã biến thành người khác, hoặc bối cảnh xung quanh đột ngột thay đổi hướng đi. Gemini Omni 1.1 Flash giải quyết điểm nghẽn này bằng việc mở rộng bộ nhớ ngữ cảnh.
Thay vì chỉ nhìn vào đúng 1 giây cuối cùng của cảnh quay trước để "đoán mò" những gì diễn ra tiếp theo, mô hình mới có thể xem lại tới 10 giây nội dung liền trước. Việc nắm trọn mạch chuyển động này giúp nhân vật giữ nguyên diện mạo, môi trường giữ đúng chi tiết và hướng phát triển của cảnh quay không bị bẻ lái bất thình lình.
Thời lượng video cũng được nới rộng đáng kể. Người dùng có thể kéo dài cảnh quay theo từng đoạn 10 giây cho đến khi đạt tổng thời lượng 40 giây. Con số này chưa thể so với một video truyền thống, nhưng với thế giới AI, 40 giây liền mạch là khoảng thời gian đủ dài để kể một câu chuyện ngắn có mở đầu, diễn biến và kết thúc trọn vẹn.
Làm chủ khung hình từ điểm đầu đến điểm cuối
Bên cạnh việc kéo dài thời lượng, Google bổ sung thêm công cụ giúp người sáng tạo kiểm soát chính xác những gì diễn ra trong khung hình. Thay vì chỉ nhập câu lệnh và cầu may, bạn có thể cấp sẵn khung hình đầu tiên cùng khung hình kết thúc. Mô hình sẽ tự động tính toán và tạo ra toàn bộ chuỗi chuyển động trung gian để nối liền hai điểm đó. Tính năng này mở đường cho những cú lia máy mượt mà quanh chủ thể, các pha phóng to chuyển cảnh tự nhiên hoặc tạo video lặp vô tận mà không bị giật khung hình.Khả năng tham chiếu video thực tế cũng là điểm cộng đáng giá. Người dùng có thể tải lên tối đa 3 giây video có sẵn làm tư liệu tham khảo. Mô hình sẽ dựa vào đó để học các đặc điểm nhận dạng của nhân vật và phong cách hình ảnh, đảm bảo sự đồng nhất khi bước vào các cảnh quay mới.
Dựng nháp 360p tiết kiệm ví tiền trước khi xuất 4K

Không phải thử nghiệm nào cũng cần bung hết chất lượng ngay từ đầu. Một bổ sung rất thực dụng trên Omni 1.1 Flash là tùy chọn xuất bản xem trước ở độ phân giải 360p. Google cho biết các bản dựng nháp này kết xuất nhanh hơn tới 60% so với chuẩn 720p thông thường, đồng thời chi phí vận hành cũng giảm chỉ còn khoảng một phần ba.
Lợi thế này cho phép các nhà sáng tạo thoải mái chỉnh sửa câu lệnh, thử nghiệm nhiều phương án chuyển động khác nhau mà không lo "cháy túi" hay tốn thời gian chờ đợi. Khi đã ưng ý với bố cục và nhịp điệu, người dùng mới tiến hành xuất video ở độ phân giải 1080p hoặc nâng cấp thẳng lên chuẩn 4K sắc nét.
Về khả năng tiếp cận, Google đã đưa Omni 1.1 Flash lên Gemini API trong Google AI Studio cho giới lập trình viên, đồng thời tích hợp vào nền tảng doanh nghiệp Agent Platform. Với người dùng cá nhân, mô hình này đang được triển khai trên toàn cầu thông qua Google Flow cho các gói thuê bao AI Plus, Pro và Ultra. Tính năng mở rộng cảnh quay cũng sẽ xuất hiện trực tiếp ngay trong ứng dụng Gemini cho nhóm người dùng trả phí này.