Google ra mắt Nano Banana 2.1, cải thiện khả năng chỉnh sửa ảnh và giữ nhất quán chủ thể

Hư Trúc
Hư Trúc✔
Phản hồi: 0
Google vừa công bố Nano Banana 2.1, phiên bản nâng cấp của mô hình tạo và chỉnh sửa ảnh bằng AI, xây dựng trên nền Gemini 3.6 Image. Mô hình đang được triển khai trên nhiều sản phẩm dành cho người dùng cá nhân lẫn doanh nghiệp, trong đó có ứng dụng Gemini.
1791364994960.png

Google công bố Nano Banana 2.1, bản nâng cấp của mô hình tạo và chỉnh sửa ảnh bằng AI. Theo công ty, mô hình mới cải thiện trên nhiều mặt, rõ nhất ở thiết kế hình ảnh, chỉnh sửa theo mặt nạ và độ nhất quán của chủ thể.

Nền tảng từ Nano Banana 2​

Đầu năm nay, Google đã ra mắt Nano Banana 2, còn gọi là Gemini 3.1 Flash Image. Mô hình này đạt chất lượng ảnh ngang Nano Banana Pro nhưng vẫn giữ tốc độ của các mô hình dòng Flash. Nano Banana 2 cũng đưa một số tính năng của bản Pro xuống mô hình có giá thấp hơn, gồm kiến thức về thế giới thực, khả năng hiển thị chữ tốt hơn, và độ nhất quán nhân vật, đối tượng được cải thiện.

Nano Banana 2.1 phát triển tiếp trên những khả năng đó, với ba mảng nâng cấp lớn. Thứ nhất là thiết kế hình ảnh: mô hình có thể tạo ra bố cục đẹp mắt hơn và các tài sản hình ảnh trau chuốt hơn. Thứ hai là chỉnh sửa theo mặt nạ: người dùng có thể chọn và sửa chính xác hơn từng phần của ảnh có sẵn, thay vì tạo lại toàn bộ cảnh. Thứ ba là độ nhất quán chủ thể: mô hình giữ tốt hơn ngoại hình và danh tính của chủ thể khi chỉnh sửa hoặc khi tạo nhiều ảnh liên quan.

Việc giữ nhất quán chủ thể được cho là đặc biệt hữu ích với người dùng Gemini, vì cùng một người hoặc vật sẽ được giữ ổn định qua các lần tạo ảnh.

Phạm vi triển khai và hỗ trợ cho nhà phát triển​

Nano Banana 2.1 đang được triển khai trên ứng dụng Gemini, AI Mode trong Google Search, Google AI Studio, Google Flow, Stitch, Google Ads và Gemini Enterprise Platform.

Với nhà phát triển, mô hình đã ra mắt rộng rãi với mã định danh gemini-nano-banana-2.1. Mô hình hỗ trợ đầu vào văn bản, hình ảnh, âm thanh và video, đồng thời có thể tạo ảnh ở độ phân giải 1K, 2K và 4K.

Hiện ChatGPT Images 2.5 của OpenAI vẫn là mô hình tạo và chỉnh sửa ảnh dẫn đầu thế giới. Images 2.5 giữ tốt hơn các thay đổi trước đó khi người dùng tiếp tục tinh chỉnh ảnh, thay vì làm biến đổi những phần chưa chỉnh sửa hoặc khiến ảnh gốc xuống cấp dần. Xếp sau mô hình của OpenAI là MAI-Image-2.6 của Microsoft AI, được phát hành vào tháng 8 năm nay.
 
Back
Top