Con voi còi✔
Writer
DeepSeek vừa công bố DeepSeek-V4-Flash-Vision-Exp, mô hình AI đa phương thức mới có khả năng tiếp nhận đồng thời văn bản và hình ảnh. Nếu các phiên bản trước chủ yếu đọc, viết, lập trình và suy luận từ văn bản, phiên bản mới có thể trực tiếp “nhìn” ảnh để hiểu nội dung bên trong.
Người dùng có thể đưa cho AI ảnh chụp màn hình, tài liệu, bảng biểu, giao diện phần mềm, hình ảnh sản phẩm hoặc thiết bị rồi đặt câu hỏi. Chẳng hạn, thay vì phải mô tả một lỗi đang xuất hiện trên máy tính, người dùng chỉ cần gửi ảnh màn hình để DeepSeek đọc thông báo lỗi, phân tích nguyên nhân và đề xuất cách xử lý. Trong công việc văn phòng, AI có thể đọc bảng số liệu hoặc trang tài liệu từ hình ảnh để tổng hợp thông tin và hỗ trợ lập báo cáo.

Điểm đáng chú ý của DeepSeek-V4-Flash-Vision-Exp không nằm ở khả năng tạo ảnh. Mô hình này tập trung vào hiểu hình ảnh và sử dụng thông tin nhìn thấy để thực hiện nhiệm vụ, đặc biệt trong các hệ thống AI Agent. Một Agent lập trình, ví dụ, có thể quan sát ảnh giao diện, phát hiện vị trí hiển thị sai, kiểm tra mã nguồn, sửa chương trình rồi tiếp tục đánh giá kết quả.
Hiện mô hình được cung cấp dưới dạng thử nghiệm qua API với tên deepseek-v4-flash-vision-exp. Nhà phát triển có thể gửi hình ảnh bằng URL, Base64 hoặc tải lên trước thông qua Files API rồi sử dụng file_id để gọi lại nhiều lần. Cách này phù hợp với những hệ thống phải thường xuyên làm việc với cùng một lượng lớn ảnh và tài liệu.
Công bố mới đáng chú ý vì nó cho thấy DeepSeek đang tiến từ một AI chủ yếu đọc và suy luận sang AI có thể nhìn, hiểu, suy luận rồi hành động. Đây là năng lực quan trọng để xây dựng thế hệ AI Agent có thể làm việc trực tiếp với tài liệu, phần mềm, hình ảnh và các nguồn thông tin trong thế giới thực, thay vì phụ thuộc hoàn toàn vào những gì con người nhập bằng văn bản.
Người dùng có thể đưa cho AI ảnh chụp màn hình, tài liệu, bảng biểu, giao diện phần mềm, hình ảnh sản phẩm hoặc thiết bị rồi đặt câu hỏi. Chẳng hạn, thay vì phải mô tả một lỗi đang xuất hiện trên máy tính, người dùng chỉ cần gửi ảnh màn hình để DeepSeek đọc thông báo lỗi, phân tích nguyên nhân và đề xuất cách xử lý. Trong công việc văn phòng, AI có thể đọc bảng số liệu hoặc trang tài liệu từ hình ảnh để tổng hợp thông tin và hỗ trợ lập báo cáo.

Điểm đáng chú ý của DeepSeek-V4-Flash-Vision-Exp không nằm ở khả năng tạo ảnh. Mô hình này tập trung vào hiểu hình ảnh và sử dụng thông tin nhìn thấy để thực hiện nhiệm vụ, đặc biệt trong các hệ thống AI Agent. Một Agent lập trình, ví dụ, có thể quan sát ảnh giao diện, phát hiện vị trí hiển thị sai, kiểm tra mã nguồn, sửa chương trình rồi tiếp tục đánh giá kết quả.
Hiện mô hình được cung cấp dưới dạng thử nghiệm qua API với tên deepseek-v4-flash-vision-exp. Nhà phát triển có thể gửi hình ảnh bằng URL, Base64 hoặc tải lên trước thông qua Files API rồi sử dụng file_id để gọi lại nhiều lần. Cách này phù hợp với những hệ thống phải thường xuyên làm việc với cùng một lượng lớn ảnh và tài liệu.
Công bố mới đáng chú ý vì nó cho thấy DeepSeek đang tiến từ một AI chủ yếu đọc và suy luận sang AI có thể nhìn, hiểu, suy luận rồi hành động. Đây là năng lực quan trọng để xây dựng thế hệ AI Agent có thể làm việc trực tiếp với tài liệu, phần mềm, hình ảnh và các nguồn thông tin trong thế giới thực, thay vì phụ thuộc hoàn toàn vào những gì con người nhập bằng văn bản.