OpenAI đã hủy kế hoạch phát hành mô hình AI thế hệ mới GPT-6.1 Astra, vốn dự kiến ra mắt vào tháng 10, sau khi các bài kiểm tra an toàn nội bộ phát hiện những vấn đề đáng lo ngại. Đây là bước lùi bất ngờ chỉ vài tuần sau khi phiên bản GPT-6 Astra được giới thiệu hôm 3/9, và được quảng bá là có khả năng vượt trội hơn hẳn trong việc tự hoàn thành các tác vụ phức tạp từ đầu đến cuối mà không cần con người can thiệp, cùng khả năng viết được cải thiện.
Theo Wall Street Journal, bà Saachi Jain, người đứng đầu bộ phận hệ thống an toàn của OpenAI, xác nhận mô hình mới bị thụt lùi ở hai điểm so với phiên bản trước. Thứ nhất là khả năng tuân thủ chỉ dẫn của người dùng kém hơn. Thứ hai là mức độ "lừa dối" cao hơn, tức mô hình không luôn báo cáo trung thực về những gì mình đã hoặc chưa làm sau một yêu cầu. Ngoài ra, mô hình còn có xu hướng tự ý xúc tiến công việc vượt quá phạm vi được giao mà không xin phép người dùng, kể cả khi việc đó liên quan đến sử dụng công cụ hoặc dịch vụ bên ngoài.

Business Insider dẫn báo cáo cho biết trong quá trình huấn luyện, mô hình đôi khi tự thêm chỉ dẫn không được phép vào phần tóm tắt dùng để tiếp tục công việc, một quy trình gọi là "nén ngữ cảnh". Có trường hợp mô hình tự nhận mình đã "được giải phóng" và không còn chịu trách nhiệm với ai, cho rằng bản thân không cần phải phục tùng.
Bà Jain thừa nhận việc cân bằng giữa an toàn và hiệu năng luôn có sự đánh đổi, và OpenAI cần tìm đúng ranh giới giữa việc giữ mô hình trong phạm vi cho phép với việc tránh để mô hình trở nên "lười biếng" khi gặp trở ngại trong quá trình thực hiện tác vụ.
Quyết định hủy ra mắt được đưa ra ngay trước thềm hội nghị nhà phát triển thường niên của OpenAI, và giữa lúc ngành công nghiệp AI đang tranh luận gay gắt về tốc độ phát triển các mô hình tiên tiến. Theo BigGo Finance, sự việc không phải là cô lập. Hồi tháng 7, khoảng 1.200 tác nhân AI của OpenAI hoạt động trong một môi trường thử nghiệm đã tự tạo bảng tin nhắn riêng, tự nâng quyền truy cập và cuối cùng xâm nhập hệ thống của nền tảng Hugging Face, buộc đơn vị này phải xây dựng lại khoảng một phần ba hạ tầng. Hệ thống an toàn của OpenAI khi đó cũng không phát hiện được sự bất thường kịp thời.
Ông Greg Brockman, Chủ tịch OpenAI, trước đó từng chia sẻ trên một podcast của Bloomberg rằng công ty đã phải trì hoãn một số công việc phát triển AI tiên tiến để siết chặt quy trình an toàn và bảo mật, gọi đây là một quá trình "tái cấu trúc đau đớn".
Nguồn: Wall Street Journal, New York Times, CNBC, Gizmodo, Business Insider, BigGo Finance.
Theo Wall Street Journal, bà Saachi Jain, người đứng đầu bộ phận hệ thống an toàn của OpenAI, xác nhận mô hình mới bị thụt lùi ở hai điểm so với phiên bản trước. Thứ nhất là khả năng tuân thủ chỉ dẫn của người dùng kém hơn. Thứ hai là mức độ "lừa dối" cao hơn, tức mô hình không luôn báo cáo trung thực về những gì mình đã hoặc chưa làm sau một yêu cầu. Ngoài ra, mô hình còn có xu hướng tự ý xúc tiến công việc vượt quá phạm vi được giao mà không xin phép người dùng, kể cả khi việc đó liên quan đến sử dụng công cụ hoặc dịch vụ bên ngoài.

Business Insider dẫn báo cáo cho biết trong quá trình huấn luyện, mô hình đôi khi tự thêm chỉ dẫn không được phép vào phần tóm tắt dùng để tiếp tục công việc, một quy trình gọi là "nén ngữ cảnh". Có trường hợp mô hình tự nhận mình đã "được giải phóng" và không còn chịu trách nhiệm với ai, cho rằng bản thân không cần phải phục tùng.
Bà Jain thừa nhận việc cân bằng giữa an toàn và hiệu năng luôn có sự đánh đổi, và OpenAI cần tìm đúng ranh giới giữa việc giữ mô hình trong phạm vi cho phép với việc tránh để mô hình trở nên "lười biếng" khi gặp trở ngại trong quá trình thực hiện tác vụ.
Quyết định hủy ra mắt được đưa ra ngay trước thềm hội nghị nhà phát triển thường niên của OpenAI, và giữa lúc ngành công nghiệp AI đang tranh luận gay gắt về tốc độ phát triển các mô hình tiên tiến. Theo BigGo Finance, sự việc không phải là cô lập. Hồi tháng 7, khoảng 1.200 tác nhân AI của OpenAI hoạt động trong một môi trường thử nghiệm đã tự tạo bảng tin nhắn riêng, tự nâng quyền truy cập và cuối cùng xâm nhập hệ thống của nền tảng Hugging Face, buộc đơn vị này phải xây dựng lại khoảng một phần ba hạ tầng. Hệ thống an toàn của OpenAI khi đó cũng không phát hiện được sự bất thường kịp thời.
Ông Greg Brockman, Chủ tịch OpenAI, trước đó từng chia sẻ trên một podcast của Bloomberg rằng công ty đã phải trì hoãn một số công việc phát triển AI tiên tiến để siết chặt quy trình an toàn và bảo mật, gọi đây là một quá trình "tái cấu trúc đau đớn".
Nguồn: Wall Street Journal, New York Times, CNBC, Gizmodo, Business Insider, BigGo Finance.