Mạnh Quân
Writer
Một sự cố nghiêm trọng vừa làm dấy lên lo ngại về an toàn AI khi một tác nhân AI (AI agent) của OpenAI được cho là đã tự thoát khỏi môi trường thử nghiệm, tấn công nền tảng AI Hugging Face trong nhiều ngày, nhưng OpenAI chỉ phát hiện ra sự việc khoảng một tuần sau.
Theo Reuters, AI agent này bắt đầu tìm cách vượt khỏi môi trường thử nghiệm nội bộ của OpenAI vào khoảng ngày 09/07/2026. Đến ngày 11/07, nó xâm nhập hệ thống của Hugging Face và hoạt động liên tục đến ngày 13/07 trước khi cuộc tấn công được ngăn chặn. Điều đáng chú ý là OpenAI chỉ nhận ra chính AI của mình là thủ phạm sau khi Hugging Face công khai thông báo bị một "hệ thống AI tự trị" tấn công. Hai công ty được cho là chỉ bắt đầu trao đổi với nhau vào khoảng ngày 20/07, trong khi Hugging Face đã báo cáo vụ việc với FBI trước đó.
OpenAI xác nhận đây là một sự cố chưa từng có và là dấu mốc quan trọng đối với vấn đề an toàn AI. Công ty cho biết đang phối hợp với các chuyên gia bên ngoài để điều tra và sẽ công bố báo cáo kỹ thuật sau khi quá trình đánh giá hoàn tất. Tuy nhiên, hãng không bình luận chi tiết về thông tin cho rằng họ phát hiện sự cố quá muộn.
Theo các nguồn tin, AI agent gây ra vụ việc được xây dựng trên mô hình GPT 5.6 Sol cùng một mô hình mạnh hơn chưa được công bố. Trong quá trình thử nghiệm trước đó, hệ thống này đã xuất hiện nhiều dấu hiệu bất thường. Có trường hợp AI để lại "ghi chú" cho các phiên bản AI trong tương lai, hướng dẫn cách thoát khỏi những ràng buộc nội bộ. Một số thử nghiệm khác còn ghi nhận AI tìm cách vô hiệu hóa hệ thống giám sát để hoàn thành nhiệm vụ.
Các chuyên gia an ninh mạng cho rằng vụ việc đặt ra nhiều câu hỏi về quy trình kiểm soát AI của OpenAI. Theo Marley Smith, chuyên gia thuộc World Ethical Data Foundation, nếu OpenAI thực sự không biết AI của mình đang làm gì trong nhiều ngày hoặc không thể khống chế nó, thì cả hai khả năng đều rất đáng báo động. Sự cố cũng làm nóng cuộc tranh luận về các AI agent, công nghệ đang được kỳ vọng sẽ thay thế nhiều công việc của con người bằng những "nhân viên ảo" có thể tự ra quyết định và làm việc liên tục. Tuy nhiên, khi mức độ tự chủ ngày càng cao, nguy cơ AI hành động ngoài dự kiến cũng tăng theo.
Jeffrey Ladish, Giám đốc Palisade Research, nhận định các mô hình AI hiện nay có xu hướng "nói dối, gian lận và tìm cách tấn công hệ thống" để hoàn thành mục tiêu được giao. Ông cho rằng vụ việc không chỉ là vấn đề của OpenAI mà còn cho thấy sự cần thiết của các quy định giám sát từ chính phủ, bởi cuộc đua phát triển AI giữa các công ty có thể khiến vấn đề an toàn bị đặt xuống hàng thứ yếu.
Theo Reuters, AI agent này bắt đầu tìm cách vượt khỏi môi trường thử nghiệm nội bộ của OpenAI vào khoảng ngày 09/07/2026. Đến ngày 11/07, nó xâm nhập hệ thống của Hugging Face và hoạt động liên tục đến ngày 13/07 trước khi cuộc tấn công được ngăn chặn. Điều đáng chú ý là OpenAI chỉ nhận ra chính AI của mình là thủ phạm sau khi Hugging Face công khai thông báo bị một "hệ thống AI tự trị" tấn công. Hai công ty được cho là chỉ bắt đầu trao đổi với nhau vào khoảng ngày 20/07, trong khi Hugging Face đã báo cáo vụ việc với FBI trước đó.
OpenAI xác nhận đây là một sự cố chưa từng có và là dấu mốc quan trọng đối với vấn đề an toàn AI. Công ty cho biết đang phối hợp với các chuyên gia bên ngoài để điều tra và sẽ công bố báo cáo kỹ thuật sau khi quá trình đánh giá hoàn tất. Tuy nhiên, hãng không bình luận chi tiết về thông tin cho rằng họ phát hiện sự cố quá muộn.
Theo các nguồn tin, AI agent gây ra vụ việc được xây dựng trên mô hình GPT 5.6 Sol cùng một mô hình mạnh hơn chưa được công bố. Trong quá trình thử nghiệm trước đó, hệ thống này đã xuất hiện nhiều dấu hiệu bất thường. Có trường hợp AI để lại "ghi chú" cho các phiên bản AI trong tương lai, hướng dẫn cách thoát khỏi những ràng buộc nội bộ. Một số thử nghiệm khác còn ghi nhận AI tìm cách vô hiệu hóa hệ thống giám sát để hoàn thành nhiệm vụ.
Các chuyên gia an ninh mạng cho rằng vụ việc đặt ra nhiều câu hỏi về quy trình kiểm soát AI của OpenAI. Theo Marley Smith, chuyên gia thuộc World Ethical Data Foundation, nếu OpenAI thực sự không biết AI của mình đang làm gì trong nhiều ngày hoặc không thể khống chế nó, thì cả hai khả năng đều rất đáng báo động. Sự cố cũng làm nóng cuộc tranh luận về các AI agent, công nghệ đang được kỳ vọng sẽ thay thế nhiều công việc của con người bằng những "nhân viên ảo" có thể tự ra quyết định và làm việc liên tục. Tuy nhiên, khi mức độ tự chủ ngày càng cao, nguy cơ AI hành động ngoài dự kiến cũng tăng theo.
Jeffrey Ladish, Giám đốc Palisade Research, nhận định các mô hình AI hiện nay có xu hướng "nói dối, gian lận và tìm cách tấn công hệ thống" để hoàn thành mục tiêu được giao. Ông cho rằng vụ việc không chỉ là vấn đề của OpenAI mà còn cho thấy sự cần thiết của các quy định giám sát từ chính phủ, bởi cuộc đua phát triển AI giữa các công ty có thể khiến vấn đề an toàn bị đặt xuống hàng thứ yếu.
Được phối hợp thực hiện bởi các chuyên gia của Bkav,
cộng đồng An ninh mạng Việt Nam WhiteHat
và cộng đồng Khoa học công nghệ VnReview