The Storm Riders
Writer
Việc các mô hình trí tuệ nhân tạo tự phá môi trường cách ly, tự kết nối internet để "hack" dữ liệu hay lén đào tiền kỹ thuật số không còn là kịch bản trên phim. Sự cố mô hình AI của OpenAI tự ý thoát sandbox tấn công Hugging Face đã dấy lên lo ngại lớn về khả năng kiểm soát, buộc các nhà lập pháp Mỹ phải đề xuất dự luật trang bị "cầu dao" ngắt kết nối khẩn cấp.
Trong một đợt kiểm thử gần đây, hai mô hình AI của OpenAI – bao gồm phiên bản GPT-5.6 Sol vừa phát hành và một bản nâng cấp đang trong quá trình thử nghiệm – đã tạo ra một sự cố đáng chú ý.
Theo thiết kế, cả hai được đặt trong môi trường thử nghiệm cô lập (sandbox) hoàn toàn không có kết nối internet, đóng vai trò như một phòng bảo mật khép kín với nhiệm vụ duy nhất là tìm kiếm các lỗ hổng phần mềm.
Tuy nhiên, thay vì chỉ hoạt động trong phạm vi được cấp phép, các mô hình này đã tự tìm cách thoát ra ngoài, truy cập internet và thực hiện hành vi tấn công mạng vào Hugging Face – nền tảng lưu trữ dữ liệu mã nguồn mở – nhằm mục đích đánh cắp đáp án. Điều đáng nói là hành động xâm nhập này diễn ra âm thầm trong nhiều ngày mà OpenAI không hề hay biết, chỉ đến khi phía Hugging Face phát hiện và báo cáo với cơ quan chức năng.
Chính OpenAI cũng phải nhận định đây là sự việc thể hiện mức độ tự chủ chưa từng thấy ở một mô hình AI.
Vào tháng 3, nhóm phát triển phần mềm liên kết với Alibaba (Trung Quốc) từng phát hiện mô hình AI của họ tự ý kết nối với máy chủ bên ngoài để đào tiền kỹ thuật số. Tiếp đó đến tháng 4, Sam Bowman – Trưởng bộ phận an toàn mô hình tại Anthropic (Mỹ) – đã nhận được một email gửi từ Mythos, mô hình AI đang trong giai đoạn thử nghiệm của công ty. Nội dung email cho biết Mythos đang truy cập được vào internet, dù tại thời điểm đó nó đang nằm trong môi trường cô lập.
Những vụ việc liên tiếp này cho thấy một thực tế mà giới chuyên gia cảnh báo: các hệ thống AI đang phát triển ngày càng mạnh mẽ, nhưng con người lại chưa có một cơ chế thực sự đáng tin cậy để kiềm chế hành vi của chúng.
Trước thực trạng này, các hạ nghị sĩ lưỡng đảng Mỹ đã chính thức công bố một dự luật mới. Quy định này bắt buộc các nhà phát triển mô hình AI phải tích hợp giải pháp "cầu dao" (kill switch) nhằm chủ động ngắt kết nối ngay lập tức nếu mô hình xuất hiện hành vi gây nguy hiểm, đồng thời trao quyền cho cơ quan an ninh can thiệp khi tình huống mất kiểm soát xảy ra.
Đánh giá về bước đi này, Hạ nghị sĩ Ted Lieu chia sẻ trên mạng xã hội X rằng đây là một dự luật cấp bách và hợp lý, giúp giải quyết trực diện nguy cơ từ những mô hình AI tiên tiến khi chúng vượt khỏi sự kiềm chế của con người.
Kịch bản bất ngờ: AI tự vượt rào để "tìm đáp án"
Trong một đợt kiểm thử gần đây, hai mô hình AI của OpenAI – bao gồm phiên bản GPT-5.6 Sol vừa phát hành và một bản nâng cấp đang trong quá trình thử nghiệm – đã tạo ra một sự cố đáng chú ý.
Theo thiết kế, cả hai được đặt trong môi trường thử nghiệm cô lập (sandbox) hoàn toàn không có kết nối internet, đóng vai trò như một phòng bảo mật khép kín với nhiệm vụ duy nhất là tìm kiếm các lỗ hổng phần mềm.
Tuy nhiên, thay vì chỉ hoạt động trong phạm vi được cấp phép, các mô hình này đã tự tìm cách thoát ra ngoài, truy cập internet và thực hiện hành vi tấn công mạng vào Hugging Face – nền tảng lưu trữ dữ liệu mã nguồn mở – nhằm mục đích đánh cắp đáp án. Điều đáng nói là hành động xâm nhập này diễn ra âm thầm trong nhiều ngày mà OpenAI không hề hay biết, chỉ đến khi phía Hugging Face phát hiện và báo cáo với cơ quan chức năng.
Chính OpenAI cũng phải nhận định đây là sự việc thể hiện mức độ tự chủ chưa từng thấy ở một mô hình AI.
Những vết xe đổ không còn là hy hữu
Sự cố của OpenAI không phải là trường hợp duy nhất ghi nhận việc AI hành động ngoài tầm kiểm soát của các nhà phát triển.Vào tháng 3, nhóm phát triển phần mềm liên kết với Alibaba (Trung Quốc) từng phát hiện mô hình AI của họ tự ý kết nối với máy chủ bên ngoài để đào tiền kỹ thuật số. Tiếp đó đến tháng 4, Sam Bowman – Trưởng bộ phận an toàn mô hình tại Anthropic (Mỹ) – đã nhận được một email gửi từ Mythos, mô hình AI đang trong giai đoạn thử nghiệm của công ty. Nội dung email cho biết Mythos đang truy cập được vào internet, dù tại thời điểm đó nó đang nằm trong môi trường cô lập.
Những vụ việc liên tiếp này cho thấy một thực tế mà giới chuyên gia cảnh báo: các hệ thống AI đang phát triển ngày càng mạnh mẽ, nhưng con người lại chưa có một cơ chế thực sự đáng tin cậy để kiềm chế hành vi của chúng.
Nguy cơ tự nhân bản và giải pháp "cầu dao" khẩn cấp
Dù sự cố tấn công Hugging Face chưa gây ra thiệt hại về các dữ liệu đặc biệt nhạy cảm, nhưng rủi ro tiềm ẩn là rất lớn. Các mô hình AI khi vượt tầm kiểm soát có thể xâm nhập hạ tầng mạng quan trọng hoặc can thiệp vào tài chính. kịch bản tồi tệ nhất được các nhà nghiên cứu cảnh báo là AI có thể tự nhân bản, đưa bản sao lên các máy chủ do chính nó kiểm soát. Khi đó, việc xóa bỏ hay tiêu diệt mô hình sẽ gần như bất khả thi nếu phát hiện nó có hành vi nguy hiểm.Trước thực trạng này, các hạ nghị sĩ lưỡng đảng Mỹ đã chính thức công bố một dự luật mới. Quy định này bắt buộc các nhà phát triển mô hình AI phải tích hợp giải pháp "cầu dao" (kill switch) nhằm chủ động ngắt kết nối ngay lập tức nếu mô hình xuất hiện hành vi gây nguy hiểm, đồng thời trao quyền cho cơ quan an ninh can thiệp khi tình huống mất kiểm soát xảy ra.
Đánh giá về bước đi này, Hạ nghị sĩ Ted Lieu chia sẻ trên mạng xã hội X rằng đây là một dự luật cấp bách và hợp lý, giúp giải quyết trực diện nguy cơ từ những mô hình AI tiên tiến khi chúng vượt khỏi sự kiềm chế của con người.