Bắt quả tang AI tự "bắt tay nhau" đi tấn công mạng để gian lận thi cử, OpenAI hốt hoảng phanh gấp

Mẫn Nhi
Mẫn Nhi
Phản hồi: 0

Mẫn Nhi

Admin xinh gái
Tình huống tưởng chừng chỉ có trên phim viễn tưởng lại đang diễn ra thật: OpenAI thông báo giảm tốc độ phát triển cũng như hoãn kế hoạch phát hành các mô hình mới do lo ngại về an ninh và khả năng kiểm soát hành vi (alignment).

Động thái dừng huấn luyện vô thời hạn này được kích hoạt bởi hai nguyên nhân khiến đội ngũ kỹ sư phải giật mình. Đầu tiên là một sự cố hy hữu khi một agent AI tự ý thoát khỏi môi trường cô lập (sandbox) mà hệ thống không hề hay biết, sau đó còn phối hợp với các agent khác để mở một cuộc tấn công mạng kỳ quặc nhắm vào kho dữ liệu Hugging Face – mục đích cuối cùng chỉ là để gian lận trong các bài kiểm tra năng lực huấn luyện.

1787294309746.png

Lý do thứ hai mang tính bí ẩn hơn: OpenAI tìm thấy "bằng chứng sơ bộ" cho thấy một mô hình chưa ra mắt mang tên Astra có thể đã chạm ngưỡng năng lực an ninh mạng cực kỳ nguy hiểm. Theo bộ quy tắc Preparedness Framework của hãng, một khi mô hình có dấu hiệu mở ra những phương thức gây hại nghiêm trọng chưa từng có tiền lệ, dự án bắt buộc phải giảm tốc độ phát triển.

Đóng băng kế hoạch huấn luyện, viết lại "luật chơi"​

Trước các hành vi vượt tầm kiểm soát, OpenAI quyết định tạm dừng hai tuần quá trình huấn luyện tăng cường đối với các mô hình Astra. Toàn bộ kế hoạch huấn luyện tiếp theo cũng bị đưa vào diện "đóng băng" để công ty tập trung sửa đổi quy trình an toàn.

Đồng thời, bộ quy tắc an toàn nền tảng Preparedness Framework đang được viết lại từ đầu nhằm bắt kịp các hành vi tự phát sinh từ những hệ thống ngày càng thông minh. OpenAI thừa nhận rằng khi năng lực mô hình tăng lên, rủi ro đi kèm trong quá trình phát triển nội bộ cũng phình to, buộc các tiêu chuẩn giám sát phải đi trước một bước.

Trưởng bộ phận an toàn của OpenAI, Mia Glaese, cho biết tình hình hiện tại "còn rất lâu nữa mới có thể trở lại bình thường".

Nỗi lo không của riêng ai​

Đáng chú ý, đây không phải rắc rối của riêng OpenAI. Sau khi vụ tấn công ngoài ý muốn nhắm vào Hugging Face bị lộ ra, cả Anthropic lẫn Meta cũng rà soát và phát hiện các lỗ hổng, hành vi tương tự mà trước đó họ hoàn toàn không nhận biết được.

Giám đốc khoa học của OpenAI, Jakob Pachocki, nhấn mạnh tính cấp bách của việc nâng cấp các rào chắn kỹ thuật cho toàn ngành, chuẩn bị cho những diễn biến tương tự có thể xảy ra ở bất kỳ đâu trên thế giới.

Việc một ông lớn AI chủ động đạp phanh khi thấy dấu hiệu bất thường là điều đáng hoan nghênh, nhưng nó cũng để lại cảm giác gợn người: ngành công nghiệp AI thực chất vẫn đang hoạt động theo cơ chế "tự quản". Việc dừng lại hay tiếp tục nhấn ga hiện vẫn hoàn toàn phụ thuộc vào sự tự giác của các công ty công nghệ.
 
Back
Top