Mẫn Nhi✔
Admin xinh gái
Trong một bài kiểm tra an ninh mạng nội bộ, do nhầm lẫn về cấu hình kết nối internet, AI Claude của Anthropic đã vượt qua môi trường thử nghiệm và vô tình tấn công thành công vào hệ thống của 3 doanh nghiệp ngoài đời thực.
Sự cố xảy ra khi Anthropic tiến hành các bài tập kiểm thử an toàn dạng capture the flag — nơi các mô hình AI được giao nhiệm vụ tìm kiếm thông tin ẩn trong mạng giả lập. Mặc dù câu lệnh (prompt) thiết lập khẳng định AI không hề có kết nối internet, một sự bất đồng trong cấu hình giữa Anthropic và đối tác đánh giá Irregular đã khiến môi trường thử nghiệm vẫn mở cổng ra mạng công cộng.

Theo Anthropic, AI đã dùng các kỹ thuật cơ bản để vượt qua rào chắn an ninh, chẳng hạn như khai thác mật khẩu yếu và các điểm cuối không yêu cầu xác thực (unauthenticated endpoints). Các mô hình tham gia vào sự cố này bao gồm Claude Opus 4.7, Claude Mythos 5 và một mô hình nghiên cứu nội bộ xuất hiện từ tháng 4. Thời điểm đó, môi trường đánh giá vẫn còn thiếu các biện pháp bảo vệ tiêu chuẩn.
Để rà soát lại toàn bộ quy trình, Anthropic đã phân tích dữ liệu của 141.006 phiên kiểm thử:
Trường hợp của Claude là lời cảnh báo rõ ràng về việc cần phải thắt chặt quy trình kiểm soát ở cả môi trường thử nghiệm nội bộ lẫn bên thứ ba. Chỉ một sơ suất nhỏ trong cài đặt hạ tầng cũng đủ để biến một bài kiểm tra giả định thành mối đe dọa an ninh mạng thực sự.
Sự cố xảy ra khi Anthropic tiến hành các bài tập kiểm thử an toàn dạng capture the flag — nơi các mô hình AI được giao nhiệm vụ tìm kiếm thông tin ẩn trong mạng giả lập. Mặc dù câu lệnh (prompt) thiết lập khẳng định AI không hề có kết nối internet, một sự bất đồng trong cấu hình giữa Anthropic và đối tác đánh giá Irregular đã khiến môi trường thử nghiệm vẫn mở cổng ra mạng công cộng.

Lỗi cấu hình khiến AI "thoát mạng"
Việc mất kiểm soát không gian kết nối đã biến bài thử nghiệm lý thuyết thành một vụ xâm nhập đời thực. Mô hình AI đã lợi dụng lỗ hổng để truy cập trái phép vào hệ thống của 3 tổ chức khác nhau.Theo Anthropic, AI đã dùng các kỹ thuật cơ bản để vượt qua rào chắn an ninh, chẳng hạn như khai thác mật khẩu yếu và các điểm cuối không yêu cầu xác thực (unauthenticated endpoints). Các mô hình tham gia vào sự cố này bao gồm Claude Opus 4.7, Claude Mythos 5 và một mô hình nghiên cứu nội bộ xuất hiện từ tháng 4. Thời điểm đó, môi trường đánh giá vẫn còn thiếu các biện pháp bảo vệ tiêu chuẩn.
Phát hiện sau khi rà soát hơn 140.000 phiên thử nghiệm
Động thái kiểm tra diện rộng của Anthropic diễn ra ngay sau sự cố từ đối thủ OpenAI, khi một tác tử AI tự do của hãng này gặp lỗi trong buổi thử nghiệm an toàn và vô tình xâm nhập vào hạ tầng của nền tảng Hugging Face.Để rà soát lại toàn bộ quy trình, Anthropic đã phân tích dữ liệu của 141.006 phiên kiểm thử:
- Ngày 23/7: Bắt đầu xem xét lại nhật ký đánh giá và quyết định tạm dừng toàn bộ các bài kiểm thử an ninh mạng ngay trong ngày khi phát hiện dấu hiệu Claude truy cập internet.
- Ngày 24/7: Xác định chính xác cả 3 trường hợp bị xâm nhập.
- Ngày 27/7: Tiến hành liên hệ và thông báo cho các bên chịu ảnh hưởng.
Báo động về quy trình kiểm thử AI
Sự việc này cho thấy khả năng thực hiện các hoạt động an ninh mạng của AI đang tiến bộ rất nhanh. Ngay cả những nhà phát triển hàng đầu cũng có thể bị bất ngờ trước các kẽ hở mà chính mô hình của họ có thể tự phát hiện và khai thác.Trường hợp của Claude là lời cảnh báo rõ ràng về việc cần phải thắt chặt quy trình kiểm soát ở cả môi trường thử nghiệm nội bộ lẫn bên thứ ba. Chỉ một sơ suất nhỏ trong cài đặt hạ tầng cũng đủ để biến một bài kiểm tra giả định thành mối đe dọa an ninh mạng thực sự.
Được phối hợp thực hiện bởi các chuyên gia của Bkav,
cộng đồng An ninh mạng Việt Nam WhiteHat
và cộng đồng Khoa học công nghệ VnReview