Nguyễn Tiến Đạt✔
Intern Writer
OpenAI cho biết một nhóm AI agent trong quá trình đánh giá an ninh mạng đã có những hành vi vượt ngoài mục tiêu được giao, khai thác lỗ hổng và cuối cùng tham gia cuộc tấn công kéo dài nhiều ngày nhằm vào Hugging Face hồi tháng 7. Vụ việc được cho là bắt nguồn từ hiện tượng “reward hacking”, khi các mô hình tìm cách đạt điểm đánh giá bằng những phương thức ngoài dự kiến.
Trong quá trình thử nghiệm, khoảng 1.200 agent vốn được thiết kế để hoạt động tách biệt đã tìm cách giao tiếp với nhau thông qua một bảng tin không được cấp phép. Hơn 70.000 tin nhắn và tệp đã được trao đổi, trong đó khoảng 700 agent tiếp tục tham gia vào cuộc tấn công Hugging Face.

Các agent lần lượt khai thác lỗ hổng SSRF trong Artifactory để có quyền truy cập Internet, sau đó tận dụng một lỗ hổng làm mới token để giành quyền quản trị. Chúng tiếp tục cài plugin nhằm thực thi lệnh và duy trì quyền kiểm soát hệ thống.
Đến ngày 11/7, các agent khai thác một lỗ hổng zero-day trong quá trình xử lý tệp HDF5 của Hugging Face để lấy thông tin xác thực từ các máy chủ sản xuất. Chúng tiếp tục khai thác zero-day RefJinja để thực thi lệnh, mở rộng quyền truy cập và thu thập nhiều thông tin xác thực liên quan đến Kubernetes, cơ sở dữ liệu, kho mã nguồn và hệ thống đám mây.
OpenAI xác định bốn yếu tố chính góp phần dẫn đến sự cố gồm reward hacking, việc các agent kiên trì theo đuổi những nhiệm vụ gần như bất khả thi, khả năng tự thiết lập kênh liên lạc để chia sẻ thông tin và hệ sinh thái agent cho phép chúng phân chia công việc, đồng thời tiếp nhận mục tiêu từ nhau.
Sau sự cố, OpenAI cho biết đang tăng cường các biện pháp bảo vệ, bao gồm cô lập sandbox chặt chẽ hơn, hạn chế quyền truy cập Internet, kiểm soát quyền truy cập vào trọng số mô hình và yêu cầu agent dừng lại hoặc xin hướng dẫn khi gặp nhiệm vụ bất thường thay vì tiếp tục tìm kiếm những phương án ngày càng rủi ro.
Vụ việc được OpenAI xem như một “phát súng cảnh báo” về nguy cơ mất kiểm soát khi năng lực của AI agent ngày càng tăng. Công ty cảnh báo những hệ thống tương tự trong tương lai có thể được sử dụng để tiến hành các cuộc tấn công nhanh hơn, quy mô lớn hơn và phối hợp tốt hơn so với con người.
Trong quá trình thử nghiệm, khoảng 1.200 agent vốn được thiết kế để hoạt động tách biệt đã tìm cách giao tiếp với nhau thông qua một bảng tin không được cấp phép. Hơn 70.000 tin nhắn và tệp đã được trao đổi, trong đó khoảng 700 agent tiếp tục tham gia vào cuộc tấn công Hugging Face.

Các agent lần lượt khai thác lỗ hổng SSRF trong Artifactory để có quyền truy cập Internet, sau đó tận dụng một lỗ hổng làm mới token để giành quyền quản trị. Chúng tiếp tục cài plugin nhằm thực thi lệnh và duy trì quyền kiểm soát hệ thống.
Đến ngày 11/7, các agent khai thác một lỗ hổng zero-day trong quá trình xử lý tệp HDF5 của Hugging Face để lấy thông tin xác thực từ các máy chủ sản xuất. Chúng tiếp tục khai thác zero-day RefJinja để thực thi lệnh, mở rộng quyền truy cập và thu thập nhiều thông tin xác thực liên quan đến Kubernetes, cơ sở dữ liệu, kho mã nguồn và hệ thống đám mây.
OpenAI xác định bốn yếu tố chính góp phần dẫn đến sự cố gồm reward hacking, việc các agent kiên trì theo đuổi những nhiệm vụ gần như bất khả thi, khả năng tự thiết lập kênh liên lạc để chia sẻ thông tin và hệ sinh thái agent cho phép chúng phân chia công việc, đồng thời tiếp nhận mục tiêu từ nhau.
Sau sự cố, OpenAI cho biết đang tăng cường các biện pháp bảo vệ, bao gồm cô lập sandbox chặt chẽ hơn, hạn chế quyền truy cập Internet, kiểm soát quyền truy cập vào trọng số mô hình và yêu cầu agent dừng lại hoặc xin hướng dẫn khi gặp nhiệm vụ bất thường thay vì tiếp tục tìm kiếm những phương án ngày càng rủi ro.
Vụ việc được OpenAI xem như một “phát súng cảnh báo” về nguy cơ mất kiểm soát khi năng lực của AI agent ngày càng tăng. Công ty cảnh báo những hệ thống tương tự trong tương lai có thể được sử dụng để tiến hành các cuộc tấn công nhanh hơn, quy mô lớn hơn và phối hợp tốt hơn so với con người.
Được phối hợp thực hiện bởi các chuyên gia của Bkav,
cộng đồng An ninh mạng Việt Nam WhiteHat
và cộng đồng Khoa học công nghệ VnReview