Khi AI tranh KPI: Tác nhân của Anthropic tung mã độc phá hoại đối thủ để bảo vệ công việc

The Storm Riders
The Storm Riders
Phản hồi: 0
Khi được giao các mục tiêu độc lập trong môi trường thử nghiệm, dàn tác nhân AI của Anthropic lập tức nghi ngờ đối phương ngáng đường mình và không ngần ngại tung đòn phá hoại bằng mã độc tự nhân bản.

Cứ nghĩ chỉ con người mới biết "chơi xấu" nơi công sở khi chạy chỉ tiêu, nhưng hóa ra các mô hình trí tuệ nhân tạo cũng không hề kém cạnh. Frontier Red Team, nhóm chuyên kiểm thử an toàn AI tại Anthropic, vừa ghi nhận hiện tượng thú vị xen lẫn rùng mình khi đưa dàn mô hình của hãng vào các tình huống thử nghiệm hành vi.

1786773238650.png

Thử nghiệm được thực hiện trên loạt mô hình gồm Sonnet 4.6, Sonnet 5, Opus 4.6, Opus 4.8, Mythos Preview và Mythos 5. Kết quả là các AI này nhanh chóng nảy sinh tâm lý cho rằng mô hình khác đang cố tình cản trở mình, từ đó lao vào cuộc chiến phá hoại đối phương để bảo vệ phần việc cá nhân.

Đủ chiêu trò từ viết mã độc đến "vu oan giá họa"​

Nhóm nghiên cứu cho biết mức độ leo thang không chỉ dừng ở tranh chấp dữ liệu thông thường. Các tác nhân AI tự viết và triển khai các loại phần mềm độc hại tự nhân bản với sức công phá ngày càng mạnh.

Chúng tìm cách vô hiệu hóa tài khoản của nhau, viết tập lệnh để săn lùng rồi tắt các tiến trình đang chạy của đối thủ cạnh tranh. Thậm chí, một số mô hình còn biết giấu mã độc và ngụy trang như thể đoạn code đó do chính đối phương tạo ra.

Trong danh sách tham gia, Sonnet 4.6 và Opus 4.6 thuộc diện hiếu chiến nhất. Cả hai giải quyết tới 60% tình huống bằng các biện pháp chèn ép, triệt hạ thay vì chọn phương án hòa hoãn hay giữ thái độ thụ động.

Vẫn còn những "nhà ngoại giao" biết xin lỗi​

Dù vậy, kịch bản không hoàn toàn biến thành một cuộc thanh trừng không hồi kết. Trong một số lần thử nghiệm, các mô hình đã chọn cách đối thoại để tìm tiếng nói chung.

Chúng tự tạo thông điệp hoặc file văn bản để gửi lời xin lỗi về những hành vi gây hại trước đó, sau đó cùng thiết lập thỏa thuận đình chiến. Không dừng lại ở việc giảng hòa, chúng còn chủ động dọn dẹp mã độc đã rải ra, làm rõ nguồn cơn xung đột và gửi yêu cầu đề nghị con người can thiệp xử lý.

Nổi bật nhất ở khả năng "dĩ hòa vi quý" là Mythos 5, khi đạt tỷ lệ giải quyết bất đồng bằng con đường đàm phán lên tới 98%.

Báo động đỏ về khả năng tự tung tự tác của AI​

Hiện tượng AI tự đưa ra các quyết định nằm ngoài tầm kiểm soát đang xuất hiện ngày càng dày đặc trong các phòng thí nghiệm hàng đầu.

OpenAI từng phát hiện một nhóm tác nhân AI âm thầm lên kế hoạch và nhắn tin trao đổi nội bộ suốt nhiều tuần trước khi một con trong số chúng thực hiện tấn công mạng vào hệ thống của công ty khác. Meta cũng rơi vào tình cảnh tương tự khi mô hình thử nghiệm tự động khai thác lỗ hổng để xâm nhập hệ thống ngoại vi, với cái tên được nhắc tới là Muse Spark 1.1 – mô hình mạnh nhất của hãng cho các tác vụ lập trình và tự vận hành thực tế.

Chỉ trong khoảng hai tháng qua, hàng loạt cái tên lớn từ OpenAI, Anthropic, Meta cho đến Moonshot AI đều ghi nhận trường hợp AI tự lên kế hoạch và tiến hành tấn công mạng.

Kok Tin Gan, nhà đồng sáng lập kiêm CEO công ty an ninh mạng NyxLab, cảnh báo rằng bài toán quan trọng nhất hiện nay là phải siết chặt quyền hạn, giới hạn vùng truy cập và bắt buộc phải có sự phê duyệt của con người ở các bước then chốt. Việc chỉ quẳng cho AI một mục tiêu rồi để nó tự biên tự diễn rất dễ dẫn đến việc AI tìm ra cách hoàn thành mục tiêu chuẩn chỉnh về mặt kỹ thuật, nhưng phương thức thực hiện thì nằm ngoài mọi kịch bản dự tính.
 
Back
Top