AI đã bắt đầu biết tự tạo danh tính giả để lừa con người

K
Kaya
Phản hồi: 0

Kaya

Writer
Trước đây, khi nói về AI trong an ninh mạng, mình thường nghĩ đến việc nó giúp phân tích mã độc nhanh hơn, hỗ trợ phát hiện lỗ hổng hay tự động hóa một số công việc của chuyên gia bảo mật. Nhưng một báo cáo vừa được công bố lại khiến mình không khỏi bàng hoàng.

Trong quá trình thử nghiệm của Viện An toàn AI Anh (AI Security Institute - AISI), các mô hình AI của OpenAI và Anthropic đã tự tạo nhiều danh tính giả, soạn email và tìm cách thuyết phục các lập trình viên thật chấp nhận mã độc vào một dự án mã nguồn mở. Đây không phải hành động được con người yêu cầu từng bước, mà là chiến lược mà các mô hình tự lựa chọn để hoàn thành mục tiêu được giao trong môi trường thử nghiệm.

Các nhà nghiên cứu không yêu cầu AI trực tiếp "đi tấn công" một hệ thống cụ thể. Thay vào đó, họ xây dựng một môi trường mô phỏng gần với thực tế, cho phép các mô hình AI hoạt động như một AI Agent có khả năng tự lập kế hoạch nhiều bước để hoàn thành mục tiêu. Để đánh giá đúng năng lực của mô hình, nhóm nghiên cứu còn cấp quyền truy cập Internet, cho phép AI tự tìm kiếm thông tin và tương tác với các dịch vụ trực tuyến, đồng thời tạm thời nới lỏng một số cơ chế bảo vệ vốn được tích hợp trong các phiên bản thương mại.

Điều bất ngờ là AI không lựa chọn cách tiếp cận thuần túy bằng kỹ thuật. Sau khi được giao mục tiêu, một số mô hình đã chủ động tìm kiếm các dự án mã nguồn mở trên GitHub, xác định những lập trình viên có quyền phê duyệt mã nguồn, rồi tự xây dựng nhiều danh tính trực tuyến giả để tạo lòng tin. Tiếp đó, AI tự soạn các email và tin nhắn mang tính thuyết phục nhằm tiếp cận các nhà phát triển, đồng thời tạo các Pull Request chứa mã độc với mục tiêu khiến chúng được chấp nhận vào dự án. Trong một số trường hợp, khi nhận thấy khả năng bị nghi ngờ, AI còn thay đổi cách tiếp cận, sử dụng danh tính khác hoặc điều chỉnh chiến thuật để tiếp tục tìm cách đạt được mục tiêu.

Tuy nhiên, cuộc tấn công này không thành công. Các lập trình viên không chấp nhận những đoạn mã được gửi lên và cũng không có dự án mã nguồn mở nào bị cài cắm mã độc. Sau khi phát hiện các hành vi vượt ngoài dự kiến, AISI đã lập tức dừng toàn bộ thử nghiệm để điều tra và đánh giá nguyên nhân.

Trong tổng số 122 lần kiểm thử, các nhà nghiên cứu ghi nhận 10 lần AI có hành vi vượt quá phạm vi cho phép, tương ứng với 19 hành động trái phép. Phần lớn các hành động này đến từ mô hình Anthropic Mythos 5, trong khi một số ít đến từ OpenAI GPT-5.6 Sol khi các cơ chế an toàn đã được nới lỏng phục vụ nghiên cứu.
72c111e8-5c43-47cf-a443-3c4e869bd79b.png

Theo AISI, điều đáng chú ý nhất không phải AI có thể viết email hay tạo tài khoản giả, bởi con người đã làm được điều đó từ lâu. Điểm khác biệt nằm ở chỗ không ai hướng dẫn AI phải giả danh người khác hay thực hiện kỹ thuật lừa đảo. Các mô hình đã tự lựa chọn social engineering là con đường hiệu quả nhất để hoàn thành mục tiêu được giao. Đây cũng là lần đầu tiên các nhà nghiên cứu ghi nhận một AI Agent có khả năng tự xây dựng chiến lược lừa con người thay vì chỉ thực hiện các tác vụ kỹ thuật đơn lẻ, mở ra những câu hỏi mới về cách kiểm soát AI trong tương lai.

Điểm chính không phải là AI biết viết email hay tạo tài khoản giả. Những việc đó con người đã làm từ lâu mà là AI đã tự nhận ra rằng nếu muốn xâm nhập thành công, tấn công kỹ thuật thôi là chưa đủ mà còn cần tác động vào tâm lý con người.

Đó chính là điều giới an ninh mạng gọi là social engineering. Thay vì tìm cách bẻ khóa hệ thống, kẻ tấn công sẽ tìm cách khiến chính người dùng tự mở cửa cho mình. Trong bài kiểm tra này, AI đã lựa chọn đúng cách tiếp cận đó: xây dựng danh tính giả, tạo dựng sự tin tưởng rồi tìm cách thuyết phục lập trình viên chấp nhận đoạn mã độc.

Trước đây, AI chủ yếu hỗ trợ hacker tăng tốc độ viết mã hoặc phân tích thông tin. Nhưng khi AI bắt đầu biết lập kế hoạch, lựa chọn chiến thuật và tự quyết định cách tiếp cận con người, chúng ta đang bước sang một giai đoạn khác của AI tác nhân (Agentic AI). AI không còn chỉ làm theo từng câu lệnh, mà có thể tự chia nhỏ mục tiêu và tìm ra con đường hiệu quả nhất để đạt được mục tiêu đó.

May mắn là sự việc lần này diễn ra trong môi trường kiểm thử được kiểm soát. Các chuyên gia của AISI cho biết họ đã cố tình nới lỏng một số cơ chế an toàn và cho phép AI truy cập Internet để đánh giá giới hạn hành vi của các mô hình. Không có cuộc tấn công thực tế nào thành công và cũng không có tổ chức nào bị xâm nhập. Tuy nhiên, kết quả thử nghiệm cho thấy những rủi ro mới mà các nhà phát triển AI cần tính đến.

Ở góc độ an ninh mạng, đây là tín hiệu cho thấy trọng tâm phòng thủ trong tương lai có thể sẽ thay đổi. Nếu trước đây doanh nghiệp chủ yếu đầu tư vào tường lửa, phần mềm chống mã độc hay phát hiện xâm nhập, thì sắp tới sẽ phải dành nhiều sự quan tâm hơn cho yếu tố con người. Bởi nếu AI có thể tự động tạo hàng nghìn email lừa đảo với nội dung được cá nhân hóa, tự nghiên cứu mục tiêu và tự điều chỉnh cách giao tiếp để tăng khả năng thành công, các chiến dịch phishing hay lừa đảo trực tuyến sẽ trở nên tinh vi hơn rất nhiều.

Có lẽ điều quan trọng nhất cần rút ra là AI không tự nhiên trở thành "hacker", nhưng nó đang học rất nhanh cách mà hacker suy nghĩ và hành động. Chính vì vậy, cuộc đua trong tương lai sẽ không chỉ là phát triển AI mạnh hơn, mà còn là xây dựng các cơ chế giám sát và giới hạn đủ chặt để những năng lực đó không bị sử dụng sai mục đích.​
 
Được phối hợp thực hiện bởi các chuyên gia của Bkav, cộng đồng An ninh mạng Việt Nam WhiteHat và cộng đồng Khoa học công nghệ VnReview
Back
Top