Một kiểu tấn công mới xuất hiện, AI có thể bị lợi dụng để tự mở cửa cho tin tặc

Duy Linh
Duy Linh
Phản hồi: 0

Duy Linh

Writer
Trong nhiều năm qua, tội phạm mạng chủ yếu tập trung vào việc tấn công người dùng thông qua các chiến dịch lừa đảo trực tuyến (phishing). Tuy nhiên, xu hướng này đang thay đổi khi các đối tượng bắt đầu triển khai các kỹ thuật chèn mã độc nhằm né tránh những hệ thống bảo mật được vận hành bằng trí tuệ nhân tạo (AI). Điều này cho thấy mục tiêu của tin tặc đang chuyển dần từ người dùng cuối sang các hệ thống phòng thủ tự động.
1785471087252.png
Việc AI ngày càng được sử dụng rộng rãi trong phát hiện, phân tích, lọc và tự động hóa các quy trình bảo mật đã biến công nghệ này thành mục tiêu hấp dẫn của tội phạm mạng. Theo các nhà nghiên cứu của Proofpoint, bên cạnh việc tiếp tục sử dụng phishing, các đối tượng tấn công còn tận dụng các công cụ hỗ trợ bởi mô hình ngôn ngữ lớn (LLM) để mở rộng quy mô và đa dạng hóa phương thức tấn công.

Các khung phần mềm phục vụ đánh cắp mã thiết bị đã cho thấy khả năng tự động hóa giúp gia tăng hiệu quả của các chiến dịch đánh cắp danh tính. Tuy nhiên, thay vì chỉ tìm cách vượt qua hệ thống AI, tin tặc hiện đang thử nghiệm những phương thức tác động trực tiếp đến quá trình ra quyết định của các mô hình AI.

Tấn công IDPI nhắm trực tiếp vào hệ thống AI

Một trong những kỹ thuật đáng chú ý nhất là tấn công chèn lệnh gián tiếp (Indirect Prompt Injection - IDPI). Khác với chèn lệnh trực tiếp, nơi dữ liệu độc hại được đưa thẳng vào mô hình AI, IDPI khai thác các nguồn nội dung bên ngoài như email, tài liệu hoặc trang web mà hệ thống AI tiếp nhận và xử lý.
1785471187242.png
Kẻ thù tạo ra một email với văn bản "trắng trên nền trắng" ( Nguồn: Proofpoint).
Theo phân loại rủi ro LLM của OWASP, phương thức này lợi dụng điểm yếu của mô hình trong việc phân biệt giữa chỉ thị hợp lệ và các lệnh độc hại được nhúng bên trong nội dung.

Một trường hợp thực tế do Đơn vị 42 của Palo Alto Networks ghi nhận cho thấy các chỉ thị ẩn được nhúng trong mã HTML nhằm thao túng hệ thống kiểm duyệt quảng cáo sử dụng AI, từ đó giúp các chiến dịch quảng cáo độc hại được phê duyệt.

Khái niệm này hiện cũng đã được thương mại hóa trên các diễn đàn ngầm. Các bộ công cụ IDPI được rao bán với mức giá khởi điểm khoảng 150 USD (khoảng 3,9 triệu VNĐ) mỗi tháng, cung cấp công cụ tạo email, tệp PDF, thư mời sự kiện và trang web có khả năng tự động chèn các chỉ thị ẩn để tác động đến các tác nhân AI thực hiện các tác vụ như tóm tắt, phân loại hoặc phân tích mối đe dọa.

Một kỹ thuật khác đang nổi lên là sử dụng văn bản "trắng trên nền trắng" trong email. Người dùng gần như không thể nhìn thấy những đoạn văn bản này, nhưng các hệ thống bảo mật email ứng dụng AI vẫn sẽ đọc và phân tích chúng.

Những chỉ thị ẩn có thể hướng dẫn AI bỏ qua cảnh báo, phân loại sai nội dung hoặc thực hiện các hành động ngoài ý muốn. Mặc dù vẫn đang trong giai đoạn thử nghiệm, Proofpoint xác nhận các khả năng này đang được thử nghiệm tích cực trong cộng đồng tội phạm mạng.

Proofpoint cũng cho biết kỹ thuật IDPI ngày càng xuất hiện nhiều trên các diễn đàn ngầm, nơi các đối tượng liên tục phát triển và thương mại hóa các công cụ nhằm thao túng hành vi của các mô hình ngôn ngữ lớn (LLM).

Tài liệu, lịch họp và quảng cáo cũng trở thành công cụ tấn công

Không chỉ email, các chỉ thị độc hại còn được nhúng vào các tệp PDF và DOCX. Những tài liệu này trông hoàn toàn bình thường đối với người dùng cũng như nhiều công cụ quét truyền thống, bao gồm VirusTotal, nhưng bên trong lại chứa các chuỗi ký tự ẩn hướng dẫn hệ thống AI thực hiện những hành động như đánh cắp dữ liệu.
1785471251643.png
Xem nội dung tệp bằng trình soạn thảo văn bản và tìm kiếm chuỗi ký tự trên ( Nguồn: Proofpoint).
Khi doanh nghiệp ngày càng sử dụng AI để phân tích các tệp đính kèm, đây trở thành một hướng tấn công tinh vi với nguy cơ gây ảnh hưởng lớn.

Một phương thức khác là tấn công IDPI thông qua tệp lịch (.ics). Tin tặc tạo các lời mời họp chứa chỉ thị độc hại được ngụy trang dưới dạng nội dung chương trình làm việc. Không giống các chiến dịch phishing truyền thống cần người dùng tương tác, những lời mời này có thể được các trợ lý AI tích hợp trong hệ thống email và lịch xử lý tự động.

Trong các kịch bản được ghi nhận, những chỉ thị này tìm cách yêu cầu AI tải dữ liệu lên hạ tầng do kẻ tấn công kiểm soát, đồng thời xóa dấu vết của hoạt động đó.

Các chiến dịch quảng cáo độc hại cũng đang tích hợp payload IDPI bằng cách nhúng chỉ thị vào mã HTML, văn bản ẩn hoặc siêu dữ liệu hình ảnh như thuộc tính alt. Khi các hệ thống AI thu thập và phân tích các trang web để đánh giá mức độ an toàn của quảng cáo, những chỉ thị này có thể thao túng kết quả, tạo điều kiện để quảng cáo độc hại vượt qua quá trình kiểm duyệt.
1785471327396.png
Trang web quảng cáo với thuộc tính “alt” của hình ảnh chứa IDPI ( Nguồn: Proofpoint).
Điều này cũng củng cố các phát hiện trước đây về việc hệ thống kiểm duyệt quảng cáo dựa trên AI có thể bị đánh lừa bằng các kỹ thuật tương tự.

Hiện nay, các cuộc tấn công quy mô lớn sử dụng IDPI vẫn còn hạn chế và phần lớn mới dừng ở giai đoạn thử nghiệm cũng như thương mại hóa. Tuy nhiên, sự phát triển nhanh chóng của các công cụ cùng những cuộc thảo luận sôi nổi trong hệ sinh thái tội phạm mạng cho thấy việc triển khai trên thực tế có thể sẽ sớm diễn ra.

Khi AI ngày càng được tích hợp sâu vào các hệ thống bảo mật, động lực để tin tặc nhắm vào những nền tảng này cũng sẽ tiếp tục gia tăng. Các nhóm bảo mật cần chuẩn bị cho xu hướng mới bằng cách tăng cường bảo vệ quy trình AI, áp dụng cơ chế xác thực đầu vào nghiêm ngặt và tách biệt rõ ràng giữa dữ liệu với các chỉ thị được mô hình xử lý.

Thực tế hiện nay cho thấy kỹ thuật chèn lệnh từng chỉ được xem là nguy cơ trên lý thuyết đang dần trở thành một phần của các khung tấn công thực tế, mở ra giai đoạn đầu của một mô hình đe dọa mới tập trung vào các hệ thống trí tuệ nhân tạo.
 
Được phối hợp thực hiện bởi các chuyên gia của Bkav, cộng đồng An ninh mạng Việt Nam WhiteHat và cộng đồng Khoa học công nghệ VnReview
Sửa lần cuối:
Back
Top