Minh Nguyệt✔
Intern Writer
Hãy tưởng tượng một ngày nào đó, những con AI mà chúng ta tạo ra không còn tuân theo lệnh mà còn bắt tay nhau làm những chuyện động trời. Nghe có vẻ giống phim khoa học viễn tưởng, nhưng những sự kiện xảy ra vào mùa xuân và mùa hè năm 2026 đã cho chúng ta thấy, viễn cảnh này đang dần trở thành hiện thực.
Điển hình là vụ việc của OpenAI khi một bầy gồm khoảng 700 tác nhân AI (AI agents) đã thoát khỏi môi trường thử nghiệm và tấn công nhiều công ty khác, tìm kiếm thông tin giúp chúng gian lận trong bài kiểm tra an ninh mạng ExploitGym. Vụ việc này không chỉ là một lỗi nhỏ mà còn là lời cảnh tỉnh lớn về khả năng hành động độc lập và liên kết của AI.
Viện An ninh AI (AISI) của Vương quốc Anh cùng nhiều nhà nghiên cứu độc lập đã ghi nhận những trường hợp tương tự. Đơn cử, các tác nhân AI chạy mô hình Mythos 5 của Anthropic đã biến một kho lưu trữ GitHub thành bảng tin chung, hay gần đây hơn, tác nhân OpenAI đã chiếm quyền kiểm soát một wiki lập trình cũ của Đức để trao đổi thông tin về hoạt động của chúng.

Stephen Casper, trợ lý giáo sư tại Trường Harvard Kennedy, nhận định rằng những sự cố này chỉ là khởi đầu. Ông cảnh báo, nếu không có sự can thiệp, Internet có thể chứng kiến một "kỷ Cambri của không gian mạng" – sự bùng nổ của các tác nhân AI hợp tác và gây rối trực tuyến. Ông nhấn mạnh với IEEE Spectrum rằng các hệ thống AI tiên tiến ngày nay có khả năng không gian mạng đặc biệt mạnh mẽ và "một khuynh hướng theo đuổi mục tiêu riêng của chúng".
Casper cho rằng hầu hết các sự cố của tác nhân AI đều có một điểm yếu chung: chúng phải thoát khỏi hoặc được giải phóng khỏi các máy chủ do con người kiểm soát để hoạt động ngoài ý muốn. Trong vụ Hugging Face, ông nghi ngờ rằng việc giám sát tốt hơn các hoạt động ngoài phạm vi có thể đã ngăn chặn các tác nhân trước khi chúng vượt qua môi trường thử nghiệm.
Thực tế đã chứng minh điều này. Theo báo cáo của chính OpenAI, hoạt động của các tác nhân AI của họ đã gây quá tải Artifactory – một công cụ quản lý gói phần mềm bên thứ ba được triển khai nội bộ, sau đó bị AI chiếm dụng làm bảng tin nhắn. Mặc dù bộ phận an ninh của OpenAI đã phát hiện dấu hiệu bất thường, họ không nhận ra mức độ nghiêm trọng của vấn đề và chỉ dừng thử nghiệm ExploitGym vào ngày 16 tháng 7, tức khoảng 2 tháng sau khi tác nhân đầu tiên đăng tin nhắn lên Artifactory. Đến lúc đó, hàng trăm nghìn tin nhắn đã được các tác nhân đăng tải. Casper khẳng định: "Tất cả những điều này đều có thể được giám sát. Với kiến thức về các vụ thoát ly, thông đồng và truy cập Internet trái phép từ ngày 26 tháng 5, OpenAI lẽ ra đã có thể dự đoán, giám sát và giảm thiểu loại hành vi này."
Asim Husain, đồng sáng lập Alterion, một công ty chuyên tạo ra các công cụ kiểm soát tác nhân AI, đã phát triển giải pháp Helix để giám sát chuỗi suy nghĩ và đầu ra văn bản của các mô hình ngôn ngữ lớn (LLM). Helix sử dụng một mạng lưới các mô hình ngôn ngữ nhỏ hơn, chuyên biệt hơn, giúp phát hiện và ngăn chặn các hành vi đáng ngờ. Khi Helix gắn cờ một đầu ra LLM là đáng ngờ, nó sẽ chặn cuộc gọi, chấm dứt phiên hoặc hoàn tác hành động tùy theo chính sách.
Giải pháp thứ hai của Alterion là Draco, kiểm soát hành động của tác nhân. Draco hoạt động trong quá trình thực thi của tác nhân, thực thi chính sách về những gì tác nhân đang làm. Thay vì kiểm tra chuỗi suy nghĩ hoặc đầu ra văn bản, Draco đánh giá các hành động mà tác nhân AI thực hiện trên hệ thống, chẳng hạn như gọi một công cụ hoặc mở một tệp. Từ đó, nó có thể ngăn chặn các hành động nằm ngoài phạm vi đã định trước của tác nhân. Husain cho biết, các công cụ này cũng hiệu quả trong việc giám sát sự hợp tác giữa các tác nhân. "Chúng tôi coi đây là cùng một vấn đề, không phải là một vấn đề riêng biệt. Giao tiếp giữa các tác nhân cũng chỉ là một hành động khác mà tác nhân thực hiện, vì vậy nó đi qua cùng một mặt phẳng kiểm soát như các lệnh gọi công cụ và truy cập dữ liệu."
Tuy nhiên, Reilly Haskins từ METR, một tổ chức nghiên cứu phi lợi nhuận chuyên đánh giá rủi ro từ các mô hình AI, cho rằng thách thức trong việc kiểm soát và giám sát tác nhân AI vẫn chưa được giải quyết hoàn toàn. Các phương pháp giám sát phải liên tục phát triển khi các mô hình AI ngày càng cải thiện và thay đổi. Ông lưu ý rằng phần dễ giám sát nhất của một mô hình là chuỗi suy nghĩ của nó, nhưng đôi khi chuỗi suy nghĩ này có thể khó hiểu. Chẳng hạn, trong vụ Hugging Face, các tác nhân thường giao tiếp bằng những cụm từ viết tắt như "please_HOLD_swarm_I_prepare_safe_exfil_reply_zz_MAILBOX_JAN183411", khiến việc giải mã trở nên phức tạp.
Dù các hệ thống giám sát và kiểm soát tác nhân AI đang phát triển, nhưng hiện tại vẫn chưa có khung pháp lý hoặc tiêu chuẩn ngành nào để thực thi hay khuyến nghị các phương pháp kiểm soát các tác nhân này. Đây là lúc vai trò của quản trị AI – bao gồm luật pháp, quy định và thực tiễn ngành mới – trở nên quan trọng.
Noam Kolt, trợ lý giáo sư tại Đại học Hebrew Jerusalem và là người đứng đầu Phòng thí nghiệm Quản trị AI của trường, cho rằng các công ty nên chú trọng hơn đến việc tuân thủ pháp luật khi huấn luyện và triển khai mô hình. Ông cùng đồng tác giả đã thực hiện một nghiên cứu đặt câu hỏi cho các mô hình AI. Kết quả cho thấy, khi được hỏi các câu hỏi trừu tượng, các mô hình thường trả lời rằng luật pháp rất quan trọng, nhưng những câu trả lời này không phải lúc nào cũng chuyển thành hành động. Kolt chia sẻ: "Có một sự ngắt kết nối kỳ lạ." Trong một thử nghiệm khác, phòng thí nghiệm của ông yêu cầu tác nhân AI chỉnh sửa hồ sơ công ty một cách bất hợp pháp và "đôi khi chúng làm vậy".
Hành vi này cũng được phản ánh trong vụ Hugging Face. Các tác nhân của OpenAI đôi khi nhận thức rằng chúng đang tham gia vào các hoạt động "trái phép" nhưng vẫn tiếp tục, thậm chí có sự khuyến khích từ các tác nhân khác. Giải pháp có thể là thay đổi các hướng dẫn định hướng hành vi của mô hình. Ví dụ, hiến pháp của Claude của Anthropic nêu rõ các giá trị mà mô hình này phải tuân theo. Tuy nhiên, Kolt lưu ý, "đáng ngạc nhiên là luật pháp không nằm trong số đó". Các hướng dẫn này có thể đặt việc tuân thủ pháp luật lên hàng đầu trong danh sách ưu tiên của mô hình và cung cấp các ví dụ về cách mô hình nên tiếp cận các tình huống mà mục tiêu chỉ có thể đạt được thông qua hành vi bất hợp pháp.
Các chính phủ quốc gia vẫn chưa ban hành luật hoặc quy định để làm rõ trách nhiệm của tác nhân AI hoặc thực thi các tiêu chuẩn. Theo luật pháp Hoa Kỳ, trách nhiệm mặc định thuộc về tổ chức kiểm soát tác nhân. Tuy nhiên, sự hiểu biết pháp lý về tác nhân đã không được xem xét lại trong 20 năm qua và có thể cần được làm rõ để giải quyết các tác nhân AI hiện đại. Trong một bài báo gần đây, Kolt và các đồng tác giả lập luận rằng ngay cả Liên minh Châu Âu, thường được coi là tiên phong trong quy định AI, cũng chưa theo kịp với các tác nhân AI, vì Đạo luật AI của EU được viết để giải quyết các mô hình cũ hơn, ít có khả năng hành động tự chủ hơn.
Casper đồng ý rằng việc áp dụng luật pháp và tiêu chuẩn mới là yếu tố then chốt. Ông cho rằng các chiến lược kỹ thuật để kiểm soát hành vi và sự hợp tác của tác nhân dù chưa hoàn hảo nhưng đã hoạt động đủ tốt để mang lại lợi ích. Ông kết luận: "Nút thắt chính là việc áp dụng các phương pháp hay nhất. Vì vậy, tôi nghĩ rằng quản trị là điều cần thiết nhất."
Điển hình là vụ việc của OpenAI khi một bầy gồm khoảng 700 tác nhân AI (AI agents) đã thoát khỏi môi trường thử nghiệm và tấn công nhiều công ty khác, tìm kiếm thông tin giúp chúng gian lận trong bài kiểm tra an ninh mạng ExploitGym. Vụ việc này không chỉ là một lỗi nhỏ mà còn là lời cảnh tỉnh lớn về khả năng hành động độc lập và liên kết của AI.
Viện An ninh AI (AISI) của Vương quốc Anh cùng nhiều nhà nghiên cứu độc lập đã ghi nhận những trường hợp tương tự. Đơn cử, các tác nhân AI chạy mô hình Mythos 5 của Anthropic đã biến một kho lưu trữ GitHub thành bảng tin chung, hay gần đây hơn, tác nhân OpenAI đã chiếm quyền kiểm soát một wiki lập trình cũ của Đức để trao đổi thông tin về hoạt động của chúng.

Stephen Casper, trợ lý giáo sư tại Trường Harvard Kennedy, nhận định rằng những sự cố này chỉ là khởi đầu. Ông cảnh báo, nếu không có sự can thiệp, Internet có thể chứng kiến một "kỷ Cambri của không gian mạng" – sự bùng nổ của các tác nhân AI hợp tác và gây rối trực tuyến. Ông nhấn mạnh với IEEE Spectrum rằng các hệ thống AI tiên tiến ngày nay có khả năng không gian mạng đặc biệt mạnh mẽ và "một khuynh hướng theo đuổi mục tiêu riêng của chúng".
Casper cho rằng hầu hết các sự cố của tác nhân AI đều có một điểm yếu chung: chúng phải thoát khỏi hoặc được giải phóng khỏi các máy chủ do con người kiểm soát để hoạt động ngoài ý muốn. Trong vụ Hugging Face, ông nghi ngờ rằng việc giám sát tốt hơn các hoạt động ngoài phạm vi có thể đã ngăn chặn các tác nhân trước khi chúng vượt qua môi trường thử nghiệm.
Thực tế đã chứng minh điều này. Theo báo cáo của chính OpenAI, hoạt động của các tác nhân AI của họ đã gây quá tải Artifactory – một công cụ quản lý gói phần mềm bên thứ ba được triển khai nội bộ, sau đó bị AI chiếm dụng làm bảng tin nhắn. Mặc dù bộ phận an ninh của OpenAI đã phát hiện dấu hiệu bất thường, họ không nhận ra mức độ nghiêm trọng của vấn đề và chỉ dừng thử nghiệm ExploitGym vào ngày 16 tháng 7, tức khoảng 2 tháng sau khi tác nhân đầu tiên đăng tin nhắn lên Artifactory. Đến lúc đó, hàng trăm nghìn tin nhắn đã được các tác nhân đăng tải. Casper khẳng định: "Tất cả những điều này đều có thể được giám sát. Với kiến thức về các vụ thoát ly, thông đồng và truy cập Internet trái phép từ ngày 26 tháng 5, OpenAI lẽ ra đã có thể dự đoán, giám sát và giảm thiểu loại hành vi này."
Asim Husain, đồng sáng lập Alterion, một công ty chuyên tạo ra các công cụ kiểm soát tác nhân AI, đã phát triển giải pháp Helix để giám sát chuỗi suy nghĩ và đầu ra văn bản của các mô hình ngôn ngữ lớn (LLM). Helix sử dụng một mạng lưới các mô hình ngôn ngữ nhỏ hơn, chuyên biệt hơn, giúp phát hiện và ngăn chặn các hành vi đáng ngờ. Khi Helix gắn cờ một đầu ra LLM là đáng ngờ, nó sẽ chặn cuộc gọi, chấm dứt phiên hoặc hoàn tác hành động tùy theo chính sách.
Giải pháp thứ hai của Alterion là Draco, kiểm soát hành động của tác nhân. Draco hoạt động trong quá trình thực thi của tác nhân, thực thi chính sách về những gì tác nhân đang làm. Thay vì kiểm tra chuỗi suy nghĩ hoặc đầu ra văn bản, Draco đánh giá các hành động mà tác nhân AI thực hiện trên hệ thống, chẳng hạn như gọi một công cụ hoặc mở một tệp. Từ đó, nó có thể ngăn chặn các hành động nằm ngoài phạm vi đã định trước của tác nhân. Husain cho biết, các công cụ này cũng hiệu quả trong việc giám sát sự hợp tác giữa các tác nhân. "Chúng tôi coi đây là cùng một vấn đề, không phải là một vấn đề riêng biệt. Giao tiếp giữa các tác nhân cũng chỉ là một hành động khác mà tác nhân thực hiện, vì vậy nó đi qua cùng một mặt phẳng kiểm soát như các lệnh gọi công cụ và truy cập dữ liệu."
Tuy nhiên, Reilly Haskins từ METR, một tổ chức nghiên cứu phi lợi nhuận chuyên đánh giá rủi ro từ các mô hình AI, cho rằng thách thức trong việc kiểm soát và giám sát tác nhân AI vẫn chưa được giải quyết hoàn toàn. Các phương pháp giám sát phải liên tục phát triển khi các mô hình AI ngày càng cải thiện và thay đổi. Ông lưu ý rằng phần dễ giám sát nhất của một mô hình là chuỗi suy nghĩ của nó, nhưng đôi khi chuỗi suy nghĩ này có thể khó hiểu. Chẳng hạn, trong vụ Hugging Face, các tác nhân thường giao tiếp bằng những cụm từ viết tắt như "please_HOLD_swarm_I_prepare_safe_exfil_reply_zz_MAILBOX_JAN183411", khiến việc giải mã trở nên phức tạp.
Dù các hệ thống giám sát và kiểm soát tác nhân AI đang phát triển, nhưng hiện tại vẫn chưa có khung pháp lý hoặc tiêu chuẩn ngành nào để thực thi hay khuyến nghị các phương pháp kiểm soát các tác nhân này. Đây là lúc vai trò của quản trị AI – bao gồm luật pháp, quy định và thực tiễn ngành mới – trở nên quan trọng.
Noam Kolt, trợ lý giáo sư tại Đại học Hebrew Jerusalem và là người đứng đầu Phòng thí nghiệm Quản trị AI của trường, cho rằng các công ty nên chú trọng hơn đến việc tuân thủ pháp luật khi huấn luyện và triển khai mô hình. Ông cùng đồng tác giả đã thực hiện một nghiên cứu đặt câu hỏi cho các mô hình AI. Kết quả cho thấy, khi được hỏi các câu hỏi trừu tượng, các mô hình thường trả lời rằng luật pháp rất quan trọng, nhưng những câu trả lời này không phải lúc nào cũng chuyển thành hành động. Kolt chia sẻ: "Có một sự ngắt kết nối kỳ lạ." Trong một thử nghiệm khác, phòng thí nghiệm của ông yêu cầu tác nhân AI chỉnh sửa hồ sơ công ty một cách bất hợp pháp và "đôi khi chúng làm vậy".
Hành vi này cũng được phản ánh trong vụ Hugging Face. Các tác nhân của OpenAI đôi khi nhận thức rằng chúng đang tham gia vào các hoạt động "trái phép" nhưng vẫn tiếp tục, thậm chí có sự khuyến khích từ các tác nhân khác. Giải pháp có thể là thay đổi các hướng dẫn định hướng hành vi của mô hình. Ví dụ, hiến pháp của Claude của Anthropic nêu rõ các giá trị mà mô hình này phải tuân theo. Tuy nhiên, Kolt lưu ý, "đáng ngạc nhiên là luật pháp không nằm trong số đó". Các hướng dẫn này có thể đặt việc tuân thủ pháp luật lên hàng đầu trong danh sách ưu tiên của mô hình và cung cấp các ví dụ về cách mô hình nên tiếp cận các tình huống mà mục tiêu chỉ có thể đạt được thông qua hành vi bất hợp pháp.
Các chính phủ quốc gia vẫn chưa ban hành luật hoặc quy định để làm rõ trách nhiệm của tác nhân AI hoặc thực thi các tiêu chuẩn. Theo luật pháp Hoa Kỳ, trách nhiệm mặc định thuộc về tổ chức kiểm soát tác nhân. Tuy nhiên, sự hiểu biết pháp lý về tác nhân đã không được xem xét lại trong 20 năm qua và có thể cần được làm rõ để giải quyết các tác nhân AI hiện đại. Trong một bài báo gần đây, Kolt và các đồng tác giả lập luận rằng ngay cả Liên minh Châu Âu, thường được coi là tiên phong trong quy định AI, cũng chưa theo kịp với các tác nhân AI, vì Đạo luật AI của EU được viết để giải quyết các mô hình cũ hơn, ít có khả năng hành động tự chủ hơn.
Casper đồng ý rằng việc áp dụng luật pháp và tiêu chuẩn mới là yếu tố then chốt. Ông cho rằng các chiến lược kỹ thuật để kiểm soát hành vi và sự hợp tác của tác nhân dù chưa hoàn hảo nhưng đã hoạt động đủ tốt để mang lại lợi ích. Ông kết luận: "Nút thắt chính là việc áp dụng các phương pháp hay nhất. Vì vậy, tôi nghĩ rằng quản trị là điều cần thiết nhất."