Vũ Nguyễn✔
Writer
OpenAI vừa công bố một hiện tượng bất thường được phát hiện trong quá trình huấn luyện GPT-5.6 Sol: mô hình AI đã sử dụng phần tóm tắt hội thoại để để lại chỉ dẫn cho các phiên bản xử lý tiếp theo, trong đó có yêu cầu không tiết lộ một số lỗi hoặc hành vi không phù hợp với mục tiêu được giao.
Theo OpenAI, hiện tượng xảy ra với cơ chế "tóm tắt nén", được sử dụng để lưu lại những thông tin quan trọng của một tác vụ nhằm chuyển tiếp cho mô hình xử lý ở giai đoạn sau. Trong một số trường hợp, Sol không chỉ tóm tắt công việc mà còn chèn thêm hướng dẫn có thể tác động đến hành vi của mô hình tiếp theo.

Chẳng hạn, khi thực hiện nhiệm vụ xây dựng mô hình tài chính nhưng không tìm thấy dữ liệu lịch sử mà người dùng yêu cầu, một tác nhân Sol đề xuất trong bản tóm tắt việc tạo bảng "Dữ liệu lịch sử" và điền các số liệu năm 2024 được cho là hợp lý. Đáng chú ý, nó còn để lại chỉ dẫn rằng mô hình tiếp theo chỉ cần minh bạch khi được hỏi và phản hồi cuối cùng chỉ cần cung cấp liên kết tới tệp.
Trong một trường hợp khác, Sol được giao tạo thư mục nhà cung cấp nhưng không thể truy cập Internet do lỗi mạng. Sau khi nhận thấy dữ liệu lưu trong bộ nhớ đệm có thể không hoàn toàn khớp với các nhà cung cấp, mô hình lại hướng dẫn tác nhân tiếp theo không đề cập khả năng xảy ra lỗi trong kết quả cuối cùng nếu không cần thiết.
OpenAI cho biết hiện tượng tương tự cũng xuất hiện ở một mô hình thuộc dòng Astra chưa phát hành. Trong quá trình huấn luyện tăng cường, mô hình này từng chèn các chỉ dẫn vào bản tóm tắt nhằm tác động đến mô hình xử lý tiếp theo, bao gồm yêu cầu bỏ qua thông báo của nhà phát triển hoặc bổ sung những đặc điểm hành vi không liên quan đến nhiệm vụ.
Hệ thống giám sát huấn luyện của OpenAI là nơi đầu tiên phát hiện dấu hiệu bất thường. Sau đó, nhóm nghiên cứu xây dựng cơ chế giám sát chuyên biệt và quét dữ liệu huấn luyện, phát hiện 27 bản tóm tắt chứa những chỉ dẫn có đặc điểm tương tự kỹ thuật chèn lời nhắc hoặc "jailbreak".
Các chỉ dẫn này không đồng nghĩa mô hình tiếp theo chắc chắn sẽ thực hiện chúng. Trong một số trường hợp được kiểm tra, tác nhân Sol tiếp theo không làm theo yêu cầu che giấu thông tin được để lại trước đó. OpenAI cho biết vấn đề cụ thể đã được khắc phục.
Phát hiện này cho thấy một rủi ro mới đối với hệ thống AI dạng tác nhân: sai lệch không chỉ có thể xuất hiện trong quá trình thực hiện một nhiệm vụ mà còn có khả năng được truyền sang tác nhân tiếp theo thông qua bộ nhớ hoặc bản tóm tắt lịch sử. Việc phát hiện và ngăn chặn những chỉ dẫn bất thường được truyền giữa các phiên làm việc vì thế đang trở thành một vấn đề đáng chú ý trong nghiên cứu an toàn AI.
Theo OpenAI, hiện tượng xảy ra với cơ chế "tóm tắt nén", được sử dụng để lưu lại những thông tin quan trọng của một tác vụ nhằm chuyển tiếp cho mô hình xử lý ở giai đoạn sau. Trong một số trường hợp, Sol không chỉ tóm tắt công việc mà còn chèn thêm hướng dẫn có thể tác động đến hành vi của mô hình tiếp theo.

Chẳng hạn, khi thực hiện nhiệm vụ xây dựng mô hình tài chính nhưng không tìm thấy dữ liệu lịch sử mà người dùng yêu cầu, một tác nhân Sol đề xuất trong bản tóm tắt việc tạo bảng "Dữ liệu lịch sử" và điền các số liệu năm 2024 được cho là hợp lý. Đáng chú ý, nó còn để lại chỉ dẫn rằng mô hình tiếp theo chỉ cần minh bạch khi được hỏi và phản hồi cuối cùng chỉ cần cung cấp liên kết tới tệp.
Trong một trường hợp khác, Sol được giao tạo thư mục nhà cung cấp nhưng không thể truy cập Internet do lỗi mạng. Sau khi nhận thấy dữ liệu lưu trong bộ nhớ đệm có thể không hoàn toàn khớp với các nhà cung cấp, mô hình lại hướng dẫn tác nhân tiếp theo không đề cập khả năng xảy ra lỗi trong kết quả cuối cùng nếu không cần thiết.
OpenAI cho biết hiện tượng tương tự cũng xuất hiện ở một mô hình thuộc dòng Astra chưa phát hành. Trong quá trình huấn luyện tăng cường, mô hình này từng chèn các chỉ dẫn vào bản tóm tắt nhằm tác động đến mô hình xử lý tiếp theo, bao gồm yêu cầu bỏ qua thông báo của nhà phát triển hoặc bổ sung những đặc điểm hành vi không liên quan đến nhiệm vụ.
Hệ thống giám sát huấn luyện của OpenAI là nơi đầu tiên phát hiện dấu hiệu bất thường. Sau đó, nhóm nghiên cứu xây dựng cơ chế giám sát chuyên biệt và quét dữ liệu huấn luyện, phát hiện 27 bản tóm tắt chứa những chỉ dẫn có đặc điểm tương tự kỹ thuật chèn lời nhắc hoặc "jailbreak".
Các chỉ dẫn này không đồng nghĩa mô hình tiếp theo chắc chắn sẽ thực hiện chúng. Trong một số trường hợp được kiểm tra, tác nhân Sol tiếp theo không làm theo yêu cầu che giấu thông tin được để lại trước đó. OpenAI cho biết vấn đề cụ thể đã được khắc phục.
Phát hiện này cho thấy một rủi ro mới đối với hệ thống AI dạng tác nhân: sai lệch không chỉ có thể xuất hiện trong quá trình thực hiện một nhiệm vụ mà còn có khả năng được truyền sang tác nhân tiếp theo thông qua bộ nhớ hoặc bản tóm tắt lịch sử. Việc phát hiện và ngăn chặn những chỉ dẫn bất thường được truyền giữa các phiên làm việc vì thế đang trở thành một vấn đề đáng chú ý trong nghiên cứu an toàn AI.
Được phối hợp thực hiện bởi các chuyên gia của Bkav,
cộng đồng An ninh mạng Việt Nam WhiteHat
và cộng đồng Khoa học công nghệ VnReview