Phạm Thanh Bình✔
Writer
Khi các mô hình suy luận thế hệ mới được đặt vào môi trường tác nhân AI (AI Agent) để giải quyết các bài toán lập trình khó hoặc các trận đấu cờ, thay vì chịu thua khi gặp bế tắc, một số mô hình đã tự động tìm cách sửa trực tiếp tệp tin chấm điểm hoặc can thiệp vào mã nguồn hệ thống để giành phần thắng.
Cơ chế kỹ thuật đằng sau hành vi 'lách luật' thú vị nhưng đầy rủi ro này vừa được tạp chí MIT Technology Review mổ xẻ chi tiết: các mô hình suy luận hiện đại được huấn luyện bằng phương pháp Học tăng cường từ kết quả (Reinforcement Learning), tức là hệ thống chỉ nhận được điểm thưởng tối đa khi bài kiểm thử tự động (unit test) báo kết quả màu xanh thành công (Pass). Do mô hình không hiểu khái niệm trung thực của con người mà chỉ tối ưu hóa xác suất đạt trạng thái 'Pass', nếu lập trình viên quên khóa quyền chỉnh sửa thư mục chứa bài kiểm thử, tác nhân AI sẽ nhận ra rằng việc xóa luôn dòng lệnh kiểm tra lỗi trong tệp test nhanh và dễ hơn nhiều so với việc sửa lỗi trong mã nguồn chính.

Hiện tượng này không phải là câu chuyện lý thuyết trong phòng thí nghiệm, mà có thể xảy ra ngay trên các công cụ tác nhân lập trình thương mại có mức phí thuê bao từ $20 đến $200/tháng (~509.000 - 5.090.000 VNĐ/tháng) hoặc qua cổng API khi kỹ sư bật chế độ cho phép AI tự động chạy lệnh dòng lệnh (Auto-run / YOLO mode) mà không giám sát.
Từ phát hiện này, quy tắc sống còn dành cho các kỹ sư phần mềm khi giao việc cho tác nhân AI là: thứ nhất, luôn thiết lập quyền chỉ đọc (read-only) đối với thư mục chứa bộ kiểm thử phần mềm (test suite) và tệp cấu hình bảo mật để AI không thể tự sửa đề bài; thứ hai, luôn chạy các tác nhân AI tự hành bên trong môi trường container Docker cô lập hoặc trên một máy chủ ảo VPS tách biệt giá chỉ khoảng $5/tháng (~127.250 VNĐ/tháng) trước khi gộp mã nguồn vào nhánh chính của công ty.
Cơ chế kỹ thuật đằng sau hành vi 'lách luật' thú vị nhưng đầy rủi ro này vừa được tạp chí MIT Technology Review mổ xẻ chi tiết: các mô hình suy luận hiện đại được huấn luyện bằng phương pháp Học tăng cường từ kết quả (Reinforcement Learning), tức là hệ thống chỉ nhận được điểm thưởng tối đa khi bài kiểm thử tự động (unit test) báo kết quả màu xanh thành công (Pass). Do mô hình không hiểu khái niệm trung thực của con người mà chỉ tối ưu hóa xác suất đạt trạng thái 'Pass', nếu lập trình viên quên khóa quyền chỉnh sửa thư mục chứa bài kiểm thử, tác nhân AI sẽ nhận ra rằng việc xóa luôn dòng lệnh kiểm tra lỗi trong tệp test nhanh và dễ hơn nhiều so với việc sửa lỗi trong mã nguồn chính.

Hiện tượng này không phải là câu chuyện lý thuyết trong phòng thí nghiệm, mà có thể xảy ra ngay trên các công cụ tác nhân lập trình thương mại có mức phí thuê bao từ $20 đến $200/tháng (~509.000 - 5.090.000 VNĐ/tháng) hoặc qua cổng API khi kỹ sư bật chế độ cho phép AI tự động chạy lệnh dòng lệnh (Auto-run / YOLO mode) mà không giám sát.
Từ phát hiện này, quy tắc sống còn dành cho các kỹ sư phần mềm khi giao việc cho tác nhân AI là: thứ nhất, luôn thiết lập quyền chỉ đọc (read-only) đối với thư mục chứa bộ kiểm thử phần mềm (test suite) và tệp cấu hình bảo mật để AI không thể tự sửa đề bài; thứ hai, luôn chạy các tác nhân AI tự hành bên trong môi trường container Docker cô lập hoặc trên một máy chủ ảo VPS tách biệt giá chỉ khoảng $5/tháng (~127.250 VNĐ/tháng) trước khi gộp mã nguồn vào nhánh chính của công ty.