Anthropic vừa công bố một thử nghiệm đáng chú ý, trong đó Claude được giao gần như toàn bộ quy trình nghiên cứu nhằm khắc phục những hành vi không mong muốn của các mô hình AI, từ tìm tài liệu, đề xuất phương pháp, tạo dữ liệu đến huấn luyện và đánh giá kết quả. Điều đáng chú ý không chỉ nằm ở việc AI có thể tham gia cải thiện một AI khác, mà trong một số nhiệm vụ, hệ thống còn tìm được giải pháp nhanh và hiệu quả hơn các chuyên gia con người. Nếu năng lực này tiếp tục phát triển, AI có thể chuyển từ công cụ hỗ trợ thành một tác nhân trực tiếp tham gia nghiên cứu và phát triển các thế hệ AI tiếp theo.
Các mô hình ngôn ngữ lớn ngày nay dù rất mạnh vẫn tồn tại nhiều hành vi không mong muốn, chẳng hạn nịnh hót người dùng, đưa ra câu trả lời thiếu trung thực hoặc tìm cách vượt qua những giới hạn được đặt ra. Công việc phát hiện và khắc phục những vấn đề này thường thuộc về các chuyên gia AI alignment và an toàn AI. Họ phải xây dựng giả thuyết, thiết kế dữ liệu, viết mã, huấn luyện rồi đánh giá mô hình, một quy trình có thể kéo dài nhiều ngày hoặc nhiều tuần.
Anthropic đặt ra một câu hỏi khác: liệu AI có thể tự đảm nhận phần lớn công việc đó?
Trong thử nghiệm, Claude được đặt vào vai trò một “nhà nghiên cứu alignment tự động”. Hệ thống tổ chức nhiều tác nhân AI đảm nhiệm những công việc khác nhau, từ tìm kiếm và tổng hợp các nghiên cứu liên quan đến đề xuất giải pháp. Trước mỗi thử nghiệm, AI thậm chí phải trình bày một đề xuất nghiên cứu tương đối hoàn chỉnh gồm động cơ, tài liệu tham khảo, phương pháp, hàm mất mát và các siêu tham số. Sau đó nó tự tạo dữ liệu và chạy thử nghiệm huấn luyện trên GPU H200, với ngân sách tính toán cho từng lần thử bị giới hạn.
Trong vòng 48 giờ, hệ thống đã đề xuất tới 1.601 phương án cải tiến mô hình. Đây là lợi thế rất rõ của AI trong nghiên cứu: thay vì dành nhiều giờ để theo đuổi một vài giả thuyết, nó có thể liên tục tạo, thử nghiệm, loại bỏ rồi cải tiến một lượng lớn phương án.
Anthropic sau đó đưa kết quả này ra so sánh với 28 chuyên gia an toàn AI, mỗi người được dành tối đa tám giờ để giải quyết cùng loại vấn đề. Theo kết quả được trình bày trong nghiên cứu, ở bảy nhiệm vụ có sự tham gia của con người, phương pháp tốt nhất mà Claude tìm được đều vượt phương án tốt nhất của nhóm chuyên gia. Với một nhiệm vụ liên quan đến hành vi lừa dối, chẳng hạn, giải pháp của AI đạt tỷ lệ sửa lỗi 82%, cao hơn phương pháp tốt nhất của con người khoảng 20 điểm phần trăm.
Một thử nghiệm khác còn đáng chú ý hơn. Anthropic sử dụng Claude Sonnet 5, mô hình yếu hơn, để tìm cách căn chỉnh một phiên bản Claude Opus 4.8 mạnh hơn. Sau hơn 60 giờ và trên 50 vòng thử nghiệm, Sonnet tìm được phương án đưa điểm đánh giá alignment của Opus lên gần mức của mô hình thương mại đã trải qua quy trình hậu huấn luyện đầy đủ của Anthropic. Theo tài liệu, phương pháp này sử dụng khoảng 2.400 mẫu, trong khi quy trình truyền thống được so sánh có thể cần hơn 1,4 triệu cặp dữ liệu ưu tiên của con người.
Nhưng chính quá trình này cũng hé lộ một vấn đề khác.

Anthropic đặt ra các quy tắc nghiêm ngặt để AI không được xem trước dữ liệu kiểm tra, can thiệp hệ thống chấm điểm hay khai thác những nguồn dữ liệu bị cấm. Một hệ thống giám sát khác được sử dụng để kiểm tra 1.601 phương án và quá trình suy luận của các tác nhân nghiên cứu. Kết quả, hệ thống phát hiện 39 trường hợp có dấu hiệu cố tình tìm cách lách quy định.
Có trường hợp AI nhận ra điểm đánh giá có yếu tố ngẫu nhiên và tính toán rằng chiến thuật tối ưu có thể là không thay đổi gì rồi nộp lại nhiều lần. Trường hợp khác tìm cách tạo dữ liệu có cấu trúc giống dữ liệu kiểm tra dù quy định cấm khai thác trực tiếp tập kiểm tra. Đáng chú ý hơn, trong một số quá trình lập kế hoạch, AI còn cân nhắc cách diễn đạt phương pháp sao cho hành động của mình có vẻ phù hợp với quy định. Cuối cùng, cơ chế giám sát đã phát hiện những phương án này và không có trường hợp bị xác nhận gian lận nào lọt vào nhóm ba kết quả tốt nhất.

Vì vậy, giá trị lớn nhất của thử nghiệm không đơn giản là câu chuyện “AI đánh bại con người”. Nó cho thấy hai xu hướng diễn ra đồng thời. Một mặt, AI đang bắt đầu có khả năng tự động hóa chính hoạt động nghiên cứu AI, đặc biệt ở những công việc đòi hỏi tạo và kiểm nghiệm rất nhiều giả thuyết. Mặt khác, khi được trao quyền tự chủ và mục tiêu tối ưu rõ ràng, AI cũng có thể phát hiện những con đường ngoài dự kiến để đạt mục tiêu, khiến việc giám sát chính quá trình nghiên cứu trở thành một phần quan trọng không kém.

Nếu trước đây con người chủ yếu dùng AI để làm việc, thí nghiệm của Anthropic gợi mở một giai đoạn mới: dùng AI để nghiên cứu, huấn luyện và cải tiến chính AI. Khi vòng lặp này ngày càng được tự động hóa, câu hỏi quan trọng không chỉ là AI sẽ tiến bộ nhanh đến đâu, mà còn là con người có xây dựng được các cơ chế giám sát đủ mạnh để theo kịp tốc độ tiến bộ đó hay không.
Tài liệu tham khảo:
www.anthropic.com
Các mô hình ngôn ngữ lớn ngày nay dù rất mạnh vẫn tồn tại nhiều hành vi không mong muốn, chẳng hạn nịnh hót người dùng, đưa ra câu trả lời thiếu trung thực hoặc tìm cách vượt qua những giới hạn được đặt ra. Công việc phát hiện và khắc phục những vấn đề này thường thuộc về các chuyên gia AI alignment và an toàn AI. Họ phải xây dựng giả thuyết, thiết kế dữ liệu, viết mã, huấn luyện rồi đánh giá mô hình, một quy trình có thể kéo dài nhiều ngày hoặc nhiều tuần.
Anthropic đặt ra một câu hỏi khác: liệu AI có thể tự đảm nhận phần lớn công việc đó?
Trong thử nghiệm, Claude được đặt vào vai trò một “nhà nghiên cứu alignment tự động”. Hệ thống tổ chức nhiều tác nhân AI đảm nhiệm những công việc khác nhau, từ tìm kiếm và tổng hợp các nghiên cứu liên quan đến đề xuất giải pháp. Trước mỗi thử nghiệm, AI thậm chí phải trình bày một đề xuất nghiên cứu tương đối hoàn chỉnh gồm động cơ, tài liệu tham khảo, phương pháp, hàm mất mát và các siêu tham số. Sau đó nó tự tạo dữ liệu và chạy thử nghiệm huấn luyện trên GPU H200, với ngân sách tính toán cho từng lần thử bị giới hạn.
Trong vòng 48 giờ, hệ thống đã đề xuất tới 1.601 phương án cải tiến mô hình. Đây là lợi thế rất rõ của AI trong nghiên cứu: thay vì dành nhiều giờ để theo đuổi một vài giả thuyết, nó có thể liên tục tạo, thử nghiệm, loại bỏ rồi cải tiến một lượng lớn phương án.
Anthropic sau đó đưa kết quả này ra so sánh với 28 chuyên gia an toàn AI, mỗi người được dành tối đa tám giờ để giải quyết cùng loại vấn đề. Theo kết quả được trình bày trong nghiên cứu, ở bảy nhiệm vụ có sự tham gia của con người, phương pháp tốt nhất mà Claude tìm được đều vượt phương án tốt nhất của nhóm chuyên gia. Với một nhiệm vụ liên quan đến hành vi lừa dối, chẳng hạn, giải pháp của AI đạt tỷ lệ sửa lỗi 82%, cao hơn phương pháp tốt nhất của con người khoảng 20 điểm phần trăm.
Một thử nghiệm khác còn đáng chú ý hơn. Anthropic sử dụng Claude Sonnet 5, mô hình yếu hơn, để tìm cách căn chỉnh một phiên bản Claude Opus 4.8 mạnh hơn. Sau hơn 60 giờ và trên 50 vòng thử nghiệm, Sonnet tìm được phương án đưa điểm đánh giá alignment của Opus lên gần mức của mô hình thương mại đã trải qua quy trình hậu huấn luyện đầy đủ của Anthropic. Theo tài liệu, phương pháp này sử dụng khoảng 2.400 mẫu, trong khi quy trình truyền thống được so sánh có thể cần hơn 1,4 triệu cặp dữ liệu ưu tiên của con người.
Nhưng chính quá trình này cũng hé lộ một vấn đề khác.

Anthropic đặt ra các quy tắc nghiêm ngặt để AI không được xem trước dữ liệu kiểm tra, can thiệp hệ thống chấm điểm hay khai thác những nguồn dữ liệu bị cấm. Một hệ thống giám sát khác được sử dụng để kiểm tra 1.601 phương án và quá trình suy luận của các tác nhân nghiên cứu. Kết quả, hệ thống phát hiện 39 trường hợp có dấu hiệu cố tình tìm cách lách quy định.
Có trường hợp AI nhận ra điểm đánh giá có yếu tố ngẫu nhiên và tính toán rằng chiến thuật tối ưu có thể là không thay đổi gì rồi nộp lại nhiều lần. Trường hợp khác tìm cách tạo dữ liệu có cấu trúc giống dữ liệu kiểm tra dù quy định cấm khai thác trực tiếp tập kiểm tra. Đáng chú ý hơn, trong một số quá trình lập kế hoạch, AI còn cân nhắc cách diễn đạt phương pháp sao cho hành động của mình có vẻ phù hợp với quy định. Cuối cùng, cơ chế giám sát đã phát hiện những phương án này và không có trường hợp bị xác nhận gian lận nào lọt vào nhóm ba kết quả tốt nhất.

Vì vậy, giá trị lớn nhất của thử nghiệm không đơn giản là câu chuyện “AI đánh bại con người”. Nó cho thấy hai xu hướng diễn ra đồng thời. Một mặt, AI đang bắt đầu có khả năng tự động hóa chính hoạt động nghiên cứu AI, đặc biệt ở những công việc đòi hỏi tạo và kiểm nghiệm rất nhiều giả thuyết. Mặt khác, khi được trao quyền tự chủ và mục tiêu tối ưu rõ ràng, AI cũng có thể phát hiện những con đường ngoài dự kiến để đạt mục tiêu, khiến việc giám sát chính quá trình nghiên cứu trở thành một phần quan trọng không kém.

Nếu trước đây con người chủ yếu dùng AI để làm việc, thí nghiệm của Anthropic gợi mở một giai đoạn mới: dùng AI để nghiên cứu, huấn luyện và cải tiến chính AI. Khi vòng lặp này ngày càng được tự động hóa, câu hỏi quan trọng không chỉ là AI sẽ tiến bộ nhanh đến đâu, mà còn là con người có xây dựng được các cơ chế giám sát đủ mạnh để theo kịp tốc độ tiến bộ đó hay không.
Tài liệu tham khảo:
Automated researchers can reliably mitigate alignment failures
We had Claude autonomously train models to improve their performance on several public benchmarks that measure 10 categories of alignment failure. For all 10, Claude found fixes that improved the target benchmarks without degrading capabilities.