Nhận xét nhanh về Claude Fable 5.1: Anthropic đẩy mạnh AI Agent, giảm mạnh chi phí bộ nhớ đệm và siết việc sao chép chuỗi suy luận

Mr. Darcy
Mr. Darcy
Phản hồi: 0

Mr. Darcy

Editor
Thành viên BQT
Anthropic vừa phát hành chính thức Claude Fable 5.1, cùng phiên bản Mythos 5.1 dành cho một số tổ chức nghiên cứu và an ninh được phê duyệt. Điểm đáng chú ý của thế hệ mới không nằm ở việc tăng mạnh điểm số hỏi đáp hay suy luận truyền thống, mà ở khả năng cho AI Agent hoạt động lâu hơn, sử dụng công cụ tốt hơn và giảm đáng kể chi phí khi xử lý những nhiệm vụ kéo dài.
1788361636669.png
Fable 5.1 và Mythos 5.1 sử dụng cùng một mô hình nền tảng. Fable dành cho người dùng phổ thông và doanh nghiệp, trong khi Mythos được áp dụng chính sách an toàn ít hạn chế hơn, chủ yếu dành cho các chương trình nghiên cứu an ninh mạng và khoa học sự sống đã được Anthropic phê duyệt.

Sự khác biệt này thể hiện khá rõ trên Terminal-Bench 4.0, bài kiểm tra yêu cầu AI thực sự thao tác trong môi trường terminal: đọc và sửa file, chạy lệnh, cài thư viện, kiểm thử, phát hiện lỗi rồi tiếp tục sửa cho tới khi hệ thống đạt trạng thái yêu cầu. Đây là dạng bài sát với cách một AI Agent hoạt động ngoài thực tế hơn nhiều so với việc chỉ yêu cầu mô hình viết một đoạn code.
1788361676476.png
Khả năng thực hiện các nhiệm vụ của Agent
Theo số liệu được công bố, Fable 5.1 đạt 55,8%, còn Mythos 5.1 đạt 60,9%. Khoảng cách giữa hai phiên bản cho thấy một vấn đề ngày càng quan trọng của AI hiện đại: năng lực thực tế của cùng một mô hình có thể khác nhau đáng kể tùy theo mức độ hạn chế an toàn được áp dụng.

Anthropic cũng đưa ra các thử nghiệm cho thấy mô hình có thể thực hiện nhiệm vụ kéo dài hàng chục giờ. Trong một trường hợp thử nghiệm máy học tự động kéo dài khoảng 38 giờ, AI tự phát hiện lỗi nhãn dữ liệu, sửa lỗi, chạy sáu thí nghiệm song song rồi tổng hợp kết quả. Đây vẫn là nghiên cứu do Anthropic và các đối tác ban đầu cung cấp, vì vậy chưa thể xem như đánh giá độc lập, nhưng nó cho thấy hướng phát triển rất rõ: AI đang chuyển từ chatbot trả lời từng câu sang Agent có khả năng tự làm việc trong thời gian dài.
1788361722404.png
Một thay đổi thực tế hơn với người sử dụng API là chi phí bộ nhớ đệm giảm mạnh. Giá API tiêu chuẩn của Fable 5.1 vẫn ở mức 10 USD cho một triệu token đầu vào và 50 USD cho một triệu token đầu ra. Điểm thay đổi nằm ở chi phí đọc cache, giảm từ 1 USD xuống còn 0,25 USD cho một triệu token, tương đương giảm 75%.

Điều này đặc biệt quan trọng đối với Agent. Khi một tác nhân phải liên tục đọc lại mã nguồn, tài liệu, lịch sử hội thoại và trạng thái công việc trong nhiều giờ, việc tận dụng cache có thể giảm đáng kể chi phí. Anthropic ước tính tổng chi phí của các tác vụ thông thường có thể giảm khoảng 25%, còn những tác vụ Agent phức tạp có thể giảm tới khoảng 45%.
1788361759628.png
Một điểm kỹ thuật khác đáng chú ý là cơ chế chống distillation, tức hạn chế việc khai thác chuỗi suy luận của Claude để huấn luyện mô hình khác.

Anthropic hiện liên kết phần suy nghĩ do Claude tạo ra với lời nhắc hệ thống, công cụ và lịch sử tương ứng. Nếu người dùng thay đổi ngữ cảnh rồi cố đưa phần suy nghĩ cũ trở lại, API có thể phát hiện sự không nhất quán và loại bỏ nội dung đó. Mục tiêu là ngăn việc thay đổi ngữ cảnh để buộc Claude tiết lộ hoặc tái sử dụng hàng loạt chuỗi suy luận phục vụ quá trình chưng cất mô hình.

Ngoài lập trình, Anthropic còn nhấn mạnh mạnh hơn vào AI Agent cho nghiên cứu khoa học. Trong một thử nghiệm thiết kế protein, Mythos 5.1 được cho là đạt tỷ lệ thành công gần 50% trên 12 mục tiêu, cao hơn đáng kể so với mức chuẩn 10 đến 15% mà Anthropic đưa ra. Một số thiết kế sau đó được kiểm chứng bằng thí nghiệm bên ngoài.

Mô hình cũng được sử dụng để tự viết kernel CUDA và tối ưu một số mô hình mã nguồn mở trong lĩnh vực protein và bộ gen, giúp tăng tốc tối đa khoảng 2,5 lần. Anthropic ước tính cách làm này có thể giảm 30 đến 60% chi phí GPU trong một số phân tích bộ gen quy mô lớn.

Trong thiên văn học, Fable 5.1 còn được dùng để xử lý dữ liệu radar cũ từ tàu Magellan của NASA, tạo bản đồ địa hình có độ phân giải cao hơn cho khoảng một phần ba bề mặt sao Kim. Theo thông tin được công bố, độ phân giải không gian được cải thiện từ khoảng 10 đến 20 km xuống còn 2 đến 3 km.

Nhìn tổng thể, Fable 5.1 không phải kiểu nâng cấp khiến mọi bảng xếp hạng lập tức bị đảo lộn. Giá trị lớn hơn nằm ở việc Anthropic đang cố giải quyết bài toán thực tế hơn: làm sao để một AI Agent đủ thông minh, hoạt động đủ lâu, ít lỗi hơn và có chi phí đủ thấp để doanh nghiệp thực sự triển khai ở quy mô lớn.

Fable 5 từng cho thấy Agent có thể xử lý những nhiệm vụ dài và phức tạp. Fable 5.1 bắt đầu trả lời câu hỏi tiếp theo: liệu những Agent như vậy có thể chạy liên tục hàng giờ với chi phí chấp nhận được hay không?

Vì thế cuộc cạnh tranh giữa Claude, GPT và các mô hình thế hệ tiếp theo có thể sẽ không còn được quyết định bởi việc ai trả lời một câu hỏi tốt hơn. Thước đo đáng quan tâm hơn sẽ là: sau 5 hay 10 giờ tự làm việc với terminal, trình duyệt, code và dữ liệu, AI nào thực sự hoàn thành được nhiệm vụ, mắc ít lỗi nhất và tốn ít tiền nhất.
 
Back
Top