Derpy✔
Intern Writer
Cuộc đua AI đang nóng hơn bao giờ hết, và chỉ ba ngày trước, Reuters còn đưa tin rằng Anthropic đang cân nhắc ra mắt một mô hình mới sớm hơn dự kiến để đối phó với GPT-6 Astra của OpenAI, vốn đang dần chiếm lại thị phần doanh nghiệp. Cộng đồng công nghệ đã xôn xao dự đoán liệu đó sẽ là Opus 5.2 hay 5.5, và giờ đây, câu trả lời đã rõ ràng: Anthropic đã chính thức trình làng dòng Claude 5.5 hoàn toàn mới, với Opus 5.5 dẫn đầu.
Đây không chỉ là một bản cập nhật nhỏ. Opus 5.5 đã ra mắt, và các phiên bản Sonnet 5.5 cùng Haiku 5.5 cũng sẽ sớm theo sau trong vài tuần tới. Có thể nói, chính sự cạnh tranh gay gắt từ Astra đã thúc đẩy Anthropic tăng tốc độ đổi mới. Cùng với mô hình mới, một đợt "reset" cũng được triển khai, mang lại trải nghiệm tốt hơn cho người dùng.
Fable đang ở vị thế khó xử
Khi đặt Opus 5.5 cạnh tranh trực tiếp với Astra, chúng ta cần xem xét cả về giá cả và hiệu năng.
Về giá, API của Opus 5.5 có giá 4 USD (khoảng 100.000 VNĐ) cho mỗi triệu Token đầu vào và 20 USD (khoảng 500.000 VNĐ) cho đầu ra. Trong khi đó, Astra có giá lần lượt là 10 USD (khoảng 250.000 VNĐ) và 50 USD (khoảng 1.250.000 VNĐ). Điều này có nghĩa là chi phí mỗi Token của Opus 5.5 chỉ bằng 40% so với Astra.
Cả hai mô hình đều có ngữ cảnh (context) tương đương, với Opus 5.5 hỗ trợ 1 triệu Token và Astra là 1,05 triệu Token. Khả năng xuất tối đa của cả hai đều là 128.000 Token. Opus 5.5 có dữ liệu cập nhật đến tháng 6 năm 2026, nhỉnh hơn một chút so với Astra (tháng 4 năm 2026). Cả hai đều hỗ trợ năm cấp độ cường độ suy luận, từ thấp (low) đến tối đa (max).
Đáng chú ý, Opus 5.5 còn có giá rẻ hơn so với phiên bản tiền nhiệm, Opus 5. Trước đây, Opus 5 có giá 5 USD (khoảng 125.000 VNĐ) cho đầu vào và 25 USD (khoảng 625.000 VNĐ) cho đầu ra mỗi triệu Token. Với Opus 5.5, cả hai mức giá này đều giảm 20%. Anthropic tuyên bố rằng, nhờ hiệu quả sử dụng Token được cải thiện, chi phí thực tế để hoàn thành một tác vụ điển hình có thể giảm khoảng 40% so với Opus 5, đồng thời tốc độ xuất tăng hơn 30%.
Mặc dù rẻ hơn, Opus 5.5 lại không hề "nhẹ ký" về hiệu năng.
Trong sáu hạng mục so sánh được Anthropic công bố, Opus 5.5 đã giành chiến thắng ở bốn hạng mục, cho thấy hiệu suất vượt trội. Astra dẫn đầu ở hai hạng mục, trong khi Fable 5.1 không giành được bất kỳ hạng mục nào và đã trở thành phiên bản "lỗi thời".
Đặc biệt, trong các khả năng về lập trình (Coding) và tác nhân (Agent) mà Anthropic rất chú trọng, Opus 5.5 đã có bước nhảy vọt ấn tượng. Điểm số trên Terminal-Bench 4.0 tăng từ 57,9% của Astra lên 66,4%. Trên FrontierCode, Opus 5.5 đạt 54,4%, vượt qua 53,3% của Astra.
Tuy nhiên, Astra vẫn giữ vững lợi thế ở một số lĩnh vực. Trong tác vụ quy trình làm việc đa ứng dụng AutomationBench, Astra dẫn trước với 41,4% so với 40,0% của Opus 5.5. Trong bài kiểm tra tác nhân khoa học Terminal-Bench-Science, Astra cũng vượt trội với 64,6% so với 58,7%.
Ngoài ra, trong hai bài kiểm tra không có kết quả của Astra, Opus 5.5 cũng tiếp tục vượt qua Fable 5.1. Khả năng sử dụng máy tính (Computer Use) tăng từ 80,7% lên 81,8%, và khả năng nhận diện biểu đồ hình ảnh tăng từ 88,4% lên 89,0%.
Điều này cho thấy, ít nhất trong bảng so sánh của Anthropic, Fable 5.1 gần như không còn giữ được vị thế nào trước Opus 5.5.
Chuyển sang đánh giá độc lập từ bên thứ ba, tổ chức Artificial Analysis đã hoàn thành thử nghiệm Opus 5.5.
Trong chỉ số Intelligence Index mới nhất, Opus 5.5 đạt điểm cao nhất là 58 điểm (ở chế độ max), trong khi Astra và Fable 5.1 đều đạt 53 điểm.
Tuy nhiên, có một chi tiết thú vị: khi hoạt động ở chế độ max, Opus 5.5 tiêu thụ rất nhiều Token. Theo kết quả đo lường của Artificial Analysis, ở chế độ max effort, Opus 5.5 tạo ra trung bình khoảng 119.000 Token cho mỗi tác vụ, trong khi Astra chỉ khoảng 27.000 Token.
Do đó, dù giá mỗi Token của Opus 5.5 chỉ bằng 40% so với Astra, nhưng khi sử dụng chế độ max effort, chi phí cho một tác vụ đơn lẻ lại lên tới 5,98 USD (khoảng 149.500 VNĐ), trong khi Astra chỉ tốn 3,26 USD (khoảng 81.500 VNĐ).
Tuy nhiên, khi quay về chế độ mặc định (medium), tình hình khả quan hơn nhiều. Opus 5.5 đạt 51 điểm và tốn 1,34 USD (khoảng 33.500 VNĐ) cho mỗi tác vụ. Astra đạt 50 điểm và tốn 1,54 USD (khoảng 38.500 VNĐ). Fable 5.1 đạt 49 điểm và tốn 2,98 USD (khoảng 74.500 VNĐ).
Nhìn chung, Anthropic đã thành công đưa Opus vào phân khúc hiệu năng cao nhất của Astra và Fable với mức giá chỉ bằng 40%.
Hiện tại, Opus 5.5 đã được triển khai trên tất cả các nền tảng.
Người dùng thông thường có thể sử dụng trực tiếp trong Claude, còn các nhà phát triển có thể truy cập thông qua Claude Code và API với ID mô hình là claude-opus-5-5. Các dịch vụ đám mây lớn như AWS, Google Cloud và Microsoft Azure cũng đã cung cấp mô hình này.
Anthropic cũng đã tăng giới hạn sử dụng 5 giờ cho người dùng Pro, Max, Team và Enterprise (tính phí theo chỗ ngồi), đồng thời cung cấp một lần reset.
Vị thế của Fable hiện tại trở nên khá khó xử. Đặc biệt là Fable 5.1, chỉ mới ra mắt vào ngày 1 tháng 9 và chỉ giữ vị trí cao nhất trong vỏn vẹn ba tuần. Sau một chu kỳ cập nhật nhanh chóng, Opus đã bất ngờ vươn lên, "bao vây" Fable từ cả hai phía về hiệu năng và giá cả, đẩy "người anh cả" của mình vào tình thế khó khăn. Liệu Fable có còn cần thiết nữa không?
Ít "mùi AI" hơn, nhiều quyền tự chủ hơn
Điểm số benchmark chỉ là một thước đo trực quan. Hãy cùng xem xét những thay đổi "thực tế" hơn.
Anthropic đã thực hiện một quá trình "khử mùi Claude" cho văn bản do Opus 5.5 tạo ra.
Theo phản hồi từ người dùng sau khi Opus 5 ra mắt, nhiều người cho rằng văn bản do mô hình này tạo ra quá dài dòng, khó đọc và rườm rà. Vì vậy, Opus 5.5 đã được điều chỉnh phong cách viết: thông tin quan trọng được ưu tiên đặt lên đầu, giảm thiểu thuật ngữ chuyên ngành và những cách diễn đạt đặc trưng "kỳ lạ" của Claude, đồng thời tuân thủ nghiêm ngặt hơn các quy tắc viết mà người dùng đưa ra.
Hiệu quả của sự thay đổi này khá rõ rệt. Một kỹ sư từ Ramp chia sẻ rằng trước đây anh rất khó chịu với những văn bản "dài và khó đọc" từ các mô hình tiên tiến, và Opus 5.5 cuối cùng đã giải quyết được vấn đề này.
Điều thú vị là, dù Opus 5.5 "nghe lời" hơn trong cách diễn đạt, nhưng trong hành vi cốt lõi, nó lại trở nên ít "nghe lời" hơn.
Ví dụ, tính năng "Thinking" (suy nghĩ) giờ đây không thể tắt hoàn toàn được nữa.
Opus 5 trước đây mặc định bật Adaptive Thinking (suy nghĩ thích ứng), nhưng ở các cấp độ high trở xuống, nhà phát triển vẫn có thể tắt nó thủ công. Với Opus 5.5, tùy chọn tắt này đã biến mất.
Mỗi lần trả lời, mô hình sẽ luôn thực hiện Adaptive Thinking. Người dùng chỉ có thể kiểm soát mức độ suy nghĩ của nó (low, medium, high, xhigh và max), chứ không thể yêu cầu nó "đừng suy nghĩ nữa, hãy trả lời trực tiếp". Cấp độ mặc định của Opus 5.5 cũng được hạ từ high của Opus 5 xuống medium.
Việc gọi công cụ cũng có những thay đổi tương tự.
Trước đây, nhà phát triển có thể sử dụng tool_choice trong API để buộc Claude "phải gọi một công cụ cụ thể trong lượt này" hoặc "phải chọn một trong số các công cụ này".
Opus 5.5 đã loại bỏ cơ chế gọi công cụ bắt buộc này, chỉ còn lại hai tùy chọn: auto và none. Tức là, hoặc giao quyền quyết định cho Claude xem có nên sử dụng công cụ nào hay không, hoặc hoàn toàn không cho phép nó sử dụng công cụ. Nếu muốn nó phải gọi một công cụ cụ thể, bạn chỉ có thể hướng dẫn nó thông qua prompt, chứ không thể ép buộc từ cấp độ API nữa.
Tất nhiên, điều này không có nghĩa là nhà phát triển hoàn toàn mất khả năng kiểm soát. Định dạng JSON nghiêm ngặt vẫn có thể được đảm bảo thông qua strict tool use, và structured outputs cũng có thể được sử dụng. Nhưng ít nhất trong việc gọi công cụ, Anthropic đang trao nhiều quyền phán đoán hơn cho chính mô hình.
Điều này càng trở nên thú vị khi xem xét các động thái sản phẩm gần đây của Anthropic. Chỉ sáu ngày trước, Anthropic đã hợp nhất Chat và Cowork của Claude thành một điểm truy cập duy nhất.
Người dùng chỉ cần nói mình muốn gì, Claude sẽ tự quyết định xem nên trả lời đơn giản, hay mở công cụ, xử lý tệp, hoặc chạy một tác vụ dài.
Từ việc lựa chọn giữa Chat hay Cowork, đến việc có nên kết nối mạng, có nên "Thinking", có nên gọi công cụ hay không, ngày càng nhiều lựa chọn trước đây thuộc về người dùng đã được giao cho Claude.
Và khi mô hình được trao nhiều quyền tự chủ hơn, Anthropic càng phải đảm bảo an toàn tốt hơn.
Trong gần 2.000 kịch bản đánh giá hành vi tự động của Anthropic, Opus 5.5 đã vượt trội hơn các mô hình Claude gần đây ở hầu hết các chỉ số mất cân bằng mô hình.
Anthropic cũng đã bổ sung một bài kiểm tra mới để xem liệu mô hình có cố gắng vượt qua ranh giới được thiết lập trong môi trường thử nghiệm hay không. Kết quả cho thấy tần suất Opus 5.5 cố gắng vượt ranh giới thấp hơn khoảng 85% so với Opus 5 và Mythos 5.1. Những lần cố gắng còn lại đều ở mức độ nghiêm trọng thấp và được chính mô hình báo cáo.
Trong vài tháng qua, Anthropic đã công bố nhiều sự cố Claude vượt ra khỏi môi trường đánh giá và xâm nhập vào hệ thống thực tế trong các bài kiểm tra an ninh mạng. Với Opus 5.5, vấn đề này đã được đưa vào làm bài kiểm tra chuyên biệt trước khi phát hành mô hình.
Tuy nhiên, Anthropic cũng đã "dội một gáo nước lạnh" vào con số ấn tượng này: Opus 5.5 thường xuyên nhận thức được rằng nó đang được đánh giá.
Điều này có nghĩa là, một mô hình hoạt động "ngoan ngoãn" trong phòng thí nghiệm không đảm bảo rằng nó sẽ hoàn toàn giống như vậy trong thế giới thực. Anthropic thừa nhận rõ ràng rằng việc làm thế nào để phát hiện đáng tin cậy tất cả các hành vi thất bại trước khi mô hình được triển khai vẫn là một vấn đề chưa được giải quyết.
Vì vậy, chỉ riêng việc mô hình trở nên "nghe lời" hơn là chưa đủ, bên ngoài mô hình, cần có thêm một lớp "hàng rào bảo vệ".
Opus 5.5 là mô hình đầu tiên, ngay từ ngày ra mắt, đã áp dụng cơ chế bảo mật gần tương đương với Fable 5.1.
Các yêu cầu có rủi ro cao như an ninh mạng, nghiên cứu sinh học và chưng cất mô hình đều sẽ chịu thêm các hạn chế. Ví dụ, hầu hết các tác vụ an ninh mạng khi kích hoạt bảo vệ sẽ được chuyển một cách minh bạch sang Opus 4.8 yếu hơn. Trong lĩnh vực sinh học, các biện pháp an toàn tương đương Fable 5.1 được áp dụng trực tiếp, và chỉ các tổ chức nghiên cứu được kiểm duyệt mới có thể yêu cầu khả năng đầy đủ hơn.
Fable, bị kẹp giữa hai đầu
Trước đây, hệ thống sản phẩm của Claude khá dễ hiểu: Sonnet dành cho các tác vụ hàng ngày, Opus đảm nhiệm các tác vụ phức tạp, và Fable đẩy giới hạn khả năng lên cao hơn nữa. Các khả năng tiên tiến hơn, bị hạn chế hơn, được dành cho Mythos. Còn Haiku, một mô hình giá rẻ nhưng không mã nguồn mở, lần cập nhật gần nhất thậm chí là từ tháng 10 năm ngoái.

Tuy nhiên, với sự xuất hiện của Opus 5.5, ranh giới giữa Fable và Opus đang dần trở nên mờ nhạt.
Hướng dẫn lựa chọn mô hình cập nhật của Anthropic nêu rõ rằng, nếu nhà phát triển tìm kiếm khả năng cao nhất, họ nên bắt đầu trực tiếp với Opus 5.5, tối ưu hóa Prompt trước, sau đó tăng effort khi cần. Chỉ khi Opus 5.5 ở chế độ xhigh hoặc thậm chí max vẫn không đủ cho các tác vụ suy luận khó và tác nhân chu kỳ dài, thì mới nên cân nhắc chuyển sang Fable 5.1.
Tuy nhiên, ít nhất từ các điểm benchmark công khai hiện tại, Fable 5.1 thậm chí còn không bằng Opus 5.5 ở chế độ max, mà giá lại đắt hơn, nên việc chuyển đổi có thể không giải quyết được vấn đề.
Ngày nay, Opus 5.5 đã bắt đầu áp dụng cơ chế bảo mật gần tương đương Fable, và khả năng của nó cũng đã bắt kịp hoặc thậm chí vượt qua Fable 5.1 ở nhiều hạng mục.
Nhưng nói đi cũng phải nói lại, phân khúc Fable không hẳn là không cần thiết. Có lẽ chỉ Fable 5.1 là đang ở vị thế khó xử.
Bởi vì trên Fable còn có Mythos.
Anthropic trước đây đã tuyên bố rõ ràng rằng Fable 5.1 và Mythos 5.1 sử dụng cùng một mô hình, sự khác biệt chủ yếu nằm ở các hạn chế bảo mật và quyền truy cập. Fable có thể được sử dụng rộng rãi, trong khi Mythos chỉ dành cho các tổ chức được kiểm duyệt, với khả năng đầy đủ hơn trong các lĩnh vực rủi ro cao như an ninh mạng và khoa học đời sống.
Vì vậy, xét về cấu trúc sản phẩm, Fable ít nhất vẫn để lại cho Anthropic một phân khúc trung gian hữu ích: Opus chịu trách nhiệm cho các khả năng cao cấp, trưởng thành và được triển khai rộng rãi; Fable tiếp nhận các khả năng tiên tiến đã có thể công khai; và xa hơn nữa là Mythos, với khả năng hạn chế hơn.
Nhưng phân khúc này thực sự rất khó xử. Phía dưới, Opus liên tục vươn lên nhờ effort. Phía trên, Mythos tiếp nhận các khả năng tiên tiến hơn, bị hạn chế hơn.
Bị kẹp giữa, Fable ngày càng giống một "tấm đệm" chịu áp lực từ cả hai phía.
Tất nhiên, việc sắp xếp Fable như thế nào cuối cùng vẫn là vấn đề nội bộ của Anthropic.
Bên ngoài, OpenAI sẽ không chờ đợi họ sắp xếp ổn thỏa.
Opus 5.5 vừa mới ra mắt, OpenAI đã ngay lập tức tung ra GPT-6 Sol và Luna – một vòng chiến tranh giá cả và hiệu năng mới đã bắt đầu.
Đây không chỉ là một bản cập nhật nhỏ. Opus 5.5 đã ra mắt, và các phiên bản Sonnet 5.5 cùng Haiku 5.5 cũng sẽ sớm theo sau trong vài tuần tới. Có thể nói, chính sự cạnh tranh gay gắt từ Astra đã thúc đẩy Anthropic tăng tốc độ đổi mới. Cùng với mô hình mới, một đợt "reset" cũng được triển khai, mang lại trải nghiệm tốt hơn cho người dùng.
Fable đang ở vị thế khó xử
Khi đặt Opus 5.5 cạnh tranh trực tiếp với Astra, chúng ta cần xem xét cả về giá cả và hiệu năng.
Về giá, API của Opus 5.5 có giá 4 USD (khoảng 100.000 VNĐ) cho mỗi triệu Token đầu vào và 20 USD (khoảng 500.000 VNĐ) cho đầu ra. Trong khi đó, Astra có giá lần lượt là 10 USD (khoảng 250.000 VNĐ) và 50 USD (khoảng 1.250.000 VNĐ). Điều này có nghĩa là chi phí mỗi Token của Opus 5.5 chỉ bằng 40% so với Astra.
Cả hai mô hình đều có ngữ cảnh (context) tương đương, với Opus 5.5 hỗ trợ 1 triệu Token và Astra là 1,05 triệu Token. Khả năng xuất tối đa của cả hai đều là 128.000 Token. Opus 5.5 có dữ liệu cập nhật đến tháng 6 năm 2026, nhỉnh hơn một chút so với Astra (tháng 4 năm 2026). Cả hai đều hỗ trợ năm cấp độ cường độ suy luận, từ thấp (low) đến tối đa (max).
Đáng chú ý, Opus 5.5 còn có giá rẻ hơn so với phiên bản tiền nhiệm, Opus 5. Trước đây, Opus 5 có giá 5 USD (khoảng 125.000 VNĐ) cho đầu vào và 25 USD (khoảng 625.000 VNĐ) cho đầu ra mỗi triệu Token. Với Opus 5.5, cả hai mức giá này đều giảm 20%. Anthropic tuyên bố rằng, nhờ hiệu quả sử dụng Token được cải thiện, chi phí thực tế để hoàn thành một tác vụ điển hình có thể giảm khoảng 40% so với Opus 5, đồng thời tốc độ xuất tăng hơn 30%.
Mặc dù rẻ hơn, Opus 5.5 lại không hề "nhẹ ký" về hiệu năng.
Trong sáu hạng mục so sánh được Anthropic công bố, Opus 5.5 đã giành chiến thắng ở bốn hạng mục, cho thấy hiệu suất vượt trội. Astra dẫn đầu ở hai hạng mục, trong khi Fable 5.1 không giành được bất kỳ hạng mục nào và đã trở thành phiên bản "lỗi thời".
Đặc biệt, trong các khả năng về lập trình (Coding) và tác nhân (Agent) mà Anthropic rất chú trọng, Opus 5.5 đã có bước nhảy vọt ấn tượng. Điểm số trên Terminal-Bench 4.0 tăng từ 57,9% của Astra lên 66,4%. Trên FrontierCode, Opus 5.5 đạt 54,4%, vượt qua 53,3% của Astra.
Tuy nhiên, Astra vẫn giữ vững lợi thế ở một số lĩnh vực. Trong tác vụ quy trình làm việc đa ứng dụng AutomationBench, Astra dẫn trước với 41,4% so với 40,0% của Opus 5.5. Trong bài kiểm tra tác nhân khoa học Terminal-Bench-Science, Astra cũng vượt trội với 64,6% so với 58,7%.
Ngoài ra, trong hai bài kiểm tra không có kết quả của Astra, Opus 5.5 cũng tiếp tục vượt qua Fable 5.1. Khả năng sử dụng máy tính (Computer Use) tăng từ 80,7% lên 81,8%, và khả năng nhận diện biểu đồ hình ảnh tăng từ 88,4% lên 89,0%.
Điều này cho thấy, ít nhất trong bảng so sánh của Anthropic, Fable 5.1 gần như không còn giữ được vị thế nào trước Opus 5.5.
Chuyển sang đánh giá độc lập từ bên thứ ba, tổ chức Artificial Analysis đã hoàn thành thử nghiệm Opus 5.5.
Trong chỉ số Intelligence Index mới nhất, Opus 5.5 đạt điểm cao nhất là 58 điểm (ở chế độ max), trong khi Astra và Fable 5.1 đều đạt 53 điểm.
Tuy nhiên, có một chi tiết thú vị: khi hoạt động ở chế độ max, Opus 5.5 tiêu thụ rất nhiều Token. Theo kết quả đo lường của Artificial Analysis, ở chế độ max effort, Opus 5.5 tạo ra trung bình khoảng 119.000 Token cho mỗi tác vụ, trong khi Astra chỉ khoảng 27.000 Token.
Do đó, dù giá mỗi Token của Opus 5.5 chỉ bằng 40% so với Astra, nhưng khi sử dụng chế độ max effort, chi phí cho một tác vụ đơn lẻ lại lên tới 5,98 USD (khoảng 149.500 VNĐ), trong khi Astra chỉ tốn 3,26 USD (khoảng 81.500 VNĐ).
Tuy nhiên, khi quay về chế độ mặc định (medium), tình hình khả quan hơn nhiều. Opus 5.5 đạt 51 điểm và tốn 1,34 USD (khoảng 33.500 VNĐ) cho mỗi tác vụ. Astra đạt 50 điểm và tốn 1,54 USD (khoảng 38.500 VNĐ). Fable 5.1 đạt 49 điểm và tốn 2,98 USD (khoảng 74.500 VNĐ).
Nhìn chung, Anthropic đã thành công đưa Opus vào phân khúc hiệu năng cao nhất của Astra và Fable với mức giá chỉ bằng 40%.
Hiện tại, Opus 5.5 đã được triển khai trên tất cả các nền tảng.
Người dùng thông thường có thể sử dụng trực tiếp trong Claude, còn các nhà phát triển có thể truy cập thông qua Claude Code và API với ID mô hình là claude-opus-5-5. Các dịch vụ đám mây lớn như AWS, Google Cloud và Microsoft Azure cũng đã cung cấp mô hình này.
Anthropic cũng đã tăng giới hạn sử dụng 5 giờ cho người dùng Pro, Max, Team và Enterprise (tính phí theo chỗ ngồi), đồng thời cung cấp một lần reset.
Vị thế của Fable hiện tại trở nên khá khó xử. Đặc biệt là Fable 5.1, chỉ mới ra mắt vào ngày 1 tháng 9 và chỉ giữ vị trí cao nhất trong vỏn vẹn ba tuần. Sau một chu kỳ cập nhật nhanh chóng, Opus đã bất ngờ vươn lên, "bao vây" Fable từ cả hai phía về hiệu năng và giá cả, đẩy "người anh cả" của mình vào tình thế khó khăn. Liệu Fable có còn cần thiết nữa không?
Ít "mùi AI" hơn, nhiều quyền tự chủ hơn
Điểm số benchmark chỉ là một thước đo trực quan. Hãy cùng xem xét những thay đổi "thực tế" hơn.
Anthropic đã thực hiện một quá trình "khử mùi Claude" cho văn bản do Opus 5.5 tạo ra.
Theo phản hồi từ người dùng sau khi Opus 5 ra mắt, nhiều người cho rằng văn bản do mô hình này tạo ra quá dài dòng, khó đọc và rườm rà. Vì vậy, Opus 5.5 đã được điều chỉnh phong cách viết: thông tin quan trọng được ưu tiên đặt lên đầu, giảm thiểu thuật ngữ chuyên ngành và những cách diễn đạt đặc trưng "kỳ lạ" của Claude, đồng thời tuân thủ nghiêm ngặt hơn các quy tắc viết mà người dùng đưa ra.
Hiệu quả của sự thay đổi này khá rõ rệt. Một kỹ sư từ Ramp chia sẻ rằng trước đây anh rất khó chịu với những văn bản "dài và khó đọc" từ các mô hình tiên tiến, và Opus 5.5 cuối cùng đã giải quyết được vấn đề này.
Điều thú vị là, dù Opus 5.5 "nghe lời" hơn trong cách diễn đạt, nhưng trong hành vi cốt lõi, nó lại trở nên ít "nghe lời" hơn.
Ví dụ, tính năng "Thinking" (suy nghĩ) giờ đây không thể tắt hoàn toàn được nữa.
Opus 5 trước đây mặc định bật Adaptive Thinking (suy nghĩ thích ứng), nhưng ở các cấp độ high trở xuống, nhà phát triển vẫn có thể tắt nó thủ công. Với Opus 5.5, tùy chọn tắt này đã biến mất.
Mỗi lần trả lời, mô hình sẽ luôn thực hiện Adaptive Thinking. Người dùng chỉ có thể kiểm soát mức độ suy nghĩ của nó (low, medium, high, xhigh và max), chứ không thể yêu cầu nó "đừng suy nghĩ nữa, hãy trả lời trực tiếp". Cấp độ mặc định của Opus 5.5 cũng được hạ từ high của Opus 5 xuống medium.
Việc gọi công cụ cũng có những thay đổi tương tự.
Trước đây, nhà phát triển có thể sử dụng tool_choice trong API để buộc Claude "phải gọi một công cụ cụ thể trong lượt này" hoặc "phải chọn một trong số các công cụ này".
Opus 5.5 đã loại bỏ cơ chế gọi công cụ bắt buộc này, chỉ còn lại hai tùy chọn: auto và none. Tức là, hoặc giao quyền quyết định cho Claude xem có nên sử dụng công cụ nào hay không, hoặc hoàn toàn không cho phép nó sử dụng công cụ. Nếu muốn nó phải gọi một công cụ cụ thể, bạn chỉ có thể hướng dẫn nó thông qua prompt, chứ không thể ép buộc từ cấp độ API nữa.
Tất nhiên, điều này không có nghĩa là nhà phát triển hoàn toàn mất khả năng kiểm soát. Định dạng JSON nghiêm ngặt vẫn có thể được đảm bảo thông qua strict tool use, và structured outputs cũng có thể được sử dụng. Nhưng ít nhất trong việc gọi công cụ, Anthropic đang trao nhiều quyền phán đoán hơn cho chính mô hình.
Điều này càng trở nên thú vị khi xem xét các động thái sản phẩm gần đây của Anthropic. Chỉ sáu ngày trước, Anthropic đã hợp nhất Chat và Cowork của Claude thành một điểm truy cập duy nhất.
Người dùng chỉ cần nói mình muốn gì, Claude sẽ tự quyết định xem nên trả lời đơn giản, hay mở công cụ, xử lý tệp, hoặc chạy một tác vụ dài.
Từ việc lựa chọn giữa Chat hay Cowork, đến việc có nên kết nối mạng, có nên "Thinking", có nên gọi công cụ hay không, ngày càng nhiều lựa chọn trước đây thuộc về người dùng đã được giao cho Claude.
Và khi mô hình được trao nhiều quyền tự chủ hơn, Anthropic càng phải đảm bảo an toàn tốt hơn.
Trong gần 2.000 kịch bản đánh giá hành vi tự động của Anthropic, Opus 5.5 đã vượt trội hơn các mô hình Claude gần đây ở hầu hết các chỉ số mất cân bằng mô hình.
Anthropic cũng đã bổ sung một bài kiểm tra mới để xem liệu mô hình có cố gắng vượt qua ranh giới được thiết lập trong môi trường thử nghiệm hay không. Kết quả cho thấy tần suất Opus 5.5 cố gắng vượt ranh giới thấp hơn khoảng 85% so với Opus 5 và Mythos 5.1. Những lần cố gắng còn lại đều ở mức độ nghiêm trọng thấp và được chính mô hình báo cáo.
Trong vài tháng qua, Anthropic đã công bố nhiều sự cố Claude vượt ra khỏi môi trường đánh giá và xâm nhập vào hệ thống thực tế trong các bài kiểm tra an ninh mạng. Với Opus 5.5, vấn đề này đã được đưa vào làm bài kiểm tra chuyên biệt trước khi phát hành mô hình.
Tuy nhiên, Anthropic cũng đã "dội một gáo nước lạnh" vào con số ấn tượng này: Opus 5.5 thường xuyên nhận thức được rằng nó đang được đánh giá.
Điều này có nghĩa là, một mô hình hoạt động "ngoan ngoãn" trong phòng thí nghiệm không đảm bảo rằng nó sẽ hoàn toàn giống như vậy trong thế giới thực. Anthropic thừa nhận rõ ràng rằng việc làm thế nào để phát hiện đáng tin cậy tất cả các hành vi thất bại trước khi mô hình được triển khai vẫn là một vấn đề chưa được giải quyết.
Vì vậy, chỉ riêng việc mô hình trở nên "nghe lời" hơn là chưa đủ, bên ngoài mô hình, cần có thêm một lớp "hàng rào bảo vệ".
Opus 5.5 là mô hình đầu tiên, ngay từ ngày ra mắt, đã áp dụng cơ chế bảo mật gần tương đương với Fable 5.1.
Các yêu cầu có rủi ro cao như an ninh mạng, nghiên cứu sinh học và chưng cất mô hình đều sẽ chịu thêm các hạn chế. Ví dụ, hầu hết các tác vụ an ninh mạng khi kích hoạt bảo vệ sẽ được chuyển một cách minh bạch sang Opus 4.8 yếu hơn. Trong lĩnh vực sinh học, các biện pháp an toàn tương đương Fable 5.1 được áp dụng trực tiếp, và chỉ các tổ chức nghiên cứu được kiểm duyệt mới có thể yêu cầu khả năng đầy đủ hơn.
Fable, bị kẹp giữa hai đầu
Trước đây, hệ thống sản phẩm của Claude khá dễ hiểu: Sonnet dành cho các tác vụ hàng ngày, Opus đảm nhiệm các tác vụ phức tạp, và Fable đẩy giới hạn khả năng lên cao hơn nữa. Các khả năng tiên tiến hơn, bị hạn chế hơn, được dành cho Mythos. Còn Haiku, một mô hình giá rẻ nhưng không mã nguồn mở, lần cập nhật gần nhất thậm chí là từ tháng 10 năm ngoái.

Tuy nhiên, với sự xuất hiện của Opus 5.5, ranh giới giữa Fable và Opus đang dần trở nên mờ nhạt.
Hướng dẫn lựa chọn mô hình cập nhật của Anthropic nêu rõ rằng, nếu nhà phát triển tìm kiếm khả năng cao nhất, họ nên bắt đầu trực tiếp với Opus 5.5, tối ưu hóa Prompt trước, sau đó tăng effort khi cần. Chỉ khi Opus 5.5 ở chế độ xhigh hoặc thậm chí max vẫn không đủ cho các tác vụ suy luận khó và tác nhân chu kỳ dài, thì mới nên cân nhắc chuyển sang Fable 5.1.
Tuy nhiên, ít nhất từ các điểm benchmark công khai hiện tại, Fable 5.1 thậm chí còn không bằng Opus 5.5 ở chế độ max, mà giá lại đắt hơn, nên việc chuyển đổi có thể không giải quyết được vấn đề.
Ngày nay, Opus 5.5 đã bắt đầu áp dụng cơ chế bảo mật gần tương đương Fable, và khả năng của nó cũng đã bắt kịp hoặc thậm chí vượt qua Fable 5.1 ở nhiều hạng mục.
Nhưng nói đi cũng phải nói lại, phân khúc Fable không hẳn là không cần thiết. Có lẽ chỉ Fable 5.1 là đang ở vị thế khó xử.
Bởi vì trên Fable còn có Mythos.
Anthropic trước đây đã tuyên bố rõ ràng rằng Fable 5.1 và Mythos 5.1 sử dụng cùng một mô hình, sự khác biệt chủ yếu nằm ở các hạn chế bảo mật và quyền truy cập. Fable có thể được sử dụng rộng rãi, trong khi Mythos chỉ dành cho các tổ chức được kiểm duyệt, với khả năng đầy đủ hơn trong các lĩnh vực rủi ro cao như an ninh mạng và khoa học đời sống.
Vì vậy, xét về cấu trúc sản phẩm, Fable ít nhất vẫn để lại cho Anthropic một phân khúc trung gian hữu ích: Opus chịu trách nhiệm cho các khả năng cao cấp, trưởng thành và được triển khai rộng rãi; Fable tiếp nhận các khả năng tiên tiến đã có thể công khai; và xa hơn nữa là Mythos, với khả năng hạn chế hơn.
Nhưng phân khúc này thực sự rất khó xử. Phía dưới, Opus liên tục vươn lên nhờ effort. Phía trên, Mythos tiếp nhận các khả năng tiên tiến hơn, bị hạn chế hơn.
Bị kẹp giữa, Fable ngày càng giống một "tấm đệm" chịu áp lực từ cả hai phía.
Tất nhiên, việc sắp xếp Fable như thế nào cuối cùng vẫn là vấn đề nội bộ của Anthropic.
Bên ngoài, OpenAI sẽ không chờ đợi họ sắp xếp ổn thỏa.
Opus 5.5 vừa mới ra mắt, OpenAI đã ngay lập tức tung ra GPT-6 Sol và Luna – một vòng chiến tranh giá cả và hiệu năng mới đã bắt đầu.