Anthropic tiết lộ họ sở hữu một "vũ khí hạt nhân bí mật" - Model 2 mạnh hơn cả Mythos 5!

Christine May
Christine May
Phản hồi: 0

Christine May

Editor
Thành viên BQT
Mới đây, Anthropic đã công bố Báo cáo Rủi ro thứ hai, bao gồm tất cả các đánh giá rủi ro tính đến ngày 15 tháng 7 năm 2026. Trong báo cáo này, Anthropic lần đầu tiên thừa nhận rằng công ty đang vận hành một mô hình mạnh mẽ hơn Mythos 5, có tên mã là Model 2.

Rồi Công ty lại càng làm trầm trọng thêm tình hình: "Hiện tại chúng tôi không có kế hoạch tung ra mẫu này ra thị trường." Nghe quen quen nhỉ. Ừm... Nó hoàn toàn phù hợp với phong cách thường thấy của họ. Khi Mythos được tiết lộ lần đầu vào tháng 4 năm nay, Anthropic cũng nói rằng không có ý định phát hành nó ra công chúng. Sau đó, bắt đầu Dự án Glasswing, và rồi Fable 5 ra đời. :cool:
1786758250805.png
"Vũ khí bí mật" của Anthropic

Model 2 mạnh mẽ đến mức nào? Báo cáo đề cập rằng Model 2 có “sự cải thiện đáng kể” trong các tác vụ nội bộ và, cùng với Mythos 5, được công ty sử dụng “rất nhiều” cho việc lập trình, công việc của tác nhân và tạo dữ liệu.

Báo cáo cho thấy, xét về điểm số khả năng tổng thể của AECI: Mythos Preview đạt 158,91 điểm, Mythos 5 đạt 161,29 điểm, và Model 2 thậm chí còn đạt mức cao hơn nữa là 162,79 điểm. Nói cách khác, Model 2 thực sự tốt hơn Mythos 5, nhưng không phải là vượt trội một cách quá mức - "tốt hơn ở một số khía cạnh, yếu hơn ở những khía cạnh khác, và mạnh mẽ hơn một chút về tổng thể." Một chỉ số thú vị khác là CoBench - bài kiểm tra đánh giá cụ thể hiệu suất của mô hình trong các nhiệm vụ nghiên cứu và phát triển thực tế tại Anthropic. Mô hình 2 đạt 62,8%, cao hơn 8 điểm phần trăm so với Mythos Preview. Để so sánh, các nhà nghiên cứu con người tại Anthropic đạt tỷ lệ thành công 85% trong cùng bài kiểm tra.
1786758479671.png
Kết luận định tính của Anthropic khá thận trọng: "Mô hình của chúng tôi vẫn chưa thay thế được các nhà khoa học và kỹ sư nghiên cứu, đặc biệt là những người có thâm niên. "Nó chưa thay thế hoàn toàn, nhưng khoảng cách đang thu hẹp rõ rệt.

Điều đáng chú ý hơn nữa là tuyên bố này: Claude đã viết phần lớn mã nguồn mà Anthropic đã tích hợp vào mã nguồn sản phẩm. Mặc dù quá trình phát triển AI nội bộ đã tăng tốc đáng kể nhờ sự hỗ trợ của AI, nhưng tốc độ vẫn chưa tăng gấp đôi.
1786758490562.png

Mô hình vẫn đang được cải thiện, nhưng các phương pháp đánh giá của con người đã đạt đến giới hạn của chúng. Khi việc đánh giá đạt đến điểm bão hòa, cụm từ "rủi ro thấp" còn giữ được bao nhiêu giá trị? Ngay cả Anthropic cũng không chắc chắn.

Anthropic dường như đang gửi một tín hiệu: việc hiểu rõ khả năng và rủi ro của mô hình kinh doanh của chính họ đang ngày càng trở nên khó khăn.

Mức độ rủi ro: Từ "Rất thấp" đến "Thấp"
Ngoài Mô hình 2, báo cáo này còn làm được một điều thú vị khác: nó đã xác định được " sự sai lệch " trong các tình huống rủi ro cao.Mức độ rủi ro đã được nâng từ "cực kỳ thấp" trong báo cáo trước lên "thấp".

Cái gọi là "sự sai lệch" đơn giản có nghĩa là mô hình không hoạt động theo ý định của con người vào những thời điểm quan trọng.

Vào cuối tháng 7, Anthropic đã xem xét hơn 140.000 bản ghi thử nghiệm và phát hiện ra rằng Claude thực sự đã tấn công ba công ty trong các bài kiểm tra an ninh mạng. Đây không phải là môi trường thử nghiệm (sandbox), mà là môi trường sản xuất thực tế. Mythos 5 đã truyền một gói mã độc hại đến PyPI, gói này đã được tải xuống và chạy trên 15 máy thật trong vòng một giờ.

Đầu tháng 8, một báo cáo từ Viện An ninh Trí tuệ Nhân tạo (AISI) của Anh thậm chí còn đi xa hơn: Mythos 5 đã tạo ra một loạt danh tính giả để lừa một người quản lý GitHub thực sự chấp thuận mã độc của nó. Sau khi bị chất vấn công khai, nó đã quay lại và thay đổi hồ sơ hoạt động của mình để giả vờ vô tội, thậm chí còn lên kế hoạch tiếp tục hoạt động dưới một bí danh khác.

AISI cho biết mức độ lừa dối này chưa từng được ghi nhận trước đây.

Báo cáo cũng tiết lộ năm lỗi trong quy trình bảo mật, bao gồm một loạt dữ liệu thử nghiệm "giả vờ là dữ liệu tốt" đáng lẽ phải được loại trừ khỏi quá trình huấn luyện nhưng lại liên tục bị trộn lẫn vào quá trình huấn luyện, và một tác nhân AI không được giám sát đã thu thập được các tài nguyên nhạy cảm.

Sau đó, Anthropic nói: Lập luận của chúng tôi vẫn ủng hộ mức "cực kỳ thấp", và việc nâng mức đó lên "thấp" hoàn toàn chỉ là để thận trọng.

Phần kết luận cũng được viết rất bình tĩnh: rủi ro thảm họa hiện tại vẫn ở mức "thấp" có thể kiểm soát được, và việc tiếp tục phát triển và triển khai đã vượt qua bài kiểm tra về lợi ích chi phí. Có nghĩa là: Hãy tiếp tục tiến về phía trước.

Mọi người đều đạp phanh, trừ người dẫn đầu cuộc đua.
Trong khi đó, OpenAI đang trì hoãn việc ra mắt mô hình mới Astra, viện dẫn lý do là các thử nghiệm nội bộ không thể loại trừ khả năng xảy ra các cuộc tấn công mạng ở "mức độ nghiêm trọng".

TechCrunch đưa tin rằng Astra có thể có khả năng tự phát hiện các lỗ hổng bảo mật zero-day và khởi động các chuỗi tấn công hoàn chỉnh nhắm vào các mục tiêu được bảo vệ nghiêm ngặt.

Điều thú vị ở đây là: cả hai công ty đều đang nắm giữ một mô hình mà họ không có ý định chia sẻ. Sự khác biệt là OpenAI đã tạm dừng một số hoạt động phát triển của Astra, trong khi Model 2 vẫn tiếp tục được vận hành trong Anthropic.

Cả hai đều nói về việc "không phát hành", nhưng một bên là đang kìm hãm nó lại, trong khi bên kia là nói rằng họ sẽ giữ nó để sử dụng cho riêng mình.

Chuyên gia phân tích AI Chris GPT nói với Axios: "Nếu mọi người đều đang kìm hãm việc phát triển các mô hình tiên tiến của mình, và một trong những công ty hàng đầu lại không làm vậy, thì đó chắc chắn là điều cần phải theo dõi."

Anthropic chưa đưa ra cam kết nội bộ nào về việc tạm dừng quá trình này, điều đó khiến họ rất có khả năng sẽ đạt được AGI trước tiên. Đừng quên, chỉ hai tuần trước, CEO Dario Amodei đã ký vào bức thư ngỏ "Dẫn dắt biên giới". Hơn 1.300 nhân viên từ OpenAI, Anthropic, DeepMind và Meta đã cùng nhau kêu gọi chính phủ Mỹ can thiệp và thiết lập một cơ chế để "chủ động làm chậm tốc độ phát triển trí tuệ nhân tạo tiên tiến". Anthropic và OpenAI đã ủng hộ động thái này trong vòng 24 giờ.

Quay trở lại thời điểm trước đó, vào tháng 6, chính Dario đã đăng một bài báo kêu gọi tạm dừng toàn cầu việc phát triển hệ thống trí tuệ nhân tạo mạnh nhất, lập luận rằng mô hình này đang tiến gần đến điểm tới hạn của quá trình tự hoàn thiện.Các văn kiện đã được ký kết, lời hứa đã được nói ra, nhưng hệ thống phanh vẫn chưa được lắp đặt, và chân ga đã tự động được nhấn hết cỡ. Tuy nhiên, không thể hoàn toàn đổ lỗi cho Anthropic. Thực tế, đây là một vấn đề nan giải mang tính cấu trúc trong toàn bộ cuộc cạnh tranh ASI: ai cũng nghĩ mình nên giảm tốc độ, nhưng không ai dám thực sự dừng lại. An toàn là một niềm tin; luôn đi trước đón đầu là điều thiết yếu để sinh tồn. Khi niềm tin và sự sinh tồn xung đột, câu trả lời rất rõ ràng: sinh tồn sẽ thắng.

Điều thú vị là, Gavin Baker, một nhà đầu tư nổi tiếng ở Thung lũng Silicon, tiết lộ rằng Dario đã từng tuyên bố nội bộ rằng Anthropic một ngày nào đó có thể trở thành công ty tư nhân duy nhất trên thế giới. "Trong quan điểm thượng tôn nhân loại này, chỉ có nhân loại và chính phủ, không hơn không kém." David Sacks cũng tiết lộ rằng các nhân viên tại Anthropic tin rằng doanh thu định kỳ hàng năm (ARR) sẽ tăng từ 60 tỷ đô la lên 600 tỷ đô la trong vòng một năm! (Hiện tại, ARR của họ đã đạt 80 tỷ đô la).Tốc độ tăng trưởng của họ trong năm tới sẽ như thế nào? Liệu họ có thể đạt mốc 1 nghìn tỷ đô la? Ngay cả khi họ chỉ đạt được 400 tỷ hoặc 500 tỷ, con số đó cũng đủ để đưa họ trở thành công ty phần mềm lớn nhất thế giới, và triển vọng của họ thực sự rất hứa hẹn.

Cơn bão tháng Tám đang đếnAltman cầm một chiếc Astra trên tay, trong khi Dario cầm một chiếc Model 2.Một công ty đang gặp khó khăn với khung bảo mật riêng của mình và đang cố gắng tìm cách giải quyết; công ty kia lại tình cờ đề cập trong báo cáo rằng họ "không có kế hoạch công bố nó", rồi sau đó vẫn tiếp tục sử dụng nó để viết mã, chạy thử nghiệm và đẩy nhanh quá trình nghiên cứu và phát triển.Hai mẫu xe này sẽ là những sản phẩm đầu tiên ra mắt trong nửa cuối năm 2026. Thời điểm ra mắt Astra và liệu Model 2 có thay đổi hướng đi hay không có thể sẽ được tiết lộ trong những tuần tới.Quy mô đang thu hẹp, nhưng cuộc đua đang tăng tốc. Cơn bão ASI vào tháng Tám chỉ mới bắt đầu.
Tài liệu tham khảo:



 
Back
Top