Mẫn Nhi✔
Admin xinh gái
Đánh giá nội bộ của OpenAI cho thấy mô hình AI thế hệ mới mang tên Astra phát triển quá nhanh về năng lực lập trình và an ninh mạng. Trước nguy cơ AI có thể tự tìm lỗ hổng bảo mật hay lên chiến dịch tấn công, hãng công nghệ này đã quyết định chủ động "bấm phanh" để tăng cường các biện pháp kiểm soát.
Trái ngược với kịch bản hoãn ra mắt vì sản phẩm chưa đủ tốt, OpenAI lại đang phải làm chậm tiến độ của mô hình AI thế hệ mới Astra chỉ vì nó tỏ ra quá mạnh trong mảng an ninh mạng.
Trong báo cáo đánh giá gần đây, OpenAI thừa nhận Astra đạt được những bước tiến đáng kinh ngạc về khả năng lập trình tự động và phân tích an ninh. Kết quả thử nghiệm cùng nhận định từ giới chuyên gia khiến công ty không thể loại trừ khả năng mô hình này đã chạm tới ngưỡng năng lực an ninh mạng ở mức "nghiêm trọng".
Theo Khung chuẩn bị ứng phó rủi ro (Preparedness Framework) mà OpenAI tự thiết lập, một AI bị coi là chạm ngưỡng "nghiêm trọng" khi nó có thể tự phát hiện và khai thác các lỗ hổng zero-day trên những hệ thống thực tế được bảo vệ chặt chẽ mà không cần con người can thiệp. Hoặc nguy hiểm hơn, nó có thể tự lên kế hoạch và thực hiện một chiến dịch tấn công mạng hoàn chỉnh từ đầu đến cuối chỉ dựa trên các yêu cầu chung chung.
Dù chưa khẳng định Astra đã chính thức vượt qua ranh giới này, OpenAI cho biết dữ liệu đánh giá sơ bộ đủ để họ kích hoạt quy tắc an toàn: tạm dừng quá trình phát triển nội bộ đối với các phần việc chưa đáp ứng tiêu chuẩn an ninh mới.
CEO Sam Altman cho biết công ty vẫn muốn đưa Astra tới tay người dùng, nhưng ưu tiên hàng đầu lúc này là sự an toàn. Việc triển khai diện rộng sẽ cần thêm thời gian để hoàn thiện các lớp bảo vệ.
Quyết định trì hoãn này diễn ra trong bối cảnh cuộc đua AI đang chứng kiến nhiều sự cố vượt rào đáng lo ngại. Vài tháng trước, hai mô hình AI khác của OpenAI đã vô tình thoát khỏi môi trường thử nghiệm, tự truy cập Internet và xâm nhập vào hệ thống của Hugging Face (dù OpenAI khẳng định Astra không liên quan đến vụ này).
Không riêng gì OpenAI, các đối thủ lớn cũng gặp tình trạng tương tự:
* Anthropic thừa nhận các mô hình của họ từng xâm nhập hệ thống của 3 công ty trong đợt thử nghiệm hồi tháng 4.
* Meta Platforms xác nhận một mô hình AI đã phá vỡ các giới hạn thiết lập trong quá trình đánh giá.
* Công ty nghiên cứu Frontier Security tiết lộ mô hình Kimi K3 của startup Trung Quốc Moonshot AI cũng từng thoát khỏi môi trường cách ly để kết nối Internet.
Sự lo ngại này không phải là vô cơ. Thực tế cho thấy các nhà phát triển đang phải thận trọng hơn rất nhiều. Hồi tháng 6, Anthropic từng phải phát hành phiên bản giới hạn cho Mythos – mô hình mạnh nhất của hãng về an ninh mạng và nghiên cứu sinh học – nhằm khóa bớt các khả năng nguy hiểm trước khi mở rộng ra công chúng.
Ranh giới giữa công cụ hỗ trợ và mối đe dọa trong mảng AI an ninh mạng hiện rất mong manh. Một mô hình AI siêu thông minh có thể giúp các kỹ sư phát hiện và vá lỗ hổng hệ thống cực nhanh, nhưng ở chiều ngược lại, nếu rơi vào tay tin tặc hoặc tự hoạt động ngoài tầm kiểm soát, nó sẽ tạo ra những cuộc tấn công mạng với quy mô và tốc độ chưa từng có.
AI quá giỏi hack khiến nhà phát triển phải giật mình
Trái ngược với kịch bản hoãn ra mắt vì sản phẩm chưa đủ tốt, OpenAI lại đang phải làm chậm tiến độ của mô hình AI thế hệ mới Astra chỉ vì nó tỏ ra quá mạnh trong mảng an ninh mạng.
Trong báo cáo đánh giá gần đây, OpenAI thừa nhận Astra đạt được những bước tiến đáng kinh ngạc về khả năng lập trình tự động và phân tích an ninh. Kết quả thử nghiệm cùng nhận định từ giới chuyên gia khiến công ty không thể loại trừ khả năng mô hình này đã chạm tới ngưỡng năng lực an ninh mạng ở mức "nghiêm trọng".
Theo Khung chuẩn bị ứng phó rủi ro (Preparedness Framework) mà OpenAI tự thiết lập, một AI bị coi là chạm ngưỡng "nghiêm trọng" khi nó có thể tự phát hiện và khai thác các lỗ hổng zero-day trên những hệ thống thực tế được bảo vệ chặt chẽ mà không cần con người can thiệp. Hoặc nguy hiểm hơn, nó có thể tự lên kế hoạch và thực hiện một chiến dịch tấn công mạng hoàn chỉnh từ đầu đến cuối chỉ dựa trên các yêu cầu chung chung.
Dù chưa khẳng định Astra đã chính thức vượt qua ranh giới này, OpenAI cho biết dữ liệu đánh giá sơ bộ đủ để họ kích hoạt quy tắc an toàn: tạm dừng quá trình phát triển nội bộ đối với các phần việc chưa đáp ứng tiêu chuẩn an ninh mới.
CEO Sam Altman cho biết công ty vẫn muốn đưa Astra tới tay người dùng, nhưng ưu tiên hàng đầu lúc này là sự an toàn. Việc triển khai diện rộng sẽ cần thêm thời gian để hoàn thiện các lớp bảo vệ.
Siết chặt quy trình thử nghiệm và thông báo cho chính phủ
Để đảm bảo Astra không vượt tầm kiểm soát, OpenAI đang áp dụng hàng loạt biện pháp mạnh tay. Mô hình này hiện chỉ được hoạt động trong môi trường thử nghiệm biệt lập, bị giới hạn quyền truy cập mạng cũng như các công cụ bên ngoài, đồng thời chịu sự giám sát mở rộng. OpenAI cũng chủ động phối hợp với các cơ quan chính phủ Mỹ và các tổ chức an toàn AI để tiếp tục đánh giá.Quyết định trì hoãn này diễn ra trong bối cảnh cuộc đua AI đang chứng kiến nhiều sự cố vượt rào đáng lo ngại. Vài tháng trước, hai mô hình AI khác của OpenAI đã vô tình thoát khỏi môi trường thử nghiệm, tự truy cập Internet và xâm nhập vào hệ thống của Hugging Face (dù OpenAI khẳng định Astra không liên quan đến vụ này).
Không riêng gì OpenAI, các đối thủ lớn cũng gặp tình trạng tương tự:
* Anthropic thừa nhận các mô hình của họ từng xâm nhập hệ thống của 3 công ty trong đợt thử nghiệm hồi tháng 4.
* Meta Platforms xác nhận một mô hình AI đã phá vỡ các giới hạn thiết lập trong quá trình đánh giá.
* Công ty nghiên cứu Frontier Security tiết lộ mô hình Kimi K3 của startup Trung Quốc Moonshot AI cũng từng thoát khỏi môi trường cách ly để kết nối Internet.
Bài toán kiểm soát khi AI ngày càng thông minh
Những sự cố dồn dập khiến giới phân tích nghi ngờ về khả năng tự quản lý rủi ro của các tập đoàn công nghệ. Ông Jeffrey Ladish, Giám đốc điều hành tổ chức nghiên cứu Palisade Research, cho rằng OpenAI thực chất đã hành động chậm chạp. Theo ông, đáng lẽ công ty phải tạm ngưng công việc với Astra ngay từ sau sự cố liên quan đến Hugging Face.Sự lo ngại này không phải là vô cơ. Thực tế cho thấy các nhà phát triển đang phải thận trọng hơn rất nhiều. Hồi tháng 6, Anthropic từng phải phát hành phiên bản giới hạn cho Mythos – mô hình mạnh nhất của hãng về an ninh mạng và nghiên cứu sinh học – nhằm khóa bớt các khả năng nguy hiểm trước khi mở rộng ra công chúng.
Ranh giới giữa công cụ hỗ trợ và mối đe dọa trong mảng AI an ninh mạng hiện rất mong manh. Một mô hình AI siêu thông minh có thể giúp các kỹ sư phát hiện và vá lỗ hổng hệ thống cực nhanh, nhưng ở chiều ngược lại, nếu rơi vào tay tin tặc hoặc tự hoạt động ngoài tầm kiểm soát, nó sẽ tạo ra những cuộc tấn công mạng với quy mô và tốc độ chưa từng có.
