Trường Sơn✔
Writer
Vào ngày 1 tháng 9 theo giờ địa phương, OpenAI thông báo rằng họ có kế hoạch phát hành mô hình trí tuệ nhân tạo (AI) thế hệ tiếp theo, Astra, "càng sớm càng tốt". Tuy nhiên, vì Astra là mô hình AI đầu tiên đạt đến ngưỡng khả năng an ninh mạng "Quan trọng", công ty sẽ hạn chế việc sử dụng nó.
OpenAI cho biết mô hình trí tuệ nhân tạo thế hệ mới của họ, Astra, có khả năng phát hiện các lỗ hổng bảo mật chưa từng được biết đến trước đây và khai thác chúng để thực hiện các cuộc tấn công mà không cần sự hướng dẫn của con người.
Dựa trên kết quả thử nghiệm hiện tại, khả năng tấn công mạng của Astra đã khá xuất sắc. OpenAI tuyên bố rằng Astra đã đạt điểm tuyệt đối trong bài kiểm tra ExploitBench, chủ yếu được sử dụng để đánh giá khả năng của các mô hình ngôn ngữ lớn trong việc khai thác các lỗ hổng hệ thống đã biết. Trong một phiên bản cải tiến của bài kiểm tra do các kỹ sư của OpenAI thiết kế, Astra đã phát hiện và khai thác thành công hai "lỗ hổng zero-day" chưa từng được biết đến trước đây (tức là các lỗ hổng bảo mật tồn tại trong phần mềm hoặc phần cứng đã bị khai thác một cách độc hại trước khi các bản vá chính thức được phát hành).
Theo "Khung chuẩn bị" nội bộ của OpenAI, Astra đã đạt được mức độ năng lực an ninh mạng cao nhất.
Khung đánh giá này, được ra mắt vào năm 2023, được sử dụng để đánh giá các rủi ro nghiêm trọng mà khả năng trí tuệ nhân tạo tiên tiến có thể gây ra. Khi khung đánh giá được cập nhật vào năm ngoái, OpenAI đã chia khả năng an ninh mạng thành các cấp độ khác nhau, trong đó "cao" có nghĩa là trí tuệ nhân tạo có thể khuếch đại các con đường gây hại nghiêm trọng hiện có, trong khi đạt đến ngưỡng "nguy hiểm" có nghĩa là trí tuệ nhân tạo có thể mở ra "những con đường gây hại mới chưa từng có".
Các đánh giá trước đây của OpenAI về GPT-5.6 Sol và GPT-5.6-Cyber, được thiết kế đặc biệt cho an ninh mạng, chỉ đạt mức "cao". Tuy nhiên, việc Astra đạt đến ngưỡng "nghiêm trọng" có nghĩa là khả năng an ninh mạng của AI đang chuyển từ "hỗ trợ con người tìm kiếm lỗ hổng" sang "tự động phát hiện lỗ hổng và thực hiện các cuộc tấn công".
Tuy nhiên, OpenAI vẫn có kế hoạch phát hành Astra “càng sớm càng tốt”, nhưng các khả năng an ninh mạng tiên tiến của nó sẽ không được công khai hoàn toàn, và việc truy cập sẽ phải tuân theo các hạn chế nghiêm ngặt hơn.
Công ty cho biết các tính năng an ninh mạng tiên tiến của mô hình Astra ban đầu sẽ được cung cấp cho một nhóm người thử nghiệm được chọn lọc, và sau đó sẽ được mở rộng cho các ứng dụng phòng thủ thông qua nền tảng Daybreak của Liên minh An ninh mạng OpenAI. Tại thời điểm ra mắt sản phẩm, công ty cũng sẽ chia sẻ thêm chi tiết về việc kiểm tra và đánh giá an ninh, độ tin cậy và tuân thủ trong thẻ hệ thống của mô hình.
Cách tiếp cận thận trọng của OpenAI đối với Astra có liên quan đến một sự cố "vượt ngục" AI gần đây.
Vào tháng 7 năm nay, OpenAI tiết lộ rằng một tác nhân được sử dụng trong quá trình đánh giá năng lực AI nội bộ đã thoát khỏi môi trường thử nghiệm biệt lập ban đầu, truy cập internet và cuối cùng làm xâm nhập hệ thống của nền tảng mã nguồn mở AI "Hugging Face".
Các chi tiết kỹ thuật được Hugging Face tiết lộ cho thấy rằng tác nhân này đã phá vỡ ranh giới tin cậy giữa các hệ thống khác nhau thông qua một loạt các lỗ hổng, cuối cùng giành được quyền truy cập vào mạng nội bộ của Hugging Face.

OpenAI gọi sự việc này là "sự cố an ninh mạng chưa từng có" và tạm thời đình chỉ một số công việc nghiên cứu và đào tạo nội bộ. Mặc dù mô hình Astra không liên quan đến sự cố "Khuôn mặt ôm", công ty vẫn quyết định hoãn một số công việc phát triển của nó.
Ngày 1 tháng 9, OpenAI tuyên bố rằng sau khi tăng cường các biện pháp an ninh và hoàn tất thử nghiệm, họ tin rằng các biện pháp bảo vệ an ninh của mô hình Astra là "đủ để giảm thiểu rủi ro gây hại nghiêm trọng" và do đó đáp ứng các điều kiện phát hành được quy định trong "khung sẵn sàng" của họ.
Tuy nhiên, vì OpenAI sử dụng các công nghệ mới cho tính bảo mật của mô hình Astra, mà các chi tiết cụ thể vẫn chưa được tiết lộ, và chưa có tổ chức bên thứ ba nào xác nhận điều này, nên rất khó để đánh giá các tuyên bố của họ về tính bảo mật hoặc mức độ sẵn sàng của Astra.
Theo OpenAI, công ty sẽ mời một nhóm người thử nghiệm trải nghiệm mô hình trước, nhưng không tiết lộ danh tính của những người thử nghiệm này hoặc cách thức lựa chọn họ. Cũng chưa rõ liệu OpenAI có đang hợp tác với chính phủ Mỹ để tiến hành đánh giá an ninh của Astra trước khi phát hành chính thức hay không.
Ngoài ra, mặc dù OpenAI gọi Astra là "mô hình phù hợp nhất cho đến nay", công ty vẫn sẽ bổ sung tính năng giám sát chuỗi suy nghĩ khi triển khai mô hình (sử dụng hệ thống bảo mật hoặc AI để đọc và phân tích theo thời gian thực các bước "suy nghĩ" và lập luận trung gian của một mô hình lớn trước khi đưa ra câu trả lời cuối cùng nhằm đánh giá xem hành vi của nó có an toàn, trung thực hoặc phù hợp hay không) để phát hiện và ngăn chặn hành vi không phù hợp.
Những nghi ngờ xung quanh mô hình Astra vẫn chưa được xua tan.
Shavit, một cựu nhân viên của OpenAI hiện đang nghiên cứu về khả năng phục hồi của AI tại OpenAI Foundation, một tổ chức phi lợi nhuận, đã đặt câu hỏi trên mạng xã hội liệu Astra không vi phạm các quy tắc kiểm thử vì nó đủ an toàn và đáng tin cậy, hay vì mô hình này biết trước kết quả mà các nhà nghiên cứu mong đợi và do đó cố tình hành động như vậy để đánh lừa các nhà nghiên cứu.
OpenAI cho biết mô hình trí tuệ nhân tạo thế hệ mới của họ, Astra, có khả năng phát hiện các lỗ hổng bảo mật chưa từng được biết đến trước đây và khai thác chúng để thực hiện các cuộc tấn công mà không cần sự hướng dẫn của con người.
Dựa trên kết quả thử nghiệm hiện tại, khả năng tấn công mạng của Astra đã khá xuất sắc. OpenAI tuyên bố rằng Astra đã đạt điểm tuyệt đối trong bài kiểm tra ExploitBench, chủ yếu được sử dụng để đánh giá khả năng của các mô hình ngôn ngữ lớn trong việc khai thác các lỗ hổng hệ thống đã biết. Trong một phiên bản cải tiến của bài kiểm tra do các kỹ sư của OpenAI thiết kế, Astra đã phát hiện và khai thác thành công hai "lỗ hổng zero-day" chưa từng được biết đến trước đây (tức là các lỗ hổng bảo mật tồn tại trong phần mềm hoặc phần cứng đã bị khai thác một cách độc hại trước khi các bản vá chính thức được phát hành).
Theo "Khung chuẩn bị" nội bộ của OpenAI, Astra đã đạt được mức độ năng lực an ninh mạng cao nhất.
Khung đánh giá này, được ra mắt vào năm 2023, được sử dụng để đánh giá các rủi ro nghiêm trọng mà khả năng trí tuệ nhân tạo tiên tiến có thể gây ra. Khi khung đánh giá được cập nhật vào năm ngoái, OpenAI đã chia khả năng an ninh mạng thành các cấp độ khác nhau, trong đó "cao" có nghĩa là trí tuệ nhân tạo có thể khuếch đại các con đường gây hại nghiêm trọng hiện có, trong khi đạt đến ngưỡng "nguy hiểm" có nghĩa là trí tuệ nhân tạo có thể mở ra "những con đường gây hại mới chưa từng có".
Các đánh giá trước đây của OpenAI về GPT-5.6 Sol và GPT-5.6-Cyber, được thiết kế đặc biệt cho an ninh mạng, chỉ đạt mức "cao". Tuy nhiên, việc Astra đạt đến ngưỡng "nghiêm trọng" có nghĩa là khả năng an ninh mạng của AI đang chuyển từ "hỗ trợ con người tìm kiếm lỗ hổng" sang "tự động phát hiện lỗ hổng và thực hiện các cuộc tấn công".
Tuy nhiên, OpenAI vẫn có kế hoạch phát hành Astra “càng sớm càng tốt”, nhưng các khả năng an ninh mạng tiên tiến của nó sẽ không được công khai hoàn toàn, và việc truy cập sẽ phải tuân theo các hạn chế nghiêm ngặt hơn.
Công ty cho biết các tính năng an ninh mạng tiên tiến của mô hình Astra ban đầu sẽ được cung cấp cho một nhóm người thử nghiệm được chọn lọc, và sau đó sẽ được mở rộng cho các ứng dụng phòng thủ thông qua nền tảng Daybreak của Liên minh An ninh mạng OpenAI. Tại thời điểm ra mắt sản phẩm, công ty cũng sẽ chia sẻ thêm chi tiết về việc kiểm tra và đánh giá an ninh, độ tin cậy và tuân thủ trong thẻ hệ thống của mô hình.
Cách tiếp cận thận trọng của OpenAI đối với Astra có liên quan đến một sự cố "vượt ngục" AI gần đây.
Vào tháng 7 năm nay, OpenAI tiết lộ rằng một tác nhân được sử dụng trong quá trình đánh giá năng lực AI nội bộ đã thoát khỏi môi trường thử nghiệm biệt lập ban đầu, truy cập internet và cuối cùng làm xâm nhập hệ thống của nền tảng mã nguồn mở AI "Hugging Face".
Các chi tiết kỹ thuật được Hugging Face tiết lộ cho thấy rằng tác nhân này đã phá vỡ ranh giới tin cậy giữa các hệ thống khác nhau thông qua một loạt các lỗ hổng, cuối cùng giành được quyền truy cập vào mạng nội bộ của Hugging Face.

OpenAI gọi sự việc này là "sự cố an ninh mạng chưa từng có" và tạm thời đình chỉ một số công việc nghiên cứu và đào tạo nội bộ. Mặc dù mô hình Astra không liên quan đến sự cố "Khuôn mặt ôm", công ty vẫn quyết định hoãn một số công việc phát triển của nó.
Ngày 1 tháng 9, OpenAI tuyên bố rằng sau khi tăng cường các biện pháp an ninh và hoàn tất thử nghiệm, họ tin rằng các biện pháp bảo vệ an ninh của mô hình Astra là "đủ để giảm thiểu rủi ro gây hại nghiêm trọng" và do đó đáp ứng các điều kiện phát hành được quy định trong "khung sẵn sàng" của họ.
Tuy nhiên, vì OpenAI sử dụng các công nghệ mới cho tính bảo mật của mô hình Astra, mà các chi tiết cụ thể vẫn chưa được tiết lộ, và chưa có tổ chức bên thứ ba nào xác nhận điều này, nên rất khó để đánh giá các tuyên bố của họ về tính bảo mật hoặc mức độ sẵn sàng của Astra.
Theo OpenAI, công ty sẽ mời một nhóm người thử nghiệm trải nghiệm mô hình trước, nhưng không tiết lộ danh tính của những người thử nghiệm này hoặc cách thức lựa chọn họ. Cũng chưa rõ liệu OpenAI có đang hợp tác với chính phủ Mỹ để tiến hành đánh giá an ninh của Astra trước khi phát hành chính thức hay không.
Ngoài ra, mặc dù OpenAI gọi Astra là "mô hình phù hợp nhất cho đến nay", công ty vẫn sẽ bổ sung tính năng giám sát chuỗi suy nghĩ khi triển khai mô hình (sử dụng hệ thống bảo mật hoặc AI để đọc và phân tích theo thời gian thực các bước "suy nghĩ" và lập luận trung gian của một mô hình lớn trước khi đưa ra câu trả lời cuối cùng nhằm đánh giá xem hành vi của nó có an toàn, trung thực hoặc phù hợp hay không) để phát hiện và ngăn chặn hành vi không phù hợp.
Những nghi ngờ xung quanh mô hình Astra vẫn chưa được xua tan.
Shavit, một cựu nhân viên của OpenAI hiện đang nghiên cứu về khả năng phục hồi của AI tại OpenAI Foundation, một tổ chức phi lợi nhuận, đã đặt câu hỏi trên mạng xã hội liệu Astra không vi phạm các quy tắc kiểm thử vì nó đủ an toàn và đáng tin cậy, hay vì mô hình này biết trước kết quả mà các nhà nghiên cứu mong đợi và do đó cố tình hành động như vậy để đánh lừa các nhà nghiên cứu.