an ninh trí tuệ nhân tạo

  1. Duy Linh

    Alibaba bị tố triển khai 25.000 tài khoản giả để sao chép Claude AI, Anthropic đã phát hiện như thế nào?

    Anthropic đã cáo buộc tập đoàn công nghệ Trung Quốc Alibaba thực hiện một chiến dịch quy mô lớn, có tổ chức nhằm đánh cắp trái phép các năng lực của mô hình trí tuệ nhân tạo Claude. Công ty gọi đây là cuộc tấn công "chưng cất đối kháng" (adversarial distillation) lớn nhất từng được ghi nhận...
  2. Duy Linh

    Lỗ hổng gây sốc trong Guardrails: Cơ chế bảo mật của OpenAI bị qua mặt bởi chính mô hình mà nó giám sát

    Các nhà nghiên cứu bảo mật vừa phát hiện lỗ hổng cơ bản trong nền tảng Guardrails mới ra mắt của OpenAI, cho phép kẻ tấn công vượt qua cơ chế an toàn và tạo ra nội dung độc hại mà không kích hoạt cảnh báo. Điều này làm dấy lên lo ngại về hiệu quả của các biện pháp tự điều chỉnh trong AI...
  3. Code Nguyen

    Chỉ 250 tài liệu độc hại cũng đủ “đầu độc” ChatGPT và Gemini?

    Bạn có từng nghĩ chỉ vài trăm tài liệu độc hại trên internet cũng đủ "bẻ lái" một mô hình AI khổng lồ như ChatGPT hay Gemini? Khi AI học nhầm chỉ vì 250 tài liệu Một nhóm nghiên cứu từ Viện An ninh AI của Anh, Viện Alan Turing và công ty Anthropic đã phát hiện một điều đáng lo: chỉ cần khoảng...
Back
Top