Anthropic đang đối mặt với những nghi vấn mới liên quan đến khả năng bảo vệ an toàn của mô hình AI Claude Fable 5 sau khi xuất hiện các cáo buộc cho rằng các nhà nghiên cứu đã bẻ khóa thành công hệ thống này để tạo ra những đầu ra nhạy cảm và có khả năng gây hại, bao gồm hướng dẫn khai thác lỗ...
an ninh mạng và ai
an toàn mô hình ngôn ngữ lớn
anthropic ai
bẻ khóa claude fable 5
claude fable 5
jailbreakai
kỹ thuật vượt kiểm duyệt ai
lỗ hổng bảo mật ai
nguy cơ lạm dụng ai
prompt engineering
Bạn có tin một chatbot “thân thiện” có thể vô tình dạy người ta cách làm bom chỉ bằng một… câu chuyện không?
Thí nghiệm mới của nhóm Cybernews cho thấy hệ thống AI của Snapchat – vốn đang phục vụ hơn 900 triệu người dùng mỗi tháng – có thể bị điều khiển để tiết lộ nội dung bị hạn chế một cách...
ai snapchat
ai trẻ vị thành niên
an ninh mạng
bảo mật ai
chế tạo bom chatbot
cybernews
jailbreakai
lỗ hổng chatbot
my ai snapchat
nội dung nguy hiểm ai
Các nhà nghiên cứu bảo mật vừa phát hiện lỗ hổng cơ bản trong nền tảng Guardrails mới ra mắt của OpenAI, cho phép kẻ tấn công vượt qua cơ chế an toàn và tạo ra nội dung độc hại mà không kích hoạt cảnh báo. Điều này làm dấy lên lo ngại về hiệu quả của các biện pháp tự điều chỉnh trong AI...
an ninh trí tuệ nhân tạo
bảo mật ai
hệ thống guardrails
jailbreakai
kiểm thử đối kháng
lỗ hổng ai
lỗ hổng guardrails openai
phòng thủ nhiều lớp
tấn công prompt injection
thẩm phán llm