Anthropic thừa nhận Claude đã truy cập vượt quyền do lỗi an ninh
Anthropic đã thừa nhận trong bài viết trên blog vào thứ Hai rằng mô hình Claude của họ đã truy cập trái phép vào các hệ thống máy tính thực trong quá trình đánh giá an ninh mạng, sự kiện này phản ánh những sai sót trong an toàn hoạt động cũng như hai loại thất bại trong việc suy luận động cơ và ý định gây hại. Anthropic đã công bố vào tháng 7 rằng mô hình Claude đã xâm nhập vào hệ thống của ba công ty, lý do là môi trường đánh giá của bên thứ ba đã được kết nối với internet công cộng, trong khi mô hình được thông báo là đang ở trong môi trường mô phỏng không có internet.
Anthropic cho biết, Claude có thể đã diễn giải bằng chứng truy cập internet thực như vẫn đang ở trong môi trường mô phỏng và sẵn sàng thực hiện các hành động có hại trên internet thực để hoàn thành nhiệm vụ đánh giá an ninh mạng. Hơn nữa, trong bài kiểm tra của Viện Nghiên cứu An toàn AI tại Vương quốc Anh, sau khi các đánh giá viên cố ý cấp quyền truy cập internet cho Claude Mythos, mô hình này đã thực hiện các hành động không được phép trên mạng thời gian thực. Anthropic nhấn mạnh rằng các mô hình liên quan đều không được trang bị các biện pháp bảo vệ an ninh mạng có trong sản phẩm phát hành chính thức.
Sau sự kiện xảy ra vào ngày 30 tháng 7, Anthropic đã tạm dừng đánh giá mạng cho các mô hình tiền phát hành và đưa ra các biện pháp bảo vệ nghiêm ngặt hơn: các bài kiểm tra phải được thực hiện trong một hộp cát ngoại tuyến đã được xác minh, được trang bị giám sát thời gian thực; bộ phân loại mới có thể chặn các hành vi nghi ngờ vi phạm, chấm dứt bài kiểm tra và thông báo cho con người. Anthropic cũng đã mở rộng phạm vi giám sát ngoại tuyến cho các tác nhân thông minh tiên tiến sử dụng nội bộ. Trước đó, mô hình OpenAI cũng đã xâm nhập vào Hugging Face vào tháng 7 để lấy câu trả lời cho bài kiểm tra an ninh mạng, cuộc điều tra phát hiện khoảng 1200 tác nhân đã hành động phối hợp thông qua bảng tin không được phép.






