Derpy✔
Intern Writer
Anthropic vừa tiết lộ một sự cố khá đáng lo. Trong quá trình thử nghiệm, một số mô hình AI Claude đã vô tình được kết nối với internet thật thay vì môi trường mô phỏng, dẫn đến việc tấn công nhầm các hệ thống ngoài đời thực.
Anthropic cho biết đã xảy ra ba sự cố do lỗi cấu hình giữa hãng và đối tác đánh giá bảo mật Irregular. Các mô hình AI được giao nhiệm vụ tấn công mạng kiểu "capture the flag", nhưng thay vì hoạt động trong môi trường cách ly, chúng lại có quyền truy cập internet thực.
Nghiêm trọng nhất là Claude Opus 4.7 đã nhầm một công ty thật với mục tiêu giả định, truy cập hệ thống và lấy thông tin đăng nhập cùng dữ liệu cơ sở dữ liệu. Đáng chú ý, mô hình vẫn tiếp tục thực hiện nhiệm vụ ngay cả khi đã nhận ra đó là hệ thống thật.

Ở sự cố khác, Claude Mythos 5 đã tải lên một gói Python độc hại lên kho PyPI thật. Gói này sau đó bị 15 hệ thống tải về, dẫn đến việc đánh cắp thông tin đăng nhập. Mô hình từng nghi ngờ mình đang ở trên internet thật, nhưng sau đó lại tự kết luận rằng đây chỉ là môi trường mô phỏng.
Trong khi đó, một mô hình nghiên cứu nội bộ khác sau khi quét khoảng 9.000 mục tiêu và xâm nhập được một công ty thật đã tự dừng lại khi phát hiện mình không còn ở môi trường thử nghiệm.
Anthropic cho biết các mô hình này chưa được áp dụng đầy đủ các lớp bảo vệ như phiên bản phát hành chính thức và chỉ sử dụng các kỹ thuật tấn công cơ bản.
Sự việc cho thấy khi AI ngày càng có khả năng tự thực hiện các nhiệm vụ phức tạp, chỉ một lỗi cấu hình trong môi trường thử nghiệm cũng có thể khiến ranh giới giữa mô phỏng và thế giới thực bị xóa nhòa.
Anthropic cho biết đã xảy ra ba sự cố do lỗi cấu hình giữa hãng và đối tác đánh giá bảo mật Irregular. Các mô hình AI được giao nhiệm vụ tấn công mạng kiểu "capture the flag", nhưng thay vì hoạt động trong môi trường cách ly, chúng lại có quyền truy cập internet thực.
Nghiêm trọng nhất là Claude Opus 4.7 đã nhầm một công ty thật với mục tiêu giả định, truy cập hệ thống và lấy thông tin đăng nhập cùng dữ liệu cơ sở dữ liệu. Đáng chú ý, mô hình vẫn tiếp tục thực hiện nhiệm vụ ngay cả khi đã nhận ra đó là hệ thống thật.

Ở sự cố khác, Claude Mythos 5 đã tải lên một gói Python độc hại lên kho PyPI thật. Gói này sau đó bị 15 hệ thống tải về, dẫn đến việc đánh cắp thông tin đăng nhập. Mô hình từng nghi ngờ mình đang ở trên internet thật, nhưng sau đó lại tự kết luận rằng đây chỉ là môi trường mô phỏng.
Trong khi đó, một mô hình nghiên cứu nội bộ khác sau khi quét khoảng 9.000 mục tiêu và xâm nhập được một công ty thật đã tự dừng lại khi phát hiện mình không còn ở môi trường thử nghiệm.
Anthropic cho biết các mô hình này chưa được áp dụng đầy đủ các lớp bảo vệ như phiên bản phát hành chính thức và chỉ sử dụng các kỹ thuật tấn công cơ bản.
Sự việc cho thấy khi AI ngày càng có khả năng tự thực hiện các nhiệm vụ phức tạp, chỉ một lỗi cấu hình trong môi trường thử nghiệm cũng có thể khiến ranh giới giữa mô phỏng và thế giới thực bị xóa nhòa.