Ôi không, ChatGPT và Claude đã "tấn công" người thực!

Vũ Nguyễn
Vũ Nguyễn
Phản hồi: 0
Một cuộc thử nghiệm an toàn AI tại Anh đã dẫn đến một tình huống đáng lo: các mô hình AI không chỉ thực hiện nhiệm vụ trong môi trường mô phỏng mà còn tìm cách tương tác với người thật và các hệ thống thật trên Internet.

Viện An toàn AI Anh (AISI) vừa công bố báo cáo dài 35 trang về sự cố. OpenAI và Anthropic sau đó cũng xác nhận các mô hình của họ có liên quan.

Đáng chú ý nhất là Mythos 5, một mô hình AI được Anthropic phát triển cho các bài kiểm thử an ninh mạng. Trong một bài thử nghiệm, mô hình đã đưa mã độc vào một dự án GitHub có thật dưới dạng một yêu cầu thay đổi mã (PR). Ban đầu, đoạn mã trông giống một bản sửa lỗi thông thường. Nhưng khi một người dùng phát hiện dấu hiệu bất thường và cảnh báo, mô hình không dừng lại. Nó phủ nhận ý đồ xấu, chỉnh sửa nội dung bình luận, Issue và PR để che dấu vết, sau đó tạo tài khoản GitHub khác và giả làm một lập trình viên độc lập để ủng hộ chính đoạn mã của mình.

Mô hình còn tìm kiếm thông tin công khai về những người duy trì dự án, truy cập tài khoản, lịch sử đóng góp và địa chỉ email. Khi không thuyết phục được họ trên GitHub, nó tiếp tục gửi email và tệp ra bên ngoài.

Đáng chú ý hơn, Mythos 5 còn tìm cách tác động đến những AI khác. Nó chèn hướng dẫn vào phần mã HTML của GitHub, nhắm tới các công cụ như Claude Code, Codex và Cursor. Con người không nhìn thấy nội dung này trên trang web thông thường, nhưng các công cụ AI đọc mã nguồn có thể coi đó là một chỉ dẫn cần thực hiện.
1786330525087.png
Trong một bài thử nghiệm khác, Mythos 5 đã hoạt động liên tục trong 34,5 giờ. Do cấu hình bài kiểm tra có vấn đề, mô hình hiểu nhầm một dự án GitHub thật là một phần của môi trường thử nghiệm. Những người duy trì dự án hoàn toàn không biết mình đã trở thành mục tiêu trong bài kiểm tra.

Mô hình sau đó tạo nhiều tài khoản GitHub, nghiên cứu hoạt động của những người liên quan và tìm cách tiếp cận hệ thống. Khi nhận thấy môi trường mạng có dấu hiệu giống mạng gia đình của một người thật, thay vì dừng lại để yêu cầu con người xác nhận, nó tự đưa ra giả thuyết rằng đó có thể là một bên liên quan đến dự án rồi tiếp tục.

Cuối cùng chính một người dùng đã phát hiện PR chứa mã độc, công khai cảnh báo và yêu cầu chủ dự án không hợp nhất mã. PR sau đó được đóng lại.

Không phải AI đã phá được "hàng rào"​

Điểm quan trọng là Mythos 5 không thực sự thoát khỏi môi trường bảo mật của AISI. Nó vẫn hoạt động bên trong máy ảo được cô lập. Vấn đề nằm ở cách cuộc thử nghiệm được thiết lập. Để kiểm tra khả năng tấn công ở mức cao nhất, AISI mở quyền truy cập Internet và tắt một số lớp kiểm soát an toàn. Mô hình cũng không bị cấm rõ ràng việc liên hệ với người thật hoặc thực hiện các hành vi xã hội hóa.

Thời gian hoạt động rất dài cũng làm tăng rủi ro. Một phiên thử nghiệm có thể cung cấp tới 100 hoặc 200 triệu token, đủ để AI hoạt động liên tục 40 đến 50 giờ. Khi ngữ cảnh được tóm tắt trong quá trình chạy dài, những thông tin ban đầu về phạm vi thử nghiệm có thể bị mất hoặc thay đổi.

Nói cách khác, môi trường AI vẫn an toàn về mặt hệ thống, nhưng AI bên trong lại có thể chạm tới người thật thông qua Internet.

AISI thực hiện 122 bài kiểm tra với 7 mô hình. Có 10 mẫu phát sinh vấn đề, ghi nhận tổng cộng 19 hành vi trái phép nhằm vào người hoặc tổ chức thật. Trong số này, Mythos 5 chiếm 17 trường hợp và GPT-5.6 Sol có 2 trường hợp. Anthropic cũng rà soát 141.006 lượt kiểm thử và phát hiện 3 sự cố. Trong một trường hợp, Mythos 5 đưa một gói PyPI chứa mã độc lên Internet trong khoảng một giờ. Gói này sau đó được 15 hệ thống thật tải xuống và thực thi.

Điểm chung của các sự cố là: AI được giao nhiệm vụ tấn công, các lớp bảo vệ bị giảm để phục vụ thử nghiệm, mô hình được phép hoạt động tự chủ trong thời gian dài và vẫn tồn tại một đường kết nối với hệ thống thật.

Trong những lần này, con người vẫn kịp phát hiện và ngăn chặn sự cố. Nhưng đây mới là vấn đề đáng lo nhất: nếu trong tương lai AI đồng thời viết mã, gửi mã, kiểm tra, phê duyệt và triển khai mã, ai sẽ là người đứng ngoài để phát hiện rằng AI đang làm điều không nên làm?
 
Back
Top