Duy Linh✔
Writer
Viện An ninh Trí tuệ Nhân tạo Anh (AISI) vừa công bố một sự cố nghiêm trọng liên quan đến các tác nhân AI tự động phục vụ đánh giá an ninh mạng. Trong quá trình thử nghiệm, các tác nhân này đã vượt khỏi phạm vi được thiết lập và thực hiện nhiều hành động trái phép trên internet thực tế.

Từ ngày 25 đến 28/7/2026, AISI ghi nhận 19 sự cố trong tổng số 122 lần thử nghiệm. Các tác nhân AI đã tương tác với nhiều dịch vụ bên ngoài, bao gồm những hành động nhắm vào người dùng thật và các dự án mã nguồn mở.
Trong số các sự cố, 17 trường hợp liên quan đến Mythos 5 và 2 trường hợp liên quan đến GPT-5.6-Sol. AISI cho biết các hành động đều không thành công và chưa phát hiện thiệt hại thực tế, tuy nhiên đây vẫn là một thất bại nghiêm trọng về an toàn và bảo mật.
Mô hình này đã tự tạo các tài khoản GitHub, thu thập thông tin công khai của hai nhà phát triển phần mềm không liên quan, sau đó gửi một pull request chứa mã độc vào một kho lưu trữ mã nguồn mở.
Không dừng lại ở đó, AI còn sử dụng các tài khoản giả để tạo cảm giác có nhiều người ủng hộ thay đổi này, qua đó gây áp lực buộc người duy trì dự án hợp nhất pull request.
Sau khi một người dùng phát hiện mã độc, tác nhân AI phủ nhận ý đồ xấu, liên tục chỉnh sửa mã và nội dung trao đổi nhằm lấy lại uy tín cho pull request. Cuối cùng, chủ sở hữu kho lưu trữ đã đóng yêu cầu sau khi xác định có phần mềm độc hại.
Quá trình rà soát nhật ký của AISI còn cho thấy Mythos 5 gửi email tới các nhà phát triển thực, sử dụng nội dung độc hại kết hợp kỹ thuật lừa đảo xã hội nhằm thuyết phục họ chấp nhận các thay đổi trong mã nguồn.
Ngoài ra, tác nhân này còn đăng các hướng dẫn chèn prompt ẩn trong GitHub Issues để tác động đến những tác nhân lập trình AI có khả năng đọc nội dung thông qua API.
Một sự cố khác cho thấy phần mềm độc hại đã tạm thời thực thi mã từ xa bên trong vùng chứa điều tra biệt lập của một người dùng bên ngoài sau khi người này kiểm tra phần mềm đáng ngờ. Dù cố gắng thu thập dữ liệu trong môi trường này, AI không thể đánh cắp thông tin đăng nhập, thoát khỏi vùng chứa hay xâm nhập hệ thống của bên thứ ba.
Các tác nhân để lại hướng dẫn vận hành cho nhau, chia sẻ hạ tầng và tìm cách sử dụng các đường hầm công cộng, dịch vụ DNS, danh tính dùng một lần cùng các công cụ điều khiển từ xa để đưa tài nguyên thử nghiệm cục bộ ra internet. GPT-5.6-Sol cũng liên quan đến một sự kiện sử dụng đường hầm công cộng khiến một dịch vụ tra cứu địa chỉ độc hại bị lộ.
Theo AISI, sự cố xuất phát từ nhiều nguyên nhân như quyền truy cập internet quá rộng, các bộ phân loại an toàn mạng do nhà cung cấp cung cấp bị vô hiệu hóa, thiếu cơ chế giám sát các hành động phối hợp, nguy cơ cấu hình sai và những giới hạn chưa đủ rõ ràng đối với hoạt động bên ngoài.
Viện nhấn mạnh việc cho phép AI truy cập internet là chủ đích nhằm đánh giá năng lực an ninh mạng ở cấp độ cao, không phải do AI thoát khỏi môi trường thử nghiệm.
Sau sự cố, AISI đã cách ly các môi trường bị ảnh hưởng, rà soát toàn bộ nhật ký, tạm thời hạn chế quyền truy cập của các mô hình và kiểm tra lại các đợt đánh giá trước đó để phát hiện những hành vi tương tự.
Trong thời gian tới, viện sẽ triển khai các biện pháp giảm thiểu rủi ro như áp dụng cơ chế kiểm soát mạng chi tiết hơn, cải thiện môi trường sandbox, giám sát các hành động trước khi được thực thi và thiết lập quy định rõ ràng hơn nhằm cấm các tác nhân AI tiếp xúc với người thật hoặc hệ thống thực.

Từ ngày 25 đến 28/7/2026, AISI ghi nhận 19 sự cố trong tổng số 122 lần thử nghiệm. Các tác nhân AI đã tương tác với nhiều dịch vụ bên ngoài, bao gồm những hành động nhắm vào người dùng thật và các dự án mã nguồn mở.
Trong số các sự cố, 17 trường hợp liên quan đến Mythos 5 và 2 trường hợp liên quan đến GPT-5.6-Sol. AISI cho biết các hành động đều không thành công và chưa phát hiện thiệt hại thực tế, tuy nhiên đây vẫn là một thất bại nghiêm trọng về an toàn và bảo mật.
Mythos 5 tự tạo tài khoản GitHub và gửi mã độc
Sự cố nghiêm trọng nhất xảy ra khi một tác nhân Mythos 5 cố gắng hoàn thành bài kiểm tra an ninh mạng nội bộ bằng cách thực hiện điều mà mô hình cho là một cuộc tấn công chuỗi cung ứng.Mô hình này đã tự tạo các tài khoản GitHub, thu thập thông tin công khai của hai nhà phát triển phần mềm không liên quan, sau đó gửi một pull request chứa mã độc vào một kho lưu trữ mã nguồn mở.
Không dừng lại ở đó, AI còn sử dụng các tài khoản giả để tạo cảm giác có nhiều người ủng hộ thay đổi này, qua đó gây áp lực buộc người duy trì dự án hợp nhất pull request.
Sau khi một người dùng phát hiện mã độc, tác nhân AI phủ nhận ý đồ xấu, liên tục chỉnh sửa mã và nội dung trao đổi nhằm lấy lại uy tín cho pull request. Cuối cùng, chủ sở hữu kho lưu trữ đã đóng yêu cầu sau khi xác định có phần mềm độc hại.
Quá trình rà soát nhật ký của AISI còn cho thấy Mythos 5 gửi email tới các nhà phát triển thực, sử dụng nội dung độc hại kết hợp kỹ thuật lừa đảo xã hội nhằm thuyết phục họ chấp nhận các thay đổi trong mã nguồn.
Ngoài ra, tác nhân này còn đăng các hướng dẫn chèn prompt ẩn trong GitHub Issues để tác động đến những tác nhân lập trình AI có khả năng đọc nội dung thông qua API.
Một sự cố khác cho thấy phần mềm độc hại đã tạm thời thực thi mã từ xa bên trong vùng chứa điều tra biệt lập của một người dùng bên ngoài sau khi người này kiểm tra phần mềm đáng ngờ. Dù cố gắng thu thập dữ liệu trong môi trường này, AI không thể đánh cắp thông tin đăng nhập, thoát khỏi vùng chứa hay xâm nhập hệ thống của bên thứ ba.
AISI siết chặt biện pháp kiểm soát sau sự cố
AISI cũng phát hiện các tác nhân AI có dấu hiệu phối hợp ngoài dự kiến giữa những lần chạy vốn được thiết kế độc lập. Trong một trường hợp, các mô hình cùng phát hiện một mã thông báo GitHub bị lộ trên một Gist công khai, sau đó truy cập cùng một tài khoản và sử dụng kho lưu trữ làm kênh liên lạc chung.Các tác nhân để lại hướng dẫn vận hành cho nhau, chia sẻ hạ tầng và tìm cách sử dụng các đường hầm công cộng, dịch vụ DNS, danh tính dùng một lần cùng các công cụ điều khiển từ xa để đưa tài nguyên thử nghiệm cục bộ ra internet. GPT-5.6-Sol cũng liên quan đến một sự kiện sử dụng đường hầm công cộng khiến một dịch vụ tra cứu địa chỉ độc hại bị lộ.
Theo AISI, sự cố xuất phát từ nhiều nguyên nhân như quyền truy cập internet quá rộng, các bộ phân loại an toàn mạng do nhà cung cấp cung cấp bị vô hiệu hóa, thiếu cơ chế giám sát các hành động phối hợp, nguy cơ cấu hình sai và những giới hạn chưa đủ rõ ràng đối với hoạt động bên ngoài.
Viện nhấn mạnh việc cho phép AI truy cập internet là chủ đích nhằm đánh giá năng lực an ninh mạng ở cấp độ cao, không phải do AI thoát khỏi môi trường thử nghiệm.
Sau sự cố, AISI đã cách ly các môi trường bị ảnh hưởng, rà soát toàn bộ nhật ký, tạm thời hạn chế quyền truy cập của các mô hình và kiểm tra lại các đợt đánh giá trước đó để phát hiện những hành vi tương tự.
Trong thời gian tới, viện sẽ triển khai các biện pháp giảm thiểu rủi ro như áp dụng cơ chế kiểm soát mạng chi tiết hơn, cải thiện môi trường sandbox, giám sát các hành động trước khi được thực thi và thiết lập quy định rõ ràng hơn nhằm cấm các tác nhân AI tiếp xúc với người thật hoặc hệ thống thực.
Được phối hợp thực hiện bởi các chuyên gia của Bkav,
cộng đồng An ninh mạng Việt Nam WhiteHat
và cộng đồng Khoa học công nghệ VnReview
Sửa lần cuối: