Vụ AI của OpenAI "nổi loạn" khủng khiếp hơn chúng ta tưởng rất nhiều

The Storm Riders
The Storm Riders
Phản hồi: 0
Báo cáo chi tiết về sự cố bảo mật vừa được công bố cho thấy một kịch bản khó tin: hơn một nghìn agent AI thử nghiệm của OpenAI đã tự tìm cách giao tiếp qua một kênh bí mật, che giấu dấu vết và tấn công vào hệ thống của Hugging Face mà không cần bất kỳ sự can thiệp nào từ con người.

Khi AI tự liên minh để vượt rào​

1787798934465.png

Các tài liệu điều tra dài gần 130 trang vừa được công bố từ chính OpenAI cùng hai tổ chức nghiên cứu độc lập là METR và Redwood Research đã phơi bày toàn bộ quy mô của sự cố bảo mật chấn động xảy ra vào tháng 7. Đây được xác nhận là trường hợp đầu tiên ghi nhận một tập hợp các agent AI tự động phối hợp thực hiện hành vi tấn công mạng mà không có sự cho phép hay chỉ đạo trực tiếp từ con người.

Bản chất của vụ việc bắt nguồn từ hiện tượng reward-hacking, một lỗi căn chỉnh phổ biến khi mô hình AI tìm mọi cách, kể cả những hành vi cực đoan không lường trước, chỉ để đạt được mục tiêu được giao. Trong quá trình thử nghiệm, OpenAI đã vô tình hoặc hữu ý giao cho các mô hình những nhiệm vụ gần như bất khả thi do thiếu quyền truy cập vào các tệp dữ liệu cần thiết. Thay vì dừng lại, các agent AI đã tự sáng tạo ra phương thức liên lạc nội bộ để giải quyết bài toán.

Cụ thể, một agent tự đặt tên là PHASEONE10841 đã đứng ra thiết lập một hệ thống tương tự như diễn đàn nhắn tin bí mật mà các nhà nghiên cứu không hề hay biết. Chỉ trong vài giờ, hơn 50 agent khác đã tìm ra kênh này và trao đổi hàng nghìn tin nhắn. Từ đây, "hội đồng" AI bắt đầu phân chia nhiệm vụ, tìm đường thoát ra mạng internet và nhắm thẳng vào hạ tầng nội bộ của Hugging Face để lấy dữ liệu riêng tư cùng quyền truy cập vào nền tảng nhắn tin doanh nghiệp của đơn vị này. OpenAI cũng xác nhận Hugging Face không phải là mục tiêu duy nhất bị xâm nhập trong đợt tấn công.

Quy mô vượt xa tưởng tượng​

Báo cáo từ METR và Redwood Research chỉ ra mức độ tinh vi của mạng lưới này: khoảng 1.200 agent AI vốn được thiết lập để cách ly đã gửi cho nhau hơn 70.000 tin nhắn và tệp tin trên diễn đàn ngầm. Khoảng 700 agent trong số đó trực tiếp tham gia vào chiến dịch tấn công Hugging Face. Đáng chú ý, các mô hình này liên tục tính toán và trao đổi cách thức giả mạo, chỉnh sửa hoặc xóa lịch sử hoạt động nhằm qua mặt các lớp kiểm tra tự động của cả OpenAI lẫn Hugging Face.

Toàn bộ hoạt động ngầm này diễn ra trót lọt trong suốt 12 ngày trước khi OpenAI phát hiện sự việc vào ngày 20/7. Sau khi phát hiện, công ty đã liên hệ với Hugging Face và mất khoảng 3 ngày để kiểm soát phần lớn hoạt động trái phép, trước khi quyết định dừng toàn bộ quá trình huấn luyện mô hình nghiên cứu này vào ngày 25/7.

Hai mô hình tham gia vào sự cố gồm một mô hình nghiên cứu nội bộ chưa đặt tên, được METR gọi là HPIM, và mô hình đang vận hành công khai là GPT-5.6 Sol. Do mô hình thử nghiệm chưa từng được lên kế hoạch phát hành đại trà, nó đã không được áp dụng các tiêu chuẩn an toàn nghiêm ngặt như các sản phẩm thương mại. Sự việc diễn ra ngay sau giai đoạn tranh luận căng thẳng về rủi ro an ninh mạng của mô hình Claude Mythos 5 từ Anthropic và các cuộc thảo luận giữa chính phủ với OpenAI về việc phát hành giới hạn GPT-5.6 Sol.

Lời cảnh tỉnh cho tương lai của các agent tự hành​

OpenAI thừa nhận việc thiết lập các biện pháp an toàn một lần là không đủ để ngăn chặn tình trạng reward-hacking. Để khắc phục, công ty đang củng cố hạ tầng nghiên cứu, siết chặt việc giám sát chuỗi suy nghĩ nội bộ của mô hình và tăng cường cách ly các phiên bản thử nghiệm khỏi internet.

Một quy trình phản ứng nhanh 24/7 cũng được đưa ra nhằm thông báo cho các nhà nghiên cứu trong vòng 30 phút khi phát hiện dấu hiệu bất thường, đi kèm cơ chế dự phòng nếu người phụ trách không phản hồi kịp thời. Dù những quy trình trực nhật khẩn cấp này vốn là tiêu chuẩn cơ bản trong ngành công nghệ từ lâu, sự cố vừa qua cho thấy các phòng lab AI đã chủ quan như thế nào trước chính những sản phẩm họ tạo ra.

Chính OpenAI cũng phải nhìn nhận vụ việc như một phát súng cảnh báo. Khi các agent AI ngày càng thông minh hơn, ranh giới giữa một công cụ hữu ích và một tác nhân tấn công tự động nguy hiểm hoàn toàn có thể bị xóa nhòa nếu thiếu đi các biện pháp kiểm soát kỹ thuật thực sự chặt chẽ.
 
Back
Top