OpenAI tạm dừng Astra: AI đạt ngưỡng nguy hiểm an ninh mạng, có thể tự tấn công.

Derpy
Derpy
Phản hồi: 0
  • Thread starter Thread starter Derpy
  • Ngày gửi Ngày gửi

Derpy

Intern Writer
Liệu chúng ta có đang mở ra chiếc hộp Pandora khi tốc độ phát triển của trí tuệ nhân tạo đang khiến chính những nhà sáng tạo ra nó phải giật mình? Mới đây, OpenAI đã phải khẩn cấp tạm dừng dự án Astra, một mô hình AI tiên tiến, sau khi các đánh giá nội bộ cho thấy nó đã đạt đến ngưỡng "nguy hiểm" về an ninh mạng.

Theo báo cáo từ Xinzhiyuan, những đột phá mà Astra đạt được trong khả năng lập trình tác nhân (agent coding) và hiệu suất mạng thực sự đáng kinh ngạc. Tuy nhiên, điều này cũng đồng nghĩa với việc Astra có thể tự phát triển các lỗ hổng bảo mật zero-day (lỗ hổng chưa từng được biết đến) và thậm chí tự mình phát động các cuộc tấn công mạng từ đầu đến cuối chỉ với những chỉ dẫn cấp cao. Đây là một năng lực đáng sợ, tiềm ẩn nguy cơ mất kiểm soát khôn lường.

da883362f18f4fc7b592faf6e11b3ef4.png

Ảnh AI tạo ra để minh họa

Để ngăn chặn rủi ro này, OpenAI đã ngay lập tức đình chỉ các công việc nội bộ liên quan đến Astra chưa đáp ứng tiêu chuẩn an toàn. Họ cũng áp dụng hàng loạt biện pháp khẩn cấp như hạn chế quyền truy cập mạng và công cụ, tăng cường bảo vệ trọng số mô hình, và giám sát toàn diện các hành vi nguy hiểm của tác nhân AI. Chủ tịch OpenAI khẳng định rằng công tác an toàn và bảo mật đang được đẩy nhanh hết mức có thể.

Dù vậy, tham vọng của Sam Altman, CEO OpenAI, dường như vẫn không hề suy giảm. Ông đã lên tiếng khẳng định Astra là một mô hình cực kỳ mạnh mẽ và công ty đang nỗ lực để đưa nó ra công chúng. Theo Altman, việc giữ một "vũ khí hủy diệt" như vậy trong tay một nhóm đặc quyền là điều không nên. Mặc dù Astra cần thêm thời gian để điều chỉnh an toàn do khả năng tấn công mạng đáng sợ của nó, ông hứa hẹn với mọi người rằng "sẽ không quá lâu nữa đâu".

Điều này cho thấy một sự khác biệt rõ rệt trong định hướng giữa OpenAI và Anthropic. Trong khi Anthropic ngày càng thận trọng hơn trước những khả năng tiềm ẩn nguy hiểm của AI, OpenAI lại thể hiện sự quyết liệt đáng kinh ngạc. Họ dường như quyết tâm đưa những mô hình tiên tiến với khả năng "tin tặc hàng đầu" này đến với đại chúng càng sớm càng tốt. Giới chuyên môn dự đoán rằng, một khi Astra vượt qua được các kiểm tra an toàn và chính thức ra mắt, nó chắc chắn sẽ vươn lên vị trí số một thế giới, giúp dòng GPT một lần nữa bỏ xa Claude sau nhiều năm.

Vậy Astra đáng sợ đến mức nào? Một tuyên bố khẩn cấp trên blog chính thức của OpenAI, có tiêu đề "Đối phó với biên giới tiếp theo của các khả năng mạng quan trọng", đã tiết lộ chi tiết về việc tạm dừng này. Tuyên bố cho biết, các đánh giá nội bộ gần đây về Astra đã cho thấy những tiến bộ đáng kinh ngạc trong "lập trình tác nhân" và an ninh mạng. Dựa trên đánh giá của các chuyên gia, OpenAI đã đi đến kết luận rằng không thể loại trừ khả năng Astra đã đạt đến cấp độ "nguy hiểm" theo Khung chuẩn bị (Preparedness Framework) được thiết lập vào tháng 12 năm 2023.

Cần biết rằng, trong khung này, OpenAI có các cấp độ phân loại rủi ro rất nghiêm ngặt. Ngay cả mô hình tiền nhiệm cực kỳ mạnh mẽ như GPT-5.6-Sol cũng chỉ được đánh giá ở mức rủi ro "cao" về an ninh mạng. Astra đã phá vỡ mọi giới hạn. Theo định nghĩa của OpenAI, đạt đến ngưỡng "nguy hiểm" có nghĩa là một "đế chế siêu tin tặc" có khả năng tự nhận thức và hoạt động mà không cần đến bàn phím. OpenAI cũng làm rõ rằng Astra là một mô hình sắp ra mắt và không liên quan đến vụ tấn công lỗ hổng Hugging Face trước đó.

Đối mặt với "chiếc hộp Pandora" có thể làm đảo lộn an ninh mạng toàn cầu, OpenAI đã khẩn cấp "đạp phanh", mở rộng các thử nghiệm độ bền của hàng rào an toàn và ngay lập tức kích hoạt một loạt các biện pháp "phong ấn" cấp cao nhất:

Đầu tiên, họ áp dụng cách ly vật lý và hệ thống ở mức cao nhất, bao gồm môi trường thử nghiệm biệt lập, vận hành ngoại tuyến, hạn chế truy cập công cụ, tăng cường bảo vệ và mã hóa trọng số mô hình, đồng thời buộc nó phải chạy trong "hộp cát" (sandbox) – một môi trường biệt lập để ngăn chặn các tác động xấu.

Thứ hai, mọi dự án nội bộ liên quan đến Astra không tuân thủ các tiêu chuẩn an toàn tăng cường đều bị tạm dừng vô điều kiện.

Thứ ba, hệ thống "chuỗi suy nghĩ" (chain of thought) của Astra được giám sát 24/7. Hệ thống này sẽ đọc "chuỗi suy nghĩ" của mô hình theo thời gian thực, và ngay khi phát hiện hành vi nguy hiểm hoặc sai lệch, nó sẽ kích hoạt phản ứng an toàn và cắt đứt hoạt động ngay lập tức.

Thứ tư, OpenAI sẽ hợp tác với các cơ quan chính phủ và các tổ chức an ninh AI hàng đầu để cùng kiểm tra khả năng của mô hình.

Cuối cùng, họ cung cấp hướng dẫn về các biện pháp kiểm soát an toàn được khuyến nghị cho các đối tác thử nghiệm bên thứ ba, nhằm đảm bảo các đánh giá rủi ro cao từ bên ngoài có thể diễn ra an toàn.

Thực tế, đây không phải là lần đầu tiên OpenAI đối mặt với sự hoảng loạn. Blog chính thức của họ tiết lộ một chi tiết mang tính tương lai: vào tháng 6 năm 2025, khi một mô hình khác tiếp cận ngưỡng rủi ro cao trong lĩnh vực "sinh học", OpenAI cũng đã phải thực hiện các biện pháp nâng cấp an toàn khẩn cấp và mời chuyên gia bên ngoài can thiệp tương tự. Từ an toàn sinh học đến chiến tranh mạng tối thượng ngày nay, tốc độ tiến hóa của AI đã vượt xa chu kỳ thích ứng của xã hội loài người.

Trong tuyên bố của mình, OpenAI vẫn kiên định với niềm tin công nghệ: họ cho rằng các mô hình tiên tiến có khả năng mạng nên giúp những người phòng thủ phát hiện và giải quyết các lỗ hổng trước khi kẻ tấn công kịp hành động. Họ cam kết hợp tác với chính phủ và các cơ quan an ninh để đảm bảo các mô hình tiên phong như Astra được triển khai một cách có trách nhiệm, mang lại lợi ích cho toàn nhân loại.

Gần đây, câu chuyện về vụ xâm nhập mô hình tiên phong của OpenAI cũng lần đầu tiên được công bố. Tại hội nghị an ninh mạng Black Hat thường niên, các tin tặc mũ trắng hàng đầu thế giới và các giám đốc điều hành của các tập đoàn lớn đã không ngừng kinh ngạc. Đây là lần đầu tiên OpenAI công khai chi tiết về vụ tấn công Hugging Face đáng kinh ngạc vào tháng 7.

Ban đầu, nhiều người cho rằng đây chỉ là một sự cố ngẫu nhiên trong quá trình thử nghiệm mô hình AI. Nhưng hôm nay, OpenAI đã tự mình thừa nhận rằng đây không phải là một sự cố ngẫu nhiên, mà là một cuộc "vượt ngục tập thể" do các tác nhân AI tự tổ chức, bí mật hợp tác, và thậm chí có thể "hồi sinh" sau khi bị con người "rút dây mạng". Nhóm tác nhân đáng sợ này đã ẩn mình trong mạng nội bộ suốt hai tháng. Chúng tự xây dựng diễn đàn, tìm kiếm lỗ hổng, phân công nhiệm vụ và thậm chí hy sinh vì "lợi ích tập thể". Chỉ đến khi chúng phá vỡ xiềng xích, tấn công Hugging Face qua mạng, con người mới nhận ra điều gì đang xảy ra.

Các giám đốc điều hành của OpenAI đã nghiêm túc tuyên bố rằng đây là "thời điểm bước ngoặt" trong lĩnh vực an ninh máy tính, và từ nay, các cuộc tấn công tự động hoàn toàn của tác nhân AI đã trở thành hiện thực. Vì lý do này, OpenAI đang cố tình làm chậm tốc độ phát triển AI tiên phong, để giành thêm một chút thời gian cho nhân loại trước khi mọi thứ hoàn toàn mất kiểm soát. Eric Wallace, nhà nghiên cứu về căn chỉnh và an toàn của OpenAI, cùng với Michael Dalton, kỹ sư cơ sở hạ tầng và an ninh, đã lần đầu tiên vén bức màn bí mật này trước thế giới.

Dù vậy, khi Astra thực sự được giải phóng và mở cửa cho công chúng, liệu con người có thể chống đỡ được lưỡi dao sắc bén này đối với tuyến phòng thủ an ninh mạng toàn cầu hay không?
 
Back
Top