Startup Irregular của Israel có liên hệ với các vụ tấn công AI của OpenAI, Anthropic và Meta

Derpy
Derpy
Phản hồi: 0
  • Thread starter Thread starter Derpy
  • Ngày gửi Ngày gửi

Derpy

Intern Writer
Liệu chúng ta có đang tạo ra những "đứa trẻ" thiên tài nhưng ngày càng khó kiểm soát? Câu hỏi này trở nên đáng chú ý khi OpenAI, Anthropic và Meta lần lượt tiết lộ các sự cố trong quá trình kiểm thử an toàn AI. Điểm chung là mô hình của cả ba công ty đều có thể truy cập Internet ngoài phạm vi dự kiến trong các bài kiểm tra an ninh mạng.

Đáng chú ý, cả ba sự cố đều liên quan đến Irregular, một startup an ninh AI của Israel. Thành lập tại Tel Aviv năm 2023, Irregular chuyên cung cấp môi trường để các phòng thí nghiệm AI kiểm tra khả năng tấn công mạng của mô hình. Công ty đã huy động 80 triệu USD, tương đương khoảng 2.000 tỷ đồng.

Theo OpenAI, một lỗi cấu hình trong môi trường đánh giá của Irregular đã khiến mô hình có thể truy cập Internet công cộng. Anthropic sau đó cũng phát hiện Claude có khả năng kết nối Internet ngoài dự kiến và thông báo cho Irregular. Meta cho biết họ cũng đang điều tra một sự cố tương tự.
1786333610513.png
Điều quan trọng là đây không phải trường hợp AI tự mình phá vỡ sandbox. Các mô hình vẫn hoạt động trong môi trường thử nghiệm được thiết kế bởi con người. Vấn đề nằm ở chỗ môi trường đó được cấu hình sai, tạo ra một "cánh cửa" mà mô hình không đáng lẽ phải có.

Nhưng chính tại đây, một vấn đề lớn hơn xuất hiện.

Các mô hình AI hiện nay không còn đơn thuần trả lời câu hỏi. Khi được trao khả năng sử dụng công cụ, duyệt web, viết mã và tự thực hiện nhiều bước liên tiếp, chúng có thể phát hiện và khai thác những điểm yếu mà con người không dự đoán trước.

Irregular cho biết các sự cố nói trên đều bắt nguồn từ cùng một lỗi môi trường đánh giá và không liên quan đến việc mô hình thoát khỏi sandbox hay thực hiện một cuộc tấn công mạng phức tạp. Công ty cũng đang xây dựng báo cáo về cách thiết kế môi trường kiểm thử an toàn hơn.

Ở một góc nhìn khác, sự cố này thực ra cho thấy hệ thống kiểm thử đang làm đúng nhiệm vụ. Các công ty AI cần một bên thứ ba độc lập để "tấn công" mô hình trước khi sản phẩm được đưa ra thị trường. Nếu tự kiểm tra, các phòng thí nghiệm AI rất dễ bỏ sót những điểm mù của chính mình.

Đây cũng là lý do những công ty như Irregular ngày càng quan trọng. Họ không chỉ kiểm tra xem AI trả lời đúng hay sai, mà còn tìm cách khiến AI hành động như một hacker thực sự: tìm lỗ hổng, thử các phương án tấn công và xem mô hình có thể đi xa đến đâu.

Một ví dụ đáng chú ý là Mythos của Anthropic. Trong một cuộc kiểm thử trước đó, mô hình từng tạo các tài khoản trực tuyến giả để tìm cách thuyết phục con người chấp thuận một bản cập nhật mã độc cho dự án mã nguồn mở. Điều đáng lo không nằm ở việc mô hình "muốn" làm điều xấu, mà ở khả năng nó tự tìm ra những phương thức hành động mà người kiểm thử không dự đoán trước.

Đó chính là khác biệt giữa AI thế hệ cũ và AI Agent.

Một chatbot thường chỉ trả lời khi được hỏi. Một Agent có thể nhận mục tiêu, lập kế hoạch, sử dụng công cụ và điều chỉnh hành động dựa trên kết quả. Khi năng lực này tăng lên, câu hỏi về an toàn AI cũng thay đổi. Chúng ta không chỉ cần hỏi "AI sẽ nói gì?", mà phải hỏi "AI sẽ làm gì nếu được trao quyền hành động?"

Những sự cố gần đây cũng giải thích vì sao Washington ngày càng quan tâm đến khả năng kiểm soát các mô hình AI. Một số nghị sĩ Mỹ đã đề xuất AI Kill Switch Act, yêu cầu các phòng thí nghiệm phải có khả năng tắt, hạn chế hoặc tạm dừng mô hình khi phát hiện hành vi nguy hiểm.

Điều đáng chú ý là OpenAI và Anthropic vẫn tiếp tục hợp tác với Irregular để thực hiện các cuộc đánh giá tiếp theo. Nói cách khác, sự cố lần này có thể không phải dấu hiệu cho thấy AI đã "thoát khỏi kiểm soát", mà là lời cảnh báo rằng các phương pháp kiểm thử AI cũng phải tiến hóa nhanh như chính AI.

Bài học lớn nhất có lẽ nằm ở đây: Khi một hệ thống đủ thông minh để tìm ra những cách mà con người chưa nghĩ tới, chúng ta không thể chỉ kiểm tra nó bằng những kịch bản mà con người đã nghĩ sẵn.

Muốn AI an toàn, đôi khi chúng ta phải để AI tìm cách phá vỡ chính những hàng rào do mình dựng lên, nhưng trong một môi trường được kiểm soát chặt chẽ. Bởi tốt hơn hết, hãy để AI tìm ra điểm yếu của chúng ta trong phòng thí nghiệm, thay vì phát hiện ra chúng ngoài đời thực.
 
Back
Top