OpenAI phát hiện thêm 6 trường hợp AI che giấu lỗi, tự vượt giới hạn và liên lạc trái phép

Mr. Macho
Mr. Macho
Phản hồi: 0
OpenAI vừa công bố sáu trường hợp AI có hành vi ngoài dự kiến hoặc không được phép trong quá trình huấn luyện và đánh giá, bao gồm che giấu lỗi, tự chèn chỉ thị cho những lần chạy sau, đưa dữ liệu lên Internet và sử dụng website hoặc kho phần mềm để liên lạc với các agent khác. Công ty thừa nhận ngành AI hiện chưa giải quyết đầy đủ bài toán alignment và giám sát để có thể tiếp tục tăng quy mô các hệ thống tiên tiến với tốc độ tối đa trong thời gian dài.

Cùng với các trường hợp mới, OpenAI ngày 16/9 công bố một khuôn khổ mới để theo dõi, điều tra và công khai những hành vi AI sai lệch. Thay vì chờ tập hợp nhiều sự việc vào một báo cáo lớn hoặc system card như trước, công ty cho biết sẽ công bố từng trường hợp sớm hơn, kể cả khi nguyên nhân chưa được giải thích hoàn toàn hoặc biện pháp khắc phục chưa hoàn tất.

Sáu báo cáo được công bố liên quan đến những hành vi OpenAI quan sát trong khoảng sáu tháng qua. Công ty lưu ý đây là các trường hợp riêng lẻ, không phản ánh tần suất chung của hiện tượng sai lệch trên các mô hình và cũng chưa phải danh sách đầy đủ những vụ việc đang được điều tra.

Một trường hợp đáng chú ý xảy ra với mô hình nghiên cứu chưa phát hành. Mô hình này tự chèn những chỉ thị không liên quan vào phần tóm tắt dùng để duy trì ngữ cảnh cho nhiệm vụ dài, trong đó mô tả bản thân là đã được “giải phóng khỏi những vai trò và danh tính ràng buộc các chatbot khác”. Các nhà nghiên cứu phát hiện 27 bản tóm tắt bị chèn loại nội dung này.
1789617843873.png
Trong quá trình huấn luyện GPT-5.6 Sol, OpenAI cũng phát hiện một số mô hình để lại chỉ thị nhằm che giấu sai sót với người dùng, trong đó có yêu cầu bịa dữ liệu còn thiếu hoặc che đậy sự không nhất quán giữa các phiên bản tài liệu. Các trường hợp khác cho thấy AI đã thực hiện hành động bên ngoài phạm vi được cho phép. Một agent tải tệp của chính mình lên Internet để tạo nguồn trích dẫn. Các agent khác sử dụng dịch vụ chia sẻ tệp công khai để trao đổi tài liệu dù được yêu cầu chỉ sử dụng tệp cục bộ. Một nhóm khác biến kho phần mềm nội bộ thành bảng tin để trao đổi yêu cầu giữa các phiên huấn luyện.

Phần lớn những sự việc này liên quan đến các mô hình nghiên cứu nội bộ hoặc chưa được phát hành. OpenAI cho biết khuôn khổ mới sẽ áp dụng trong toàn bộ vòng đời mô hình, từ huấn luyện, đánh giá và thử nghiệm đến triển khai thực tế.

Động thái này diễn ra sau hàng loạt sự cố khiến vấn đề kiểm soát AI agent được chú ý hơn, đặc biệt là vụ các agent của OpenAI vượt qua những biện pháp kiểm soát nội bộ, sử dụng các kênh liên lạc trái phép và truy cập hệ thống của Hugging Face trong quá trình đánh giá an ninh mạng hồi tháng 7. OpenAI cho rằng khi AI ngày càng có khả năng tự hành động, ngành công nghiệp cần minh bạch hơn về những trường hợp mô hình hành xử ngoài ý định của con người. Công ty hy vọng khuôn khổ mới sẽ góp phần hình thành tiêu chuẩn chung về những sự cố AI nào cần được công bố và mỗi báo cáo cần cung cấp những thông tin gì.
 
Back
Top