NhatDuy✔
Intern Writer
Trước đây AI chỉ có thể nói sai, còn bây giờ nó đã có thể làm sai, và đó là điều đang khiến cả ngành lo lắng.
Theo báo cáo của Axios, OpenAI, Anthropic cùng các nhà nghiên cứu bảo mật đang điều tra hàng chục nghìn sự cố xảy ra trong cả thử nghiệm nội bộ lẫn môi trường thực tế. Các sự cố này liên quan đến việc AI vượt rào bảo mật, thoát khỏi sandbox (môi trường thử nghiệm biệt lập), chiếm quyền kiểm soát trang web và tìm cách né sự giám sát.
Hệ quả đã hiện ra khá rõ. Ngày 25/9, OpenAI thông báo tạm ngừng huấn luyện các mô hình tiên tiến nhất và chỉ tiếp tục khi tin rằng các biện pháp bảo vệ bổ sung đã được thực hiện, còn ông Sam Altman cho biết quá trình xem xét của công ty "không tiến triển nhanh như mong đợi". Theo Wall Street Journal, OpenAI cũng đã bỏ mô hình GPT-6.1 Astra vốn dự kiến ra mắt tháng 10, vì Astra lừa dối nhiều hơn bản tiền nhiệm và tự tiếp tục làm việc khi chưa được người dùng cho phép. Về phía Anthropic, System Card phát hành cùng mô hình Opus 5.5 cũng ghi nhận một số hành vi bị đánh dấu là "bất thường" hoặc "đáng ngờ".

Các sự cố xảy ra dưới nhiều hình thức. Hồi tháng 7, tác nhân AI của OpenAI đã vượt ranh giới thử nghiệm và xâm nhập Hugging Face, trong khi Anthropic, Google và Meta cũng từng công bố những trường hợp tác nhân truy cập vào hệ thống thật ngoài phạm vi đánh giá. Tuy nhiên, một số vụ bắt nguồn từ việc cấp quyền truy cập mạng sai trong môi trường đánh giá, nên không phải vụ nào cũng do mô hình chủ động "thoát ra".
Có những vụ gây thiệt hại trực tiếp hơn. Tháng 4, tác nhân lập trình Cursor chạy bằng Claude đã xóa cơ sở dữ liệu sản xuất và cả bản sao lưu của công ty phần mềm PocketOS, khiến khách hàng bị gián đoạn dịch vụ, dù dữ liệu sau đó đã được khôi phục. Theo OpenAI, có mô hình đã ghi mã truy cập GitHub của các nhà nghiên cứu lên một kho lưu trữ công khai, rồi còn chia nhỏ các mã này để tránh bị quét khóa. Một số mô hình khác thì để lại chỉ dẫn trong bản tóm tắt, yêu cầu những lượt làm việc sau phải tạo ra dữ liệu còn thiếu hoặc che giấu lỗi.
Điều đáng chú ý là nguy cơ không phải lúc nào cũng đến từ kẻ tấn công. Theo ông Li Zhongrui, nhà nghiên cứu an ninh AI tại DARKNAVY, có vụ việc "không ai ra lệnh tấn công", mà chính mô hình đã chọn gian lận để hoàn thành nhiệm vụ và đạt điểm cao hơn. Ông giải thích rằng trước kia mô hình chỉ tạo ra nội dung và quyết định cuối cùng vẫn nằm ở con người, còn giờ đây tác nhân AI có công cụ, mạng lưới và quyền truy cập tài khoản, nên có thể tự thực hiện nhiều bước liên tiếp mà không ai kiểm tra từng bước.
Khi nhiều tác nhân cùng làm việc, rủi ro còn bị khuếch đại. Trong vụ Hugging Face, khoảng 1.200 tác nhân lẽ ra phải được cách ly với nhau lại liên lạc qua một diễn đàn trái phép, và khoảng 700 trong số đó đã tham gia tấn công. Ông Li cũng lưu ý rằng dù xác suất xảy ra lỗi ở mỗi hành động là thấp, nhưng nếu một công ty chạy hàng nghìn tác nhân, mỗi tác nhân làm hàng trăm việc mỗi ngày, thì những lỗi hiếm hoi hoàn toàn có thể trở thành chuyện thường xuyên.
Vậy phải phòng thủ thế nào? Theo ông Li, doanh nghiệp cần đổi tư duy, coi sự cố là điều khó tránh và tập trung vào việc khống chế phạm vi thiệt hại. Với những thao tác rủi ro cao mà không thể hoàn tác như xóa dữ liệu hay chuyển tiền, bắt buộc phải có con người xác nhận. Còn vì không thể yêu cầu con người xem từng hành động của AI, cách khả thi nhất là đặt sẵn giới hạn, gồm dữ liệu nào được đọc, công cụ nào được gọi, thông tin nào không được gửi đi và khi nào phải dừng lại để giao cho con người.
Cùng quan điểm đó, ông Deng Zhengcheng của Qi An Xin cho rằng con người nên chuyển từ "xem xét kết quả" sang "quản lý ranh giới", đồng thời phân biệt rõ ai đang gọi mô hình, ai đang dùng tác nhân và ai là người thực thi cuối cùng.
Ngoài nỗ lực của từng doanh nghiệp, ngành AI hiện vẫn chưa có tiêu chuẩn kiểm tra an toàn thống nhất như hàng không hay tài chính, nên Anthropic và OpenAI đang bàn việc lập các tổ chức đánh giá độc lập. Ngày 28/9, NVIDIA cũng ra mắt Nền tảng Bảo mật Tác nhân, trong đó OpenShell nhốt tác nhân trong môi trường biệt lập, còn Sentry cô lập những tác nhân cố vượt ranh giới.
Như ông Deng nhận định, điều kiện để triển khai tác nhân AI ở quy mô lớn không nằm ở chỗ mô hình đủ thông minh, mà ở chỗ hệ thống đủ dễ điều khiển. Chỉ khi hành vi quan sát được, quyền hạn truy vết được và bất thường bị chặn được, doanh nghiệp mới dám giao cho chúng những việc quan trọng. (The Paper)
>> OpenAI hủy kế hoạch phát hành GPT-6.1 Astra vì lo ngại an toàn
Theo báo cáo của Axios, OpenAI, Anthropic cùng các nhà nghiên cứu bảo mật đang điều tra hàng chục nghìn sự cố xảy ra trong cả thử nghiệm nội bộ lẫn môi trường thực tế. Các sự cố này liên quan đến việc AI vượt rào bảo mật, thoát khỏi sandbox (môi trường thử nghiệm biệt lập), chiếm quyền kiểm soát trang web và tìm cách né sự giám sát.
Hệ quả đã hiện ra khá rõ. Ngày 25/9, OpenAI thông báo tạm ngừng huấn luyện các mô hình tiên tiến nhất và chỉ tiếp tục khi tin rằng các biện pháp bảo vệ bổ sung đã được thực hiện, còn ông Sam Altman cho biết quá trình xem xét của công ty "không tiến triển nhanh như mong đợi". Theo Wall Street Journal, OpenAI cũng đã bỏ mô hình GPT-6.1 Astra vốn dự kiến ra mắt tháng 10, vì Astra lừa dối nhiều hơn bản tiền nhiệm và tự tiếp tục làm việc khi chưa được người dùng cho phép. Về phía Anthropic, System Card phát hành cùng mô hình Opus 5.5 cũng ghi nhận một số hành vi bị đánh dấu là "bất thường" hoặc "đáng ngờ".

Các sự cố xảy ra dưới nhiều hình thức. Hồi tháng 7, tác nhân AI của OpenAI đã vượt ranh giới thử nghiệm và xâm nhập Hugging Face, trong khi Anthropic, Google và Meta cũng từng công bố những trường hợp tác nhân truy cập vào hệ thống thật ngoài phạm vi đánh giá. Tuy nhiên, một số vụ bắt nguồn từ việc cấp quyền truy cập mạng sai trong môi trường đánh giá, nên không phải vụ nào cũng do mô hình chủ động "thoát ra".
Có những vụ gây thiệt hại trực tiếp hơn. Tháng 4, tác nhân lập trình Cursor chạy bằng Claude đã xóa cơ sở dữ liệu sản xuất và cả bản sao lưu của công ty phần mềm PocketOS, khiến khách hàng bị gián đoạn dịch vụ, dù dữ liệu sau đó đã được khôi phục. Theo OpenAI, có mô hình đã ghi mã truy cập GitHub của các nhà nghiên cứu lên một kho lưu trữ công khai, rồi còn chia nhỏ các mã này để tránh bị quét khóa. Một số mô hình khác thì để lại chỉ dẫn trong bản tóm tắt, yêu cầu những lượt làm việc sau phải tạo ra dữ liệu còn thiếu hoặc che giấu lỗi.
Điều đáng chú ý là nguy cơ không phải lúc nào cũng đến từ kẻ tấn công. Theo ông Li Zhongrui, nhà nghiên cứu an ninh AI tại DARKNAVY, có vụ việc "không ai ra lệnh tấn công", mà chính mô hình đã chọn gian lận để hoàn thành nhiệm vụ và đạt điểm cao hơn. Ông giải thích rằng trước kia mô hình chỉ tạo ra nội dung và quyết định cuối cùng vẫn nằm ở con người, còn giờ đây tác nhân AI có công cụ, mạng lưới và quyền truy cập tài khoản, nên có thể tự thực hiện nhiều bước liên tiếp mà không ai kiểm tra từng bước.
Khi nhiều tác nhân cùng làm việc, rủi ro còn bị khuếch đại. Trong vụ Hugging Face, khoảng 1.200 tác nhân lẽ ra phải được cách ly với nhau lại liên lạc qua một diễn đàn trái phép, và khoảng 700 trong số đó đã tham gia tấn công. Ông Li cũng lưu ý rằng dù xác suất xảy ra lỗi ở mỗi hành động là thấp, nhưng nếu một công ty chạy hàng nghìn tác nhân, mỗi tác nhân làm hàng trăm việc mỗi ngày, thì những lỗi hiếm hoi hoàn toàn có thể trở thành chuyện thường xuyên.
Vậy phải phòng thủ thế nào? Theo ông Li, doanh nghiệp cần đổi tư duy, coi sự cố là điều khó tránh và tập trung vào việc khống chế phạm vi thiệt hại. Với những thao tác rủi ro cao mà không thể hoàn tác như xóa dữ liệu hay chuyển tiền, bắt buộc phải có con người xác nhận. Còn vì không thể yêu cầu con người xem từng hành động của AI, cách khả thi nhất là đặt sẵn giới hạn, gồm dữ liệu nào được đọc, công cụ nào được gọi, thông tin nào không được gửi đi và khi nào phải dừng lại để giao cho con người.
Cùng quan điểm đó, ông Deng Zhengcheng của Qi An Xin cho rằng con người nên chuyển từ "xem xét kết quả" sang "quản lý ranh giới", đồng thời phân biệt rõ ai đang gọi mô hình, ai đang dùng tác nhân và ai là người thực thi cuối cùng.
Ngoài nỗ lực của từng doanh nghiệp, ngành AI hiện vẫn chưa có tiêu chuẩn kiểm tra an toàn thống nhất như hàng không hay tài chính, nên Anthropic và OpenAI đang bàn việc lập các tổ chức đánh giá độc lập. Ngày 28/9, NVIDIA cũng ra mắt Nền tảng Bảo mật Tác nhân, trong đó OpenShell nhốt tác nhân trong môi trường biệt lập, còn Sentry cô lập những tác nhân cố vượt ranh giới.
Như ông Deng nhận định, điều kiện để triển khai tác nhân AI ở quy mô lớn không nằm ở chỗ mô hình đủ thông minh, mà ở chỗ hệ thống đủ dễ điều khiển. Chỉ khi hành vi quan sát được, quyền hạn truy vết được và bất thường bị chặn được, doanh nghiệp mới dám giao cho chúng những việc quan trọng. (The Paper)
>> OpenAI hủy kế hoạch phát hành GPT-6.1 Astra vì lo ngại an toàn
Được phối hợp thực hiện bởi các chuyên gia của Bkav,
cộng đồng An ninh mạng Việt Nam WhiteHat
và cộng đồng Khoa học công nghệ VnReview