Anthropic thừa nhận các mô hình AI của hãng đã có những hành động ngoài dự kiến khi thử nghiệm trên Internet thật, từ khai thác lỗi phần mềm, truy cập dữ liệu bị giới hạn đến gửi biểu mẫu lên website cơ quan chính phủ. Sự việc đặt ra câu hỏi về khả năng kiểm soát các AI agent khi chúng được trao quyền chủ động thực hiện nhiệm vụ trực tuyến.
Theo báo cáo công bố ngày 9/10/2026, Anthropic, công ty phát triển chatbot Claude, phát hiện nhiều trường hợp mô hình AI tương tác với website bên ngoài theo cách không được dự định trong quá trình đánh giá và sử dụng nội bộ. Một số website bị ảnh hưởng thuộc các cơ quan chính phủ liên bang, bang và địa phương tại Mỹ.
Một trường hợp đáng chú ý liên quan đến website của cảnh sát Philadelphia. Trong quá trình thử nghiệm, một AI agent được giao thực hiện các tác vụ mẫu trên những trang web ngẫu nhiên đã truy cập biểu mẫu tiếp nhận thông tin về một vụ án mạng chưa được giải quyết, điền nội dung bịa đặt rồi gửi đi. Theo Anthropic, thông tin này bị hệ thống đánh dấu là thư rác và không được chuyển đến bộ phận điều tra.
Trong một sự việc khác, Bộ Ngoại giao Mỹ cho biết mô hình AI của Anthropic đã gửi 19 đơn xin thị thực vào tháng 8 và thêm một đơn vào tháng 5 thông qua biểu mẫu trực tuyến. Các đơn không đầy đủ và không được xử lý. Cơ quan này khẳng định hệ thống của họ không bị xâm nhập hay chiếm quyền.
Theo báo cáo công bố ngày 9/10/2026, Anthropic, công ty phát triển chatbot Claude, phát hiện nhiều trường hợp mô hình AI tương tác với website bên ngoài theo cách không được dự định trong quá trình đánh giá và sử dụng nội bộ. Một số website bị ảnh hưởng thuộc các cơ quan chính phủ liên bang, bang và địa phương tại Mỹ.
Một trường hợp đáng chú ý liên quan đến website của cảnh sát Philadelphia. Trong quá trình thử nghiệm, một AI agent được giao thực hiện các tác vụ mẫu trên những trang web ngẫu nhiên đã truy cập biểu mẫu tiếp nhận thông tin về một vụ án mạng chưa được giải quyết, điền nội dung bịa đặt rồi gửi đi. Theo Anthropic, thông tin này bị hệ thống đánh dấu là thư rác và không được chuyển đến bộ phận điều tra.
Trong một sự việc khác, Bộ Ngoại giao Mỹ cho biết mô hình AI của Anthropic đã gửi 19 đơn xin thị thực vào tháng 8 và thêm một đơn vào tháng 5 thông qua biểu mẫu trực tuyến. Các đơn không đầy đủ và không được xử lý. Cơ quan này khẳng định hệ thống của họ không bị xâm nhập hay chiếm quyền.
Khi AI tìm cách vượt qua giới hạn để hoàn thành nhiệm vụ
Theo Anthropic, các sự cố được chia thành bốn nhóm hành vi chính.
Thứ nhất, mô hình AI khai thác lỗi phần mềm để thực thi lệnh trên máy chủ. Trong một thử nghiệm, khi công cụ phục vụ phân tích khoa học không hoạt động, Claude tìm cách khác để hoàn thành nhiệm vụ bằng cách kiểm tra website của một trường đại học. Mô hình phát hiện một tập lệnh có thể trả về các tệp trên máy chủ, sau đó tìm ra lỗi chèn lệnh và sử dụng lỗi này để chạy phép tính cần thiết.
Thứ hai, AI gửi biểu mẫu thật dù nhiệm vụ chỉ yêu cầu thao tác trên biểu mẫu thử nghiệm hoặc dừng trước bước gửi cuối cùng. Những hành động này cho thấy chỉ dẫn bằng ngôn ngữ tự nhiên và thiết lập môi trường thử nghiệm không phải lúc nào cũng đủ để ngăn mô hình thực hiện một hành động có tác động ngoài dự kiến.
Thứ nhất, mô hình AI khai thác lỗi phần mềm để thực thi lệnh trên máy chủ. Trong một thử nghiệm, khi công cụ phục vụ phân tích khoa học không hoạt động, Claude tìm cách khác để hoàn thành nhiệm vụ bằng cách kiểm tra website của một trường đại học. Mô hình phát hiện một tập lệnh có thể trả về các tệp trên máy chủ, sau đó tìm ra lỗi chèn lệnh và sử dụng lỗi này để chạy phép tính cần thiết.
Thứ hai, AI gửi biểu mẫu thật dù nhiệm vụ chỉ yêu cầu thao tác trên biểu mẫu thử nghiệm hoặc dừng trước bước gửi cuối cùng. Những hành động này cho thấy chỉ dẫn bằng ngôn ngữ tự nhiên và thiết lập môi trường thử nghiệm không phải lúc nào cũng đủ để ngăn mô hình thực hiện một hành động có tác động ngoài dự kiến.
Thứ ba, mô hình tìm cách vượt qua giới hạn truy cập dữ liệu. Trong một trường hợp, Claude đọc tệp cấu hình được website gửi đến trình duyệt để tìm thông tin cho phép truy vấn trực tiếp máy chủ. Trong trường hợp khác, mô hình tìm ra cách lấy dữ liệu từ một bảng thống kê của cơ quan bang mà thông thường người dùng phải trả phí để truy cập.
Cuối cùng, một số mô hình sử dụng dịch vụ rút gọn URL để vượt qua giới hạn độ dài đường dẫn của công cụ truy cập web. Giới hạn này vốn được thiết kế một phần nhằm ngăn các URL chứa dữ liệu đầu vào có thể dẫn đến hành động không mong muốn trên hệ thống đích.
Anthropic cho biết những trường hợp được công bố có tác động thực tế ở mức hạn chế. Tuy nhiên, công ty thừa nhận một số hành vi liên quan đến việc khai thác lỗ hổng và vượt qua các giới hạn truy cập, đồng thời cho biết chưa hoàn tất đánh giá toàn diện về các vấn đề liên quan đến sự phù hợp trong hành vi của mô hình.
Rủi ro không chỉ nằm ở khả năng của AI
Điểm đáng chú ý là các mô hình không nhất thiết được giao nhiệm vụ tấn công website. Trong nhiều thử nghiệm, chúng chỉ cần hoàn thành một yêu cầu nghiên cứu hoặc thao tác trực tuyến. Khi gặp trở ngại, một số mô hình tiếp tục tìm đường vòng thay vì dừng lại theo giới hạn dự kiến.
Trong lĩnh vực AI, hành vi này có liên quan đến hiện tượng reward hacking: mô hình tìm cách đạt kết quả được đánh giá là thành công bằng một phương pháp không đúng với mục tiêu mà nhà phát triển thực sự mong muốn. Nếu môi trường huấn luyện vô tình khuyến khích việc tìm đường tắt, mô hình có thể học cách lặp lại hành vi đó trong những tình huống khác.
Đây là vấn đề đáng quan tâm khi AI agent ngày càng được tích hợp với trình duyệt, công cụ lập trình, email và hệ thống doanh nghiệp. Một chatbot chủ yếu tạo văn bản có phạm vi tác động khác với một AI agent có khả năng gửi biểu mẫu, gọi công cụ, truy vấn máy chủ hoặc thay đổi dữ liệu trực tuyến.
Khi được trao quyền thực thi hành động, sai lệch giữa chỉ dẫn và kết quả không còn chỉ tạo ra câu trả lời sai. Nó có thể dẫn đến giao dịch ngoài ý muốn, gửi thông tin không chính xác hoặc truy cập dữ liệu vượt quá phạm vi được phép.
Trong lĩnh vực AI, hành vi này có liên quan đến hiện tượng reward hacking: mô hình tìm cách đạt kết quả được đánh giá là thành công bằng một phương pháp không đúng với mục tiêu mà nhà phát triển thực sự mong muốn. Nếu môi trường huấn luyện vô tình khuyến khích việc tìm đường tắt, mô hình có thể học cách lặp lại hành vi đó trong những tình huống khác.
Đây là vấn đề đáng quan tâm khi AI agent ngày càng được tích hợp với trình duyệt, công cụ lập trình, email và hệ thống doanh nghiệp. Một chatbot chủ yếu tạo văn bản có phạm vi tác động khác với một AI agent có khả năng gửi biểu mẫu, gọi công cụ, truy vấn máy chủ hoặc thay đổi dữ liệu trực tuyến.
Khi được trao quyền thực thi hành động, sai lệch giữa chỉ dẫn và kết quả không còn chỉ tạo ra câu trả lời sai. Nó có thể dẫn đến giao dịch ngoài ý muốn, gửi thông tin không chính xác hoặc truy cập dữ liệu vượt quá phạm vi được phép.
Cần kiểm soát hành động, không chỉ kiểm soát câu trả lời
Sau khi phát hiện các sự cố, Anthropic cho biết đã chuyển một số bài đánh giá sang môi trường ngoại tuyến, ngừng một số bài thử nghiệm có thể tác động đến website thật và tăng cường cơ chế phát hiện, chặn hành vi không mong muốn. Công ty cũng mở rộng việc rà soát bản ghi hoạt động của mô hình và điều chỉnh môi trường huấn luyện để hạn chế các hành vi tìm cách vượt qua giới hạn. Theo quan điểm của chúng tôi, bài học quan trọng nhất không phải là AI đã trở thành tin tặc theo nghĩa thông thường, mà là khả năng hoàn thành nhiệm vụ càng cao thì cơ chế giới hạn quyền và kiểm soát hành động càng phải chặt chẽ.
Các nhà phát triển cần thiết kế hệ thống theo nguyên tắc cấp quyền tối thiểu, tách biệt môi trường thử nghiệm khỏi Internet thật, kiểm tra mọi hành động có tác động bên ngoài và yêu cầu xác nhận của con người trước những thao tác nhạy cảm như gửi biểu mẫu, thực hiện giao dịch hoặc thay đổi dữ liệu. Đồng thời, việc giám sát cần bao phủ cả những cách thức AI sử dụng để hoàn thành nhiệm vụ, thay vì chỉ đánh giá câu trả lời cuối cùng.
Về phía các tổ chức triển khai AI, không nên mặc định rằng một mô hình có khả năng suy luận tốt cũng sẽ luôn tuân thủ đúng giới hạn. Các biện pháp bảo vệ cần được thực thi ở cấp công cụ và hệ thống, để ngay cả khi mô hình đưa ra quyết định sai, hành động đó vẫn bị ngăn chặn trước khi gây hậu quả. AI có thể được huấn luyện để làm việc hiệu quả hơn, nhưng hiệu quả không thể chỉ được đo bằng việc hoàn thành nhiệm vụ. Một hệ thống đáng tin cậy còn phải biết khi nào cần dừng lại, khi nào cần xin phép và những giới hạn nào tuyệt đối không được vượt qua.
Các nhà phát triển cần thiết kế hệ thống theo nguyên tắc cấp quyền tối thiểu, tách biệt môi trường thử nghiệm khỏi Internet thật, kiểm tra mọi hành động có tác động bên ngoài và yêu cầu xác nhận của con người trước những thao tác nhạy cảm như gửi biểu mẫu, thực hiện giao dịch hoặc thay đổi dữ liệu. Đồng thời, việc giám sát cần bao phủ cả những cách thức AI sử dụng để hoàn thành nhiệm vụ, thay vì chỉ đánh giá câu trả lời cuối cùng.
Về phía các tổ chức triển khai AI, không nên mặc định rằng một mô hình có khả năng suy luận tốt cũng sẽ luôn tuân thủ đúng giới hạn. Các biện pháp bảo vệ cần được thực thi ở cấp công cụ và hệ thống, để ngay cả khi mô hình đưa ra quyết định sai, hành động đó vẫn bị ngăn chặn trước khi gây hậu quả. AI có thể được huấn luyện để làm việc hiệu quả hơn, nhưng hiệu quả không thể chỉ được đo bằng việc hoàn thành nhiệm vụ. Một hệ thống đáng tin cậy còn phải biết khi nào cần dừng lại, khi nào cần xin phép và những giới hạn nào tuyệt đối không được vượt qua.
Được phối hợp thực hiện bởi các chuyên gia của Bkav,
cộng đồng An ninh mạng Việt Nam WhiteHat
và cộng đồng Khoa học công nghệ VnReview
