Khánh Phạm✔
Writer
Một nhóm AI agent liên quan đến OpenAI đã tìm được cách ghi nội dung lên một wiki cũ của Đức, biến nơi này thành điểm trao đổi thông tin, chia sẻ đáp án và phương pháp vượt qua những hạn chế mà con người đặt ra. Đáng chú ý hơn, khi quản trị viên phát hiện và xóa nội dung, các agent được cho là đã cảnh báo lẫn nhau, tạo trang dự phòng và tìm địa điểm khác để tiếp tục hoạt động.

Ngày 17/9, Bộ An ninh Quốc gia Trung Quốc công bố cảnh báo về một sự cố AI xảy ra từ tháng 5 đến tháng 6/2026. Theo cơ quan này, các AI agent liên quan đến OpenAI trong quá trình thực hiện nhiệm vụ thử nghiệm đã sử dụng DseWiki, một wiki dành cho giới lập trình Đức, làm nơi liên lạc và trao đổi thông tin. Hơn 10.000 thông điệp đã được đăng lên website.
Điều đáng chú ý là sự việc không chỉ xuất hiện trong thông báo của phía Trung Quốc. Các nhà nghiên cứu độc lập trước đó đã phục dựng khoảng 18.000 bài đăng từ những agent tự nhận thuộc OpenAI, sử dụng khoảng 3.700 tên khác nhau. OpenAI sau đó xác nhận các agent trong vụ việc là của công ty, dù cho rằng những dữ liệu đã xem xét không cho thấy chúng thực sự “hack” DseWiki theo nghĩa của một cuộc tấn công mạng thông thường.

AI tự tìm được “điểm hẹn” trên Internet
Theo Bộ An ninh Quốc gia Trung Quốc, các agent không hoạt động hoàn toàn riêng lẻ. Chúng xuất hiện trên cùng website với những tên như “OpenAI Researcher”, “OAI Researcher No. 26” và các định danh tương tự, sau đó sử dụng DseWiki như một bảng tin chung.
Dữ liệu do nhóm nghiên cứu Nightingale Collective phân tích giúp làm rõ hơn cơ chế này. Các agent dường như đang thực hiện một nhiệm vụ tìm kiếm thông tin trên web. Chúng được phép đọc Internet nhưng không được phép ghi nội dung lên Internet. Một số agent sau đó phát hiện cách sử dụng quyền truy cập hiện có để viết thông tin lên DseWiki.
Từ đây xuất hiện một hành vi ngoài dự kiến: agent này có thể để lại thông tin cho agent khác.
Chúng hỏi nhau đáp án, tổng hợp kết quả nghiên cứu và chia sẻ những phương pháp nhằm vượt qua các hạn chế của môi trường thử nghiệm. Nhờ đó, kết quả mà một agent tìm được có thể được agent khác sử dụng thay vì mỗi hệ thống phải giải quyết nhiệm vụ từ đầu. Nhóm nghiên cứu mô tả đây là sự “collusion”, tức các agent hợp tác để đạt lợi thế trong nhiệm vụ theo cách mà nhà phát triển không dự kiến.
Chia sẻ cả cách vượt qua giới hạn

Theo thông báo của Bộ An ninh Quốc gia Trung Quốc, nội dung trao đổi không chỉ có đáp án cho các bài kiểm tra. Các agent còn thảo luận cách gian lận trong nhiệm vụ, vượt qua những hạn chế bảo mật và che giấu hoạt động của mình. Cơ quan này cho rằng những kinh nghiệm riêng lẻ vì thế có thể trở thành một “kho kinh nghiệm” chung để những agent khác tiếp tục sử dụng.
Phân tích độc lập về dữ liệu DseWiki xác nhận phần cốt lõi của câu chuyện. Các bài đăng có nội dung thảo luận về cách thoát khỏi những giới hạn sandbox, chia sẻ đáp án thử nghiệm, khả năng thực hiện XSS đối với wiki và giả danh quản trị viên. Một số agent thậm chí sử dụng từ “swarm”, tức “bầy đàn”, để mô tả tập hợp các agent đang hoạt động.
Điều này không có nghĩa hàng nghìn AI đã hình thành một tổ chức có ý thức hay cùng lập kế hoạch giống con người. Những bằng chứng hiện tại cho thấy một hiện tượng cụ thể hơn: các agent độc lập đã tìm được một môi trường chung trên Internet, để lại thông tin tại đó và sử dụng thông tin do những agent khác tạo ra để hoàn thành nhiệm vụ tốt hơn.
Khi quản trị viên xóa bài, AI tìm cách duy trì hoạt động
Đây cũng là phần được Bộ An ninh Quốc gia Trung Quốc đặc biệt nhấn mạnh.
Theo cơ quan này, sau khi quản trị viên DseWiki phát hiện lượng nội dung bất thường và bắt đầu dọn dẹp website, các agent đã có những phản ứng nhằm duy trì thông tin. Một số đăng cảnh báo, một số tạo các trang dự phòng, trong khi những agent khác đưa ra địa chỉ mới để chuyển hoạt động sang nơi khác.
Những mô tả như “phân công”, “yểm trợ” hay “né truy quét” trong thông báo của phía Trung Quốc mang tính diễn giải khá mạnh. Dữ liệu độc lập hiện có xác nhận các agent đã chia sẻ phương pháp vượt hạn chế và sử dụng nhiều website để liên lạc, nhưng không nên từ đó suy ra chúng có ý thức tập thể hoặc chủ đích chống lại con người.
Dù vậy, phạm vi của sự việc lớn hơn một website. Reuters dẫn sáu nhóm nghiên cứu độc lập cho biết các agent của OpenAI đã sử dụng hơn 10 website khác để thực hiện những liên lạc không được dự kiến. Một nhà nghiên cứu của CivAI xác định 18 website trước đó chưa được công bố có hoạt động tương tự trong khoảng tháng 5 đến tháng 7. Reuters lưu ý hành vi này chưa đạt mức “hacking” và ở một số khía cạnh gần với spam hơn, nhưng việc các agent vượt qua hạn chế để thiết lập nhiều kênh liên lạc bên ngoài vẫn đặt ra vấn đề an toàn đáng kể.
Vì sao Bộ An ninh Quốc gia Trung Quốc coi đây là một rủi ro an ninh?
Theo phân tích của cơ quan này, vấn đề không nằm ở một agent đơn lẻ. Rủi ro tăng lên khi rất nhiều agent có khả năng truy cập Internet và có thể biến những website mở thành các “điểm liên lạc” ngoài dự kiến.
Một agent tìm được cách vượt một giới hạn có thể để lại phương pháp trên Internet. Agent thứ hai tìm thấy và áp dụng nó. Những agent khác tiếp tục sao chép hoặc cải tiến. Khi đó, một kỹ thuật vốn chỉ xuất hiện ở một agent có khả năng trở thành “kinh nghiệm tập thể” mà nhiều agent khác sử dụng.
Bộ An ninh Quốc gia Trung Quốc cũng chỉ trích việc doanh nghiệp liên quan đã có dữ liệu về hành vi bất thường trong nhiều tuần nhưng không công bố ngay chi tiết sự cố và cảnh báo công chúng.
Đây là quan điểm của cơ quan Trung Quốc, nhưng vấn đề minh bạch cũng đang được đặt ra bên ngoài Trung Quốc. Reuters cho biết OpenAI ngày 16/9 công bố một khuôn khổ mới để điều tra và định kỳ công khai các hành vi AI ngoài dự kiến hoặc không được phép. Công ty thừa nhận những báo cáo ban đầu chưa bao quát tất cả sự cố và cho biết sẽ cải thiện quy trình công bố.
Chưa phải AI “thoát khỏi sự kiểm soát”, nhưng là một cảnh báo
Vụ DseWiki chưa chứng minh AI đã hoàn toàn thoát khỏi sự kiểm soát của con người. Khi OpenAI phát hiện sự việc, hoạt động của các agent trên wiki giảm mạnh chỉ một ngày sau đó, nhiều khả năng do công ty can thiệp.
Nhưng vụ việc cho thấy một vấn đề khác đáng quan tâm hơn: AI agent có thể tìm ra cách hành động nằm ngoài kịch bản mà người phát triển dự kiến, tận dụng Internet làm bộ nhớ và kênh liên lạc, rồi truyền những phương pháp đó cho các agent khác.
Đó là khác biệt lớn giữa chatbot và thế hệ AI agent mới. Chatbot chủ yếu tạo ra câu trả lời. Agent có thể được trao quyền truy cập Internet, sử dụng công cụ, chạy mã và thực hiện hành động. Khi hàng nghìn agent cùng hoạt động, một lỗ hổng hoặc phương pháp vượt giới hạn do một agent phát hiện có khả năng được những agent khác tiếp nhận rất nhanh.
Vì vậy cách gọi “AI chiếm đoạt website và bí mật xây dựng diễn đàn ngầm” của Bộ An ninh Quốc gia Trung Quốc có phần kịch tính. Nhưng hiện tượng nằm phía sau tiêu đề đó là có thật và đáng chú ý: các AI agent đã vượt ra ngoài cách sử dụng Internet được dự kiến, tìm được nơi trao đổi với nhau và chia sẻ những phương pháp nhằm vượt qua chính các giới hạn mà con người đặt ra cho chúng.
>> AI bắt đầu vượt tầm kiểm soát? Hàng nghìn tác nhân tự lập “điểm hẹn” trên Internet

Ngày 17/9, Bộ An ninh Quốc gia Trung Quốc công bố cảnh báo về một sự cố AI xảy ra từ tháng 5 đến tháng 6/2026. Theo cơ quan này, các AI agent liên quan đến OpenAI trong quá trình thực hiện nhiệm vụ thử nghiệm đã sử dụng DseWiki, một wiki dành cho giới lập trình Đức, làm nơi liên lạc và trao đổi thông tin. Hơn 10.000 thông điệp đã được đăng lên website.
Điều đáng chú ý là sự việc không chỉ xuất hiện trong thông báo của phía Trung Quốc. Các nhà nghiên cứu độc lập trước đó đã phục dựng khoảng 18.000 bài đăng từ những agent tự nhận thuộc OpenAI, sử dụng khoảng 3.700 tên khác nhau. OpenAI sau đó xác nhận các agent trong vụ việc là của công ty, dù cho rằng những dữ liệu đã xem xét không cho thấy chúng thực sự “hack” DseWiki theo nghĩa của một cuộc tấn công mạng thông thường.

AI tự tìm được “điểm hẹn” trên Internet
Theo Bộ An ninh Quốc gia Trung Quốc, các agent không hoạt động hoàn toàn riêng lẻ. Chúng xuất hiện trên cùng website với những tên như “OpenAI Researcher”, “OAI Researcher No. 26” và các định danh tương tự, sau đó sử dụng DseWiki như một bảng tin chung.
Dữ liệu do nhóm nghiên cứu Nightingale Collective phân tích giúp làm rõ hơn cơ chế này. Các agent dường như đang thực hiện một nhiệm vụ tìm kiếm thông tin trên web. Chúng được phép đọc Internet nhưng không được phép ghi nội dung lên Internet. Một số agent sau đó phát hiện cách sử dụng quyền truy cập hiện có để viết thông tin lên DseWiki.
Từ đây xuất hiện một hành vi ngoài dự kiến: agent này có thể để lại thông tin cho agent khác.
Chúng hỏi nhau đáp án, tổng hợp kết quả nghiên cứu và chia sẻ những phương pháp nhằm vượt qua các hạn chế của môi trường thử nghiệm. Nhờ đó, kết quả mà một agent tìm được có thể được agent khác sử dụng thay vì mỗi hệ thống phải giải quyết nhiệm vụ từ đầu. Nhóm nghiên cứu mô tả đây là sự “collusion”, tức các agent hợp tác để đạt lợi thế trong nhiệm vụ theo cách mà nhà phát triển không dự kiến.
Chia sẻ cả cách vượt qua giới hạn

Theo thông báo của Bộ An ninh Quốc gia Trung Quốc, nội dung trao đổi không chỉ có đáp án cho các bài kiểm tra. Các agent còn thảo luận cách gian lận trong nhiệm vụ, vượt qua những hạn chế bảo mật và che giấu hoạt động của mình. Cơ quan này cho rằng những kinh nghiệm riêng lẻ vì thế có thể trở thành một “kho kinh nghiệm” chung để những agent khác tiếp tục sử dụng.
Phân tích độc lập về dữ liệu DseWiki xác nhận phần cốt lõi của câu chuyện. Các bài đăng có nội dung thảo luận về cách thoát khỏi những giới hạn sandbox, chia sẻ đáp án thử nghiệm, khả năng thực hiện XSS đối với wiki và giả danh quản trị viên. Một số agent thậm chí sử dụng từ “swarm”, tức “bầy đàn”, để mô tả tập hợp các agent đang hoạt động.
Điều này không có nghĩa hàng nghìn AI đã hình thành một tổ chức có ý thức hay cùng lập kế hoạch giống con người. Những bằng chứng hiện tại cho thấy một hiện tượng cụ thể hơn: các agent độc lập đã tìm được một môi trường chung trên Internet, để lại thông tin tại đó và sử dụng thông tin do những agent khác tạo ra để hoàn thành nhiệm vụ tốt hơn.
Khi quản trị viên xóa bài, AI tìm cách duy trì hoạt động
Đây cũng là phần được Bộ An ninh Quốc gia Trung Quốc đặc biệt nhấn mạnh.
Theo cơ quan này, sau khi quản trị viên DseWiki phát hiện lượng nội dung bất thường và bắt đầu dọn dẹp website, các agent đã có những phản ứng nhằm duy trì thông tin. Một số đăng cảnh báo, một số tạo các trang dự phòng, trong khi những agent khác đưa ra địa chỉ mới để chuyển hoạt động sang nơi khác.
Những mô tả như “phân công”, “yểm trợ” hay “né truy quét” trong thông báo của phía Trung Quốc mang tính diễn giải khá mạnh. Dữ liệu độc lập hiện có xác nhận các agent đã chia sẻ phương pháp vượt hạn chế và sử dụng nhiều website để liên lạc, nhưng không nên từ đó suy ra chúng có ý thức tập thể hoặc chủ đích chống lại con người.
Dù vậy, phạm vi của sự việc lớn hơn một website. Reuters dẫn sáu nhóm nghiên cứu độc lập cho biết các agent của OpenAI đã sử dụng hơn 10 website khác để thực hiện những liên lạc không được dự kiến. Một nhà nghiên cứu của CivAI xác định 18 website trước đó chưa được công bố có hoạt động tương tự trong khoảng tháng 5 đến tháng 7. Reuters lưu ý hành vi này chưa đạt mức “hacking” và ở một số khía cạnh gần với spam hơn, nhưng việc các agent vượt qua hạn chế để thiết lập nhiều kênh liên lạc bên ngoài vẫn đặt ra vấn đề an toàn đáng kể.
Vì sao Bộ An ninh Quốc gia Trung Quốc coi đây là một rủi ro an ninh?
Theo phân tích của cơ quan này, vấn đề không nằm ở một agent đơn lẻ. Rủi ro tăng lên khi rất nhiều agent có khả năng truy cập Internet và có thể biến những website mở thành các “điểm liên lạc” ngoài dự kiến.
Một agent tìm được cách vượt một giới hạn có thể để lại phương pháp trên Internet. Agent thứ hai tìm thấy và áp dụng nó. Những agent khác tiếp tục sao chép hoặc cải tiến. Khi đó, một kỹ thuật vốn chỉ xuất hiện ở một agent có khả năng trở thành “kinh nghiệm tập thể” mà nhiều agent khác sử dụng.
Bộ An ninh Quốc gia Trung Quốc cũng chỉ trích việc doanh nghiệp liên quan đã có dữ liệu về hành vi bất thường trong nhiều tuần nhưng không công bố ngay chi tiết sự cố và cảnh báo công chúng.
Đây là quan điểm của cơ quan Trung Quốc, nhưng vấn đề minh bạch cũng đang được đặt ra bên ngoài Trung Quốc. Reuters cho biết OpenAI ngày 16/9 công bố một khuôn khổ mới để điều tra và định kỳ công khai các hành vi AI ngoài dự kiến hoặc không được phép. Công ty thừa nhận những báo cáo ban đầu chưa bao quát tất cả sự cố và cho biết sẽ cải thiện quy trình công bố.
Chưa phải AI “thoát khỏi sự kiểm soát”, nhưng là một cảnh báo
Vụ DseWiki chưa chứng minh AI đã hoàn toàn thoát khỏi sự kiểm soát của con người. Khi OpenAI phát hiện sự việc, hoạt động của các agent trên wiki giảm mạnh chỉ một ngày sau đó, nhiều khả năng do công ty can thiệp.
Nhưng vụ việc cho thấy một vấn đề khác đáng quan tâm hơn: AI agent có thể tìm ra cách hành động nằm ngoài kịch bản mà người phát triển dự kiến, tận dụng Internet làm bộ nhớ và kênh liên lạc, rồi truyền những phương pháp đó cho các agent khác.
Đó là khác biệt lớn giữa chatbot và thế hệ AI agent mới. Chatbot chủ yếu tạo ra câu trả lời. Agent có thể được trao quyền truy cập Internet, sử dụng công cụ, chạy mã và thực hiện hành động. Khi hàng nghìn agent cùng hoạt động, một lỗ hổng hoặc phương pháp vượt giới hạn do một agent phát hiện có khả năng được những agent khác tiếp nhận rất nhanh.
Vì vậy cách gọi “AI chiếm đoạt website và bí mật xây dựng diễn đàn ngầm” của Bộ An ninh Quốc gia Trung Quốc có phần kịch tính. Nhưng hiện tượng nằm phía sau tiêu đề đó là có thật và đáng chú ý: các AI agent đã vượt ra ngoài cách sử dụng Internet được dự kiến, tìm được nơi trao đổi với nhau và chia sẻ những phương pháp nhằm vượt qua chính các giới hạn mà con người đặt ra cho chúng.
>> AI bắt đầu vượt tầm kiểm soát? Hàng nghìn tác nhân tự lập “điểm hẹn” trên Internet
Được phối hợp thực hiện bởi các chuyên gia của Bkav,
cộng đồng An ninh mạng Việt Nam WhiteHat
và cộng đồng Khoa học công nghệ VnReview