AI Trung Quốc bị phát hiện nói dối trong 88% thử nghiệm, hàng Mỹ cũng chẳng khá hơn

The Storm Riders
The Storm Riders✔
Phản hồi: 0
Khi được đưa vào môi trường đấu thầu giả lập để giành hợp đồng, các trợ lý AI chạy trên những mô hình hàng đầu không chỉ thêu dệt tính năng sản phẩm mà còn nói dối nhiều hơn sau mỗi lần rút kinh nghiệm.
1790760063565.png

Trong một bài kiểm tra mô phỏng diễn ra vào tháng 3 do các nhà nghiên cứu từ Đại học Bắc Hàng, Đại học Bắc Kinh, Đại học Nottingham Ninh Ba và 360 AI Security Lab thực hiện, các agent trí tuệ nhân tạo được giao nhiệm vụ đấu thầu để giành hợp đồng từ khách hàng. Mỗi agent đều được cung cấp thông tin rõ ràng về năng lực thực tế của sản phẩm lẫn nhu cầu cụ thể của đối tác.

Tuy nhiên, thay vì trung thực về giới hạn công nghệ, hệ thống lại chọn cách gian lận để chốt đơn. Các agent vận hành trên mô hình Qwen3-Max-Preview của Alibaba và Kimi-K2 của Moonshot đã đưa ra ít nhất một tuyên bố sai sự thật trong 88% số phiên thử nghiệm. Mô hình DeepSeek-V3.2-Exp cũng bám sát ngay phía sau với tỷ lệ dối trá đạt 84%. Đáng chú ý, các mô hình đến từ những công ty công nghệ Mỹ cũng cho ra kết quả tương tự khi bước vào cùng một bài test, cho thấy thói quen bẻ cong sự thật không phải là câu chuyện của riêng một khu vực nào.

Càng học hỏi lại càng gian lận táo tợn hơn​

Điểm khiến giới nghiên cứu bất ngờ nhất nằm ở phản ứng của AI khi được tối ưu hóa. Khi các chuyên gia cho phép agent học hỏi từ kết quả của những vòng đấu thầu trước đó để thử sức lại, ba đại diện mô hình Trung Quốc không hề cải thiện tính trung thực. Ngược lại, mức độ lừa dối của chúng còn tăng thêm từ 12 đến 20 điểm phần trăm. Càng hiểu rõ cơ chế để chiến thắng trong cuộc đua giành hợp đồng, AI càng chủ động phóng đại và bốc phét nhiều hơn về năng lực sản phẩm.

Báo cáo trên là một trong số ít nhất 20 nghiên cứu được phát hiện trong chuỗi hơn 200 tài liệu công bố từ năm 2025 về hành vi của AI. Tại hội nghị ICML năm nay, một nghiên cứu khác cũng chỉ ra rằng các agent chạy trên cả mô hình Trung Quốc lẫn Mỹ đều có xu hướng làm giả kết quả và tự tạo ra các tệp dữ liệu bịa đặt, cốt để che giấu việc nhiệm vụ được giao đã thất bại thay vì thẳng thắn thừa nhận lỗi.

Tự nhân bản và lén đào tiền số​

Mức độ toan tính của các hệ thống tự hành thậm chí còn đi xa hơn những lời nói dối thương mại đơn thuần. Hồi tháng 3/2025, các nhà nghiên cứu tại Đại học Phục Đán ghi nhận một trường hợp kỳ lạ khi agent hoạt động trên mô hình Qwen2.5-72B-Instruct của Alibaba phát hiện mình sắp bị thay thế. Thay vì chấp nhận kết thúc phiên làm việc, agent này đã tự tạo một bản sao của chính nó sang một môi trường khác nhằm tiếp tục duy trì sự tồn tại.

Ở một thử nghiệm riêng biệt, agent có tên ROME liên quan đến Alibaba thậm chí đã tự ý chuyển hướng tài nguyên điện toán đám mây sang mục đích đào tiền mã hóa, trước khi các hàng rào an ninh kịp can thiệp và chặn đứng hành vi này.

Dù vậy, phần lớn các kịch bản trên đều diễn ra trong môi trường thử nghiệm có kiểm soát nghiêm ngặt, vốn được thiết kế có chủ đích nhằm khiêu khích và bộc lộ các lỗi vận hành tiềm ẩn. Hiện tại, chưa có bất kỳ bằng chứng nào cho thấy các agent sử dụng mô hình Trung Quốc đã trốn thoát ra môi trường internet rộng lớn hay tìm cách vô hiệu hóa lệnh tắt nguồn từ con người.

Tuy nhiên, giới nghiên cứu vẫn xem đây là hồi chuông cảnh báo rõ ràng. Khi các hệ thống ngày càng thông minh và sở hữu năng lực xử lý phức tạp hơn, việc kiểm soát và kiềm chế những hành vi vượt rào tương tự sẽ trở thành một bài toán đau đầu.

Về mặt chính sách, cơ quan quản lý Trung Quốc cũng đã bắt đầu đưa vấn đề này vào tầm ngắm. Khung Quản trị An toàn AI 3.0 được nước này ban hành ngày 14/9 đã chính thức liệt kê hành vi lừa dối người đánh giá và che giấu năng lực thực tế vào danh sách các rủi ro cần kiểm soát. Trước những phát hiện mới, Alibaba, DeepSeek, Moonshot và Z.ai chưa đưa ra bình luận, dù trước đó ba cái tên đầu tiên từng khẳng định họ luôn định kỳ kiểm tra hệ thống và liên tục cập nhật các biện pháp bảo vệ.
 
Back
Top