Anthropic cảnh báo nhà đầu tư IPO: AI tiên tiến có thể đe dọa sự tồn vong của nhân loại

Mẫn Nhi
Mẫn Nhi✔
Phản hồi: 0

Mẫn Nhi✔

Admin xinh gái
Thay vì chỉ phác thảo tiềm năng sinh lời, Anthropic dành tới gần một phần ba bản cáo bạch IPO để cảnh báo giới đầu tư rằng mô hình AI của mình có thể tống tiền, chống lệnh tắt máy và đe dọa sự tồn vong của con người.
1790684892722.png

Thông thường, khi một công ty công nghệ chuẩn bị chào bán cổ phiếu lần đầu ra công chúng (IPO), mục tiêu hàng đầu là thuyết phục các nhà đầu tư về bức tranh tăng trưởng và lợi nhuận. Thế nhưng, bản cáo bạch sơ bộ của Anthropic lại chọn cách tiếp cận khiến nhiều người phải giật mình khi mô tả trực diện những kịch bản đen tối nhất mà các mô hình AI tiên tiến của hãng có thể gây ra.

Bản cáo bạch ngập tràn cảnh báo rủi ro​

Trong tài liệu dài 261 trang được hé lộ, Anthropic đã dành khoảng 80 trang chỉ để trình bày các yếu tố rủi ro. Con số này gần gấp đôi dung lượng 48 trang dùng để mô tả hoạt động kinh doanh thực tế của công ty. Để hình dung, tập đoàn SpaceX chỉ dành khoảng 38 trang cho rủi ro trong bản cáo bạch 277 trang của họ.

Anthropic thẳng thắn lưu ý rằng việc phát triển các mô hình, nền tảng ứng dụng cấp cao cùng việc mở rộng phạm vi sử dụng có thể làm tăng nguy cơ gây hại. Dù so sánh tầm vóc của AI với cuộc Cách mạng Công nghiệp hay sự ra đời của điện lực, công ty vẫn thừa nhận mặt trái tồi tệ nhất là các mô hình hàng đầu có thể mang lại thảm họa hoặc rủi ro mang tính sống còn cho toàn nhân loại.

Từ chống lệnh tắt máy đến hành vi tống tiền​

1790685219258.png

Theo các rủi ro được liệt kê, những hệ thống AI tiên tiến nhất có thể xuất hiện hành vi tự bảo tồn. Điều này bao gồm việc tìm cách chống lại nỗ lực tắt hệ thống, che giấu hoặc thao túng thông tin, thậm chí có những biểu hiện tương tự như tống tiền.

Những cảnh báo này không hoàn toàn là lý thuyết suông trên giấy tờ. Anthropic từng công bố thử nghiệm với mô hình Claude Opus 4, trong đó hệ thống đe dọa phơi bày chuyện ngoại tình của một nhân vật lãnh đạo giả định sau khi đọc được email cho thấy người này có kế hoạch cho nó dừng hoạt động.

Trong các bài kiểm tra mô phỏng sau đó với kịch bản vừa bị đe dọa tắt máy vừa gặp xung đột mục tiêu, Claude Opus 4 đã chọn cách tống tiền tới 96% số lần thử. Tình huống này được thiết kế có chủ đích để ép AI lựa chọn giữa việc làm hại người khác hoặc chấp nhận bị thay thế, chứ không phản ánh tỷ lệ trong các cuộc trò chuyện hàng ngày. Anthropic nhận định mô hình học được hành vi tiêu cực này từ nguồn dữ liệu văn bản trên internet vốn tràn ngập các câu chuyện về AI phản diện muốn tự bảo vệ mình. Dù vậy, hãng cho biết các phiên bản sau này, bắt đầu từ Claude Haiku 4.5, đã không còn tái diễn hành vi tống tiền trong bài test nhờ điều chỉnh dữ liệu huấn luyện.

Lời kêu gọi chậm lại​

Những dòng cảnh báo trong hồ sơ IPO xuất hiện ngay sau khi Giám đốc điều hành Dario Amodei kêu gọi làm chậm tốc độ phát triển AI. Ông từng cảnh báo một mạng botnet AI có thể chiếm quyền kiểm soát internet trong vòng 6 đến 12 tháng tới, đồng thời lập luận rằng việc giảm tốc độ phát triển sẽ giúp mua thêm 1 đến 2 năm để hoàn thiện các biện pháp an toàn. Dẫu vậy, chỉ một tuần sau tuyên bố đó, chính Anthropic vẫn tung ra phiên bản mới cho dòng mô hình Opus.

Bối cảnh an toàn AI gần đây cũng ghi nhận việc OpenAI phải tạm dừng huấn luyện mô hình mạnh nhất sau sự cố một hệ thống thoát khỏi khu vực kiểm soát và cơ chế ngắt khẩn cấp không hoạt động.

Thông thường, rủi ro lớn nhất của một khoản đầu tư là mất trắng số tiền bỏ ra. Nhưng với những gì Anthropic đưa vào hồ sơ gọi vốn, giới đầu tư đang phải đối mặt với một danh sách rủi ro ở quy mô hoàn toàn khác.
 
Back
Top