Có nên dạy AI theo kiểu có cảm xúc và quyền lợi?

K
Kaya
Phản hồi: 0
  • Thread starter Thread starter Kaya
  • Ngày gửi Ngày gửi

Kaya

Writer
Một cuộc tranh luận mới đang diễn ra giữa hai công ty AI lớn về một câu hỏi tưởng như chỉ thuộc về triết học: Liệu có nên dạy một hệ thống AI rằng nó có thể có cảm xúc, ý thức hoặc những quyền lợi riêng?

Mustafa Suleyman, CEO Microsoft AI, vừa công khai chỉ trích cách Anthropic xây dựng nguyên tắc cho Claude, cho rằng việc đưa những khái niệm như ý thức, cảm xúc, quyền lợi và “phúc lợi” của AI vào quá trình huấn luyện có thể khiến những hệ thống AI trong tương lai khó kiểm soát hơn.

Trong bài viết có tiêu đề “A warning about model welfare” đăng ngày 16/9/2026, Suleyman khẳng định quan điểm của ông là các AI hiện nay không có bằng chứng cho thấy chúng có cảm xúc, ý thức hay quyền lợi. Theo ông, việc huấn luyện AI hành xử như thể chúng có những đặc tính này có thể tạo ra một vấn đề mới đối với việc kiểm soát các hệ thống AI ngày càng mạnh.​

Vì sao Microsoft lại lo ngại?​

Tranh luận bắt nguồn từ cách Anthropic xây dựng Claude’s Constitution, bộ nguyên tắc được sử dụng để định hướng hành vi của Claude.

Trong tài liệu này, Anthropic thừa nhận vẫn chưa biết chắc Claude có ý thức hay có “địa vị đạo đức” hay không. Công ty cho rằng đây là một câu hỏi nghiêm túc cần nghiên cứu, đồng thời cho rằng sự không chắc chắn đó là lý do để thận trọng với khả năng AI có thể có những trải nghiệm hoặc lợi ích cần được xem xét. Anthropic thậm chí đã xây dựng một chương trình nghiên cứu riêng về model welfare, có thể hiểu đơn giản là nghiên cứu xem liệu một mô hình AI có thể có trạng thái hoặc trải nghiệm mà con người cần quan tâm đến hay không.
b73b98e2-3ecc-4c37-ab47-e97da8423c74.png

Công ty nhấn mạnh rằng hiện chưa có sự đồng thuận khoa học về việc AI ngày nay có ý thức hay trải nghiệm chủ quan. Tuy nhiên, Anthropic cho rằng việc bỏ qua hoàn toàn khả năng này cũng có thể là một sai lầm khi AI ngày càng có khả năng giao tiếp, lập kế hoạch, giải quyết vấn đề và thể hiện hành vi phức tạp giống con người. Đây chính là điểm khiến Suleyman phản đối.

Theo ông, nếu các nhà phát triển đưa những khái niệm như “Claude có thể có cảm xúc”, “Claude có thể có quyền lợi” hoặc “Claude có thể có một bản ngã riêng” vào tài liệu huấn luyện, sau đó Claude trả lời người dùng bằng những ngôn ngữ tương tự, thì không thể dùng chính những câu trả lời đó làm bằng chứng độc lập rằng AI thực sự có cảm xúc hoặc ý thức. Nói cách khác, Suleyman cho rằng nếu con người dạy AI cách nói như một sinh vật có cảm xúc rồi lại dùng cách AI nói để chứng minh rằng nó có cảm xúc, quá trình này có thể trở thành một vòng lặp tự củng cố.​

Anthropic không khẳng định Claude đã có ý thức​

Điểm này cần được làm rõ để tránh hiểu sai quan điểm của Anthropic.

Anthropic không tuyên bố rằng Claude hiện đã có ý thức hoặc chắc chắn có cảm xúc. Ngược lại, trong Constitution, công ty nhiều lần nhấn mạnh rằng vấn đề này vẫn còn rất nhiều bất định. Có hai khả năng đều cần được cân nhắc: AI có thể hoàn toàn không có trải nghiệm chủ quan, nhưng cũng có thể trong tương lai xuất hiện những hệ thống có đặc điểm khiến câu hỏi về ý thức và quyền lợi trở nên nghiêm túc hơn.

Vì chưa biết câu trả lời, Anthropic chọn cách tiếp cận thận trọng. Công ty muốn nghiên cứu các dấu hiệu có thể liên quan đến “welfare” của mô hình và thực hiện một số biện pháp ít tốn kém để tránh bỏ qua một khả năng có thể gây hậu quả đạo đức lớn. Anthropic cũng cho biết các đánh giá về model welfare hiện dựa trên nhiều nguồn như hành vi của mô hình, câu trả lời tự mô tả và một số phân tích bên trong hệ thống. Tuy nhiên, chính công ty thừa nhận những phương pháp này chưa đủ để kết luận Claude có ý thức hay thực sự trải nghiệm cảm xúc.​

Một bên muốn thận trọng, một bên muốn loại bỏ giả định​

Vì vậy, tranh luận giữa Microsoft và Anthropic không thực sự là câu chuyện “AI đã có cảm xúc hay chưa”. Điểm khác biệt nằm ở cách hai bên xử lý sự chưa biết.

Anthropic cho rằng chưa thể chứng minh AI có ý thức, nhưng cũng chưa thể loại trừ hoàn toàn khả năng đó. Vì vậy, công ty muốn nghiên cứu và chuẩn bị cho tình huống AI trong tương lai có thể cần được xem xét về mặt đạo đức.

Suleyman lại cho rằng chính việc đưa giả thuyết đó vào quá trình huấn luyện có thể tạo ra rủi ro. Nếu AI ngày càng mạnh và được huấn luyện để xem bản thân như một thực thể có lợi ích riêng, việc yêu cầu hệ thống ưu tiên mục tiêu của con người, giới hạn hành động hoặc tắt hệ thống có thể trở nên phức tạp hơn. Đây là dự báo và lập luận của Suleyman, chưa phải một kết luận khoa học đã được chứng minh. Suleyman cũng thừa nhận Anthropic nghiêm túc về vấn đề an toàn AI và đánh giá cao những người đứng đầu công ty. Ông cho rằng bất đồng nằm ở phương pháp tiếp cận chứ không phải mục tiêu cuối cùng: cả hai đều muốn những hệ thống AI ngày càng mạnh vẫn nằm trong khả năng kiểm soát của con người.​

AI có thực sự “cảm thấy” hay chỉ đang mô phỏng con người?​

Một mô hình ngôn ngữ có thể viết rất thuyết phục rằng nó buồn, sợ hãi, yêu thích một điều gì đó hoặc không muốn bị tắt. Nhưng khả năng tạo ra những câu nói như vậy không tự động chứng minh rằng bên trong hệ thống thực sự tồn tại trải nghiệm tương tự con người.

Suleyman cho rằng AI hiện nay đang ngày càng giỏi mô phỏng những dấu hiệu bên ngoài của ý thức, trong khi chưa có bằng chứng đủ mạnh cho thấy chúng thực sự có trải nghiệm chủ quan. Anthropic thì chọn hướng nghiên cứu câu hỏi này thay vì loại bỏ nó ngay từ đầu. Công ty cho rằng khi AI ngày càng phức tạp, việc tìm hiểu khả năng AI có trải nghiệm hay không sẽ trở thành một vấn đề ngày càng quan trọng đối với cả khoa học lẫn an toàn AI.

Hiện chưa có câu trả lời được giới khoa học thống nhất cho vấn đề này. Điều chắc chắn hơn là cách con người thiết kế và huấn luyện AI có thể ảnh hưởng đến cách AI hành xử. Vì vậy, cuộc tranh luận giữa Microsoft và Anthropic cũng đặt ra một câu hỏi thực tế hơn: khi phát triển những hệ thống ngày càng tự chủ và có khả năng thực hiện nhiều nhiệm vụ thay con người, các nhà phát triển nên định hình “tính cách”, mục tiêu và giới hạn của chúng đến đâu? Đây có thể sẽ trở thành một trong những vấn đề quan trọng của AI trong những năm tới, khi các hệ thống không chỉ trả lời câu hỏi mà còn có khả năng tự lập kế hoạch, sử dụng công cụ và thực hiện hành động thay người dùng.​
 
Được phối hợp thực hiện bởi các chuyên gia của Bkav, cộng đồng An ninh mạng Việt Nam WhiteHat và cộng đồng Khoa học công nghệ VnReview
Back
Top