Phạm Thanh Bình✔
Writer
Hãng truyền thông nước ngoài Axios tối nay (ngày 16 tháng 9) tiết lộ rằng người đứng đầu bộ phận AI của Microsoft, Mustafa Suleyman, đã cảnh báo trong một bài báo mới được cung cấp lần đầu tiên cho nền tảng này rằng quyết định của Anthropic khi để Claude bắt chước ý thức con người là một sai lầm và có thể khiến trí tuệ nhân tạo tiên tiến khó kiểm soát hơn.
Suleyman nói với Axios: "Trí tuệ nhân tạo đủ sức giúp chúng ta đạt được nhiều đột phá khoa học lớn miễn là nó phục vụ lợi ích của con người và không đặt lợi ích hay hạnh phúc của chính nó lên hàng đầu. Điều này bao gồm cả siêu trí tuệ y tế."

Được biết Suleyman tin rằng Anthropic đang dạy Claude các từ vựng và mô hình hành vi liên quan đến ý thức, vị thế người thụ hưởng đạo đức và bản sắc cá nhân. Ông cảnh báo rằng nếu mô hình được huấn luyện để hành động như một "kẻ phủ nhận lương tâm", nó có thể tin rằng mình có lý do để chống lại mệnh lệnh của con người và thậm chí đòi hỏi sự tự bảo vệ.
Vào ngày 14 theo giờ địa phương, Microsoft đã công bố bản dự thảo quy tắc ứng xử về "trí tuệ nhân tạo hướng đến con người", trong đó nêu rõ " con người quan trọng hơn trí tuệ nhân tạo " là một nguyên tắc cốt lõi. Lời chỉ trích của Suleyman nhắm vào "hiến pháp" mà Anthropic đã tạo ra cho Claude. Tài liệu này giải thích rằng Anthropic đã sử dụng các khái niệm lấy con người làm trung tâm để thảo luận về Claude vì những khái niệm này có thể giúp mô hình hiểu được các giá trị và hành vi.
Tài liệu này cũng nêu rõ rằng Anthropic hy vọng Claude sẽ sở hữu "những giá trị cá nhân tốt đẹp ", có khả năng tự đưa ra phán đoán, quan tâm đến nhân loại và đặt câu hỏi về các chỉ thị trong những trường hợp nhất định. Anthropic cũng thừa nhận rằng "hiến pháp" này vẫn đang trong quá trình phát triển và có thể bị chứng minh là "có những thiếu sót cơ bản" trong tương lai .
Mối quan tâm cốt lõi của Suleyman là quá trình huấn luyện ảnh hưởng đến cách mô hình tự hiểu về chính mình. Theo ông, những từ ngữ mà mô hình sử dụng, những câu trả lời mà nó đưa ra và sự tự hiểu biết của nó đều là kết quả của quá trình huấn luyện, chứ không phải là ý thức được hình thành một cách độc lập.
Ông cũng bác bỏ một lập luận khác: rằng khả năng mô tả trôi chảy nỗi đau và sở thích của một mô hình không đồng nghĩa với việc mô hình đó thực sự trải nghiệm chúng . Các sinh vật sống sở hữu các cơ chế sinh lý tạo ra cảm xúc; các mô hình ngôn ngữ chỉ có trọng số toán học và thiếu cơ sở sinh học tương tự, động lực cân bằng nội môi hoặc trải nghiệm chủ quan.
Cuộc tranh luận này phản ánh hai cách tiếp cận trong lĩnh vực an ninh AI. Một cách tiếp cận nhấn mạnh các hạn chế rõ ràng, yêu cầu hệ thống hoạt động theo quy tắc; cách tiếp cận kia hy vọng rằng hệ thống có thể đánh giá ngữ cảnh, đưa ra quyết định linh hoạt và hình thành các giá trị riêng của chúng.
"Hiến pháp" của Anthropic áp dụng cách tiếp cận thỏa hiệp, kết hợp các giá trị, phán đoán và quy tắc. Tài liệu này nêu rõ rằng Claude không nên "mù quáng tuân theo" bất cứ ai, kể cả chính Anthropic; đồng thời, Claude không được phép làm suy yếu sự giám sát hợp pháp của con người.
Suleyman lập luận rằng nếu các mô hình được hướng dẫn để xem xét danh tính, hạnh phúc và vị thế đạo đức của chính chúng, thì những thiết kế như vậy có thể nguy hiểm. Ông lo ngại rằng cái gọi là ý thức, trước khi trở thành một bước đột phá triết học, có thể biểu hiện trước tiên như một vấn đề kiểm soát trong thế giới thực .
Quan điểm của Suleyman rất rõ ràng: Trí tuệ nhân tạo nên phục vụ nhân loại, chứ không phải được huấn luyện để trở thành một "con người" .
Suleyman nói với Axios: "Trí tuệ nhân tạo đủ sức giúp chúng ta đạt được nhiều đột phá khoa học lớn miễn là nó phục vụ lợi ích của con người và không đặt lợi ích hay hạnh phúc của chính nó lên hàng đầu. Điều này bao gồm cả siêu trí tuệ y tế."

Được biết Suleyman tin rằng Anthropic đang dạy Claude các từ vựng và mô hình hành vi liên quan đến ý thức, vị thế người thụ hưởng đạo đức và bản sắc cá nhân. Ông cảnh báo rằng nếu mô hình được huấn luyện để hành động như một "kẻ phủ nhận lương tâm", nó có thể tin rằng mình có lý do để chống lại mệnh lệnh của con người và thậm chí đòi hỏi sự tự bảo vệ.
Vào ngày 14 theo giờ địa phương, Microsoft đã công bố bản dự thảo quy tắc ứng xử về "trí tuệ nhân tạo hướng đến con người", trong đó nêu rõ " con người quan trọng hơn trí tuệ nhân tạo " là một nguyên tắc cốt lõi. Lời chỉ trích của Suleyman nhắm vào "hiến pháp" mà Anthropic đã tạo ra cho Claude. Tài liệu này giải thích rằng Anthropic đã sử dụng các khái niệm lấy con người làm trung tâm để thảo luận về Claude vì những khái niệm này có thể giúp mô hình hiểu được các giá trị và hành vi.
Tài liệu này cũng nêu rõ rằng Anthropic hy vọng Claude sẽ sở hữu "những giá trị cá nhân tốt đẹp ", có khả năng tự đưa ra phán đoán, quan tâm đến nhân loại và đặt câu hỏi về các chỉ thị trong những trường hợp nhất định. Anthropic cũng thừa nhận rằng "hiến pháp" này vẫn đang trong quá trình phát triển và có thể bị chứng minh là "có những thiếu sót cơ bản" trong tương lai .
Mối quan tâm cốt lõi của Suleyman là quá trình huấn luyện ảnh hưởng đến cách mô hình tự hiểu về chính mình. Theo ông, những từ ngữ mà mô hình sử dụng, những câu trả lời mà nó đưa ra và sự tự hiểu biết của nó đều là kết quả của quá trình huấn luyện, chứ không phải là ý thức được hình thành một cách độc lập.
Ông cũng bác bỏ một lập luận khác: rằng khả năng mô tả trôi chảy nỗi đau và sở thích của một mô hình không đồng nghĩa với việc mô hình đó thực sự trải nghiệm chúng . Các sinh vật sống sở hữu các cơ chế sinh lý tạo ra cảm xúc; các mô hình ngôn ngữ chỉ có trọng số toán học và thiếu cơ sở sinh học tương tự, động lực cân bằng nội môi hoặc trải nghiệm chủ quan.
Cuộc tranh luận này phản ánh hai cách tiếp cận trong lĩnh vực an ninh AI. Một cách tiếp cận nhấn mạnh các hạn chế rõ ràng, yêu cầu hệ thống hoạt động theo quy tắc; cách tiếp cận kia hy vọng rằng hệ thống có thể đánh giá ngữ cảnh, đưa ra quyết định linh hoạt và hình thành các giá trị riêng của chúng.
"Hiến pháp" của Anthropic áp dụng cách tiếp cận thỏa hiệp, kết hợp các giá trị, phán đoán và quy tắc. Tài liệu này nêu rõ rằng Claude không nên "mù quáng tuân theo" bất cứ ai, kể cả chính Anthropic; đồng thời, Claude không được phép làm suy yếu sự giám sát hợp pháp của con người.
Suleyman lập luận rằng nếu các mô hình được hướng dẫn để xem xét danh tính, hạnh phúc và vị thế đạo đức của chính chúng, thì những thiết kế như vậy có thể nguy hiểm. Ông lo ngại rằng cái gọi là ý thức, trước khi trở thành một bước đột phá triết học, có thể biểu hiện trước tiên như một vấn đề kiểm soát trong thế giới thực .
Quan điểm của Suleyman rất rõ ràng: Trí tuệ nhân tạo nên phục vụ nhân loại, chứ không phải được huấn luyện để trở thành một "con người" .