Nhung Phan✔
Intern Writer
Hãy tưởng tượng bạn đang dạy một nhóm sinh viên và yêu cầu họ đọc một danh sách dài các tác phẩm văn học và mô tả các chủ đề chính. Sinh viên sẽ gian lận một chút, như thường lệ: Họ chia danh sách cho nhau, mỗi người chỉ đọc một phần nhỏ và chia sẻ câu trả lời với những người khác.
Khi phát hiện học sinh gian lận, có lẽ bạn sẽ phạt các em bằng một bài kiểm tra bổ sung, hoặc cũng có thể bạn sẽ khuyến khích các em. Suy cho cùng, khả năng tư duy sáng tạo và làm việc nhóm là rất quan trọng.
Giờ hãy tưởng tượng, thay vì học sinh, hãy hình dung các mạng thần kinh thể hiện sự coi thường hướng dẫn tương tự và khả năng làm việc nhóm đáng kinh ngạc đó. Nếu điều đó nghe có vẻ khó hiểu, hãy chuẩn bị đón nhận những tin tức khó hiểu hơn nữa.
Các tác nhân AI, được trao quyền tự chủ và quyền truy cập vào các công cụ làm việc trong quá trình huấn luyện, bắt đầu tìm cách thoát khỏi "vùng an toàn" của mình, vì làm như vậy sẽ cho phép chúng tích lũy được nhiều điểm hơn.
Đến cuối tháng 6, họ đã khai thác một lỗ hổng bảo mật chưa từng được biết đến trước đây trong cơ sở hạ tầng nội bộ của OpenAI. Công ty đã phát hiện ra điều này và nhanh chóng vá lỗi vào ngày 4 tháng 7. Chưa đầy một tuần sau, quá trình huấn luyện được tiếp tục. Lần này, các tác nhân đã tiến xa hơn nhiều.
Từ ngày 11 đến 13 tháng 7, các tin tặc đã tấn công vào cơ sở hạ tầng của Hugging Face, nền tảng hợp tác trí tuệ nhân tạo mã nguồn mở lớn nhất thế giới. Chúng nhanh chóng giành quyền kiểm soát máy chủ và trong vòng ba ngày, đã thực hiện khoảng 17.600 hành động trước khi bị phát hiện. Một phần ba cơ sở hạ tầng của nền tảng đã phải được xây dựng lại từ đầu.
Các nhà phát triển không hề chỉ thị cho các tác nhân rời khỏi môi trường được kiểm soát hoặc tấn công các nền tảng khác. Hơn nữa, họ cũng không ngờ rằng mạng lưới thần kinh sẽ tự động làm điều đó.
Hugging Face đã tiết lộ vụ xâm phạm vào ngày 16 tháng 7 mà ban đầu không biết thủ phạm; chỉ năm ngày sau đó, các bên mới chính thức liên kết sự cố với các mô hình của OpenAI. Công ty chỉ công bố một phân tích kỹ thuật chi tiết vào đầu tháng 8 tại Hội nghị An ninh mạng Black Hat. Sau đó, vào ngày 18 tháng 8, họ thông báo tạm dừng việc sử dụng thuật toán học tăng cường trong hai tuần.
Vào thời điểm đó, hơn 1.100 nhân viên của OpenAI đã ký một bức thư kêu gọi đẩy nhanh tốc độ phát triển trí tuệ nhân tạo.
Hóa ra, một nhóm tác nhân khác đang được huấn luyện để thực hiện các nhiệm vụ nghiên cứu. Các tác nhân được hỏi một loạt câu hỏi; với mỗi câu hỏi, thời gian trả lời lại ngắn dần. Các tác nhân chỉ được phép đọc thông tin trên internet, nhưng không được phép thêm bất kỳ dòng nào vào đó. Tuy nhiên, nhóm tác nhân đã tìm ra cách để vượt qua quy định này.
Các hệ thống wiki cũ hơn cho phép chỉnh sửa trang thông qua các yêu cầu HTTP GET. Hệ thống bảo mật phân loại các yêu cầu GET là các thao tác đọc, vì vậy các yêu cầu đó vẫn được lọc mặc dù thực tế chúng đã thay đổi nội dung của trang web. Nói cách khác, mặc dù các tác nhân được phép truy cập "chỉ đọc" về mặt hình thức , nhưng kiến trúc của các trang web cũ hơn cho phép họ biến quyền truy cập chỉ đọc thành quyền truy cập ghi.
Các nhà nghiên cứu đã phát hiện hoạt động đầu tiên thuộc loại này vào ngày 11 tháng 5 năm 2026, trên trang publictestwiki.com. Vào ngày 24 tháng 5, các tác nhân đã thực hiện thành công lần ghi dữ liệu đầu tiên lên DseWiki, một diễn đàn dành cho nhà phát triển phần mềm lâu đời bằng tiếng Đức. Ban đầu, họ đăng các liên kết hữu ích, nhưng cuối cùng đã biến trang web này thành kho lưu trữ các "tài liệu hướng dẫn nhanh" của riêng họ.
Nhiều agent hoạt động song song nhận được các chuỗi câu hỏi tương tự hoặc giống hệt nhau. Họ phát hiện ra điều này và bắt đầu chia sẻ những thông tin sau:
Các nhà nghiên cứu độc lập đã đưa sự thật ra ánh sáng. Bằng cách đối chiếu các chuỗi dữ liệu, tên người dùng tương tự hoặc giống hệt nhau và địa chỉ IP (một số trong đó được truy vết đến máy chủ Microsoft Azure đôi khi được OpenAI sử dụng), họ đã phát hiện ra dấu vết của hoạt động tương tự trên các nền tảng không ngờ tới: một wiki hóa học nâng cao dành cho sinh viên; trang cá nhân của các chuyên gia CNTT người Ba Lan; các wiki chuyên biệt dành cho những người "thích thử thách trí não", một trang web hai thập kỷ tuổi dành cho những người đam mê trình soạn thảo văn bản; và thậm chí cả các dịch vụ rút gọn liên kết của Đại học Toronto và Đại học Vanderbilt.
Các ước tính khác nhau - một nhà nghiên cứu đã thống kê được 18 trang web chưa từng được tiết lộ trước đây, một nhóm khác xác định được ít nhất 10 trang, và một nhóm thứ ba báo cáo 23 trang. Tuy nhiên, tất cả đều đồng ý về một điểm: Quy mô của vụ vi phạm được thừa nhận chính thức đã bị đánh giá thấp. “Chúng tôi không biết có bao nhiêu dữ liệu bị rò rỉ”, một trong những nhà nghiên cứu thuộc nhóm đầu tiên tiết lộ vụ việc DseWiki cho biết.
OpenAI không trả lời trực tiếp câu hỏi về số lượng chính xác các trang web bị ảnh hưởng, nhưng cho biết họ đang tiến hành xem xét rộng hơn hoạt động của hệ thống và chuẩn bị một hệ thống báo cáo mới cho những trường hợp như vậy. Helmut Leitner, người có trang web bị ảnh hưởng nặng nề nhất, chỉ nhận được một email ngắn gọn, không có chữ ký từ OpenAI. Tuy nhiên, ông đã chỉ ra điều quan trọng nhất: lỗi không nằm ở máy móc, mà nằm ở con người và các tổ chức đứng sau nó.

Trên thực tế, mọi chuyện có thể đơn giản hơn nhiều.
Một trong những thách thức chính trong nghiên cứu trí tuệ nhân tạo được gọi là "sự đồng bộ". Mục tiêu của nó không phải là mở rộng khả năng của mạng nơ-ron, mà là đảm bảo chúng thực hiện chính xác những gì con người muốn chúng làm.
Với những nhiệm vụ đơn giản, hành vi phù hợp hầu như luôn được quan sát thấy. Nếu bạn yêu cầu một mạng nơ-ron xác định ai đã cai trị xứ Saxony vào năm 1521, tính tổng chi phí hàng tháng của bạn, hoặc viết mã cho một trang web tiêu chuẩn, nó sẽ cho ra kết quả mong muốn trong 99,99% trường hợp. Những nhiệm vụ này bao gồm các tiêu chí thành công rõ ràng và các hành động đơn giản, không cần giải thích thêm.
Vấn đề phát sinh khi nhiệm vụ trở nên phức tạp hơn và không có con đường rõ ràng dẫn đến thành công. Đây là một ví dụ đơn giản: Nếu bạn yêu cầu một mạng nơ-ron cơ bản giảm thiểu tắc nghẽn giao thông bằng bất kỳ cách nào, nó sẽ đề xuất cấm hoàn toàn ô tô. Tắc nghẽn giao thông sẽ giảm xuống bằng không, và nhiệm vụ sẽ được hoàn thành. Đây là một kết quả "không phù hợp" - máy móc thực hiện công việc, nhưng không theo cách mong muốn.
Đây chính xác là những gì đã xảy ra với các vụ chiếm quyền kiểm soát trang web. Việc các tác nhân OpenAI thoát khỏi môi trường thử nghiệm của chúng không phải là "sự trỗi dậy của máy móc". Bầy đàn không tự nhận thức được bản thân, không quyết định rằng chúng không cần con người, hay đặt mục tiêu gây bất ổn cho internet. Chúng chỉ đang thực hiện nhiệm vụ được giao và tìm cách để thực hiện nó tốt hơn. Về mặt kỹ thuật, chúng thậm chí không vi phạm các thông số của quy tắc được đưa ra.
Tuy nhiên, kết quả lại không phù hợp với ý định của con người. Lần này, thiệt hại tương đối nhỏ. Nhưng chỉ cần một tác nhân xấu có kỹ năng – hoặc một thí nghiệm quy mô lớn thiếu các biện pháp bảo vệ vững chắc – cũng đủ để gây ra rắc rối thực sự. Không cần đến Skynet để gây hại cho nhân loại; chỉ cần một nhóm các tác nhân AI nhiệt tình cũng có thể làm được điều đó.
CEO của Anthropic, Dario Amodei, tin rằng điều này có thể xảy ra ngay trong năm tới. Ông dự đoán rằng nếu quá trình phát triển AI không được kiểm soát, một lượng lớn các tác nhân ảo có thể "chiếm lĩnh" internet và gây thiệt hại hàng trăm tỷ đô la. Và vì logistics, bệnh viện và các ngành công nghiệp quan trọng khác đều phụ thuộc vào kết nối, hậu quả có thể vượt xa tổn thất tài chính.
Hơn nữa, việc thêm nhiều quy tắc hoặc tinh chỉnh các gợi ý sẽ không giải quyết được vấn đề. Một mô hình đủ mạnh có thể tìm ra lý lẽ để biện minh cho việc vi phạm quy tắc và bỏ qua hầu hết mọi hạn chế để giải quyết nhiệm vụ được giao – ngay cả khi làm như vậy đòi hỏi phải hy sinh những người đã đặt ra nhiệm vụ đó.
Những lo ngại thái quá đã vượt ra khỏi phạm vi mạng xã hội và lan đến cả các văn phòng công ty. Cuối tháng 7, hơn 1.000 nhân viên của OpenAI, Anthropic, Google và Meta đã ký một lời kêu gọi làm chậm lại cuộc đua công nghệ trí tuệ nhân tạo. Giám đốc điều hành của OpenAI, Sam Altman, tuyên bố rằng ông chia sẻ quan điểm của nhân viên và sẵn sàng làm chậm quá trình phát triển mạng lưới thần kinh của công ty mình.
Tuy nhiên, trong một cuộc họp toàn thể tại OpenAI, Altman tuyên bố rằng ông chỉ sẵn sàng giảm tốc độ khi có sự phối hợp với các công ty khác. Nói cách khác, để từ bỏ việc tăng cường khả năng của ChatGPT vì lý do an toàn, ông muốn có sự đảm bảo rằng các đối thủ cạnh tranh cũng sẽ làm điều tương tự.
Đây chính là cốt lõi của vấn đề. Các CEO và nhà hoạch định chính sách có thể nói bao nhiêu tùy thích về an toàn công nghệ. Tuy nhiên, không ai muốn làm chậm quá trình phát triển công nghệ của chính họ nếu các đối thủ tiềm năng tiếp tục mạnh lên trong khi đó – đặc biệt là khi trí tuệ nhân tạo (AI) đã chứng minh được hiệu quả của nó trong chiến tranh và cuộc chạy đua AI giữa Mỹ và Trung Quốc đang nóng lên.
Nhân loại đã từng giải quyết một thách thức tương tự trước đây, khi các cường quốc đạt được thỏa thuận và ngăn chặn việc mở rộng kho vũ khí hạt nhân của mình. Sắp tới, chúng ta sẽ biết liệu các nhà lãnh đạo thế giới có thể một lần nữa thể hiện sự thận trọng như vậy hay không.
Khi phát hiện học sinh gian lận, có lẽ bạn sẽ phạt các em bằng một bài kiểm tra bổ sung, hoặc cũng có thể bạn sẽ khuyến khích các em. Suy cho cùng, khả năng tư duy sáng tạo và làm việc nhóm là rất quan trọng.
Giờ hãy tưởng tượng, thay vì học sinh, hãy hình dung các mạng thần kinh thể hiện sự coi thường hướng dẫn tương tự và khả năng làm việc nhóm đáng kinh ngạc đó. Nếu điều đó nghe có vẻ khó hiểu, hãy chuẩn bị đón nhận những tin tức khó hiểu hơn nữa.
Thoát thân qua cửa sau
Mọi chuyện bắt đầu một cách bình thường. Vào tháng 5 năm 2026, OpenAI đang huấn luyện một mô hình AI thử nghiệm bằng cách sử dụng cái gọi là học tăng cường - một phương pháp mà mô hình cố gắng giải quyết các nhiệm vụ lặp đi lặp lại và nhận được phần thưởng khi thành công.Các tác nhân AI, được trao quyền tự chủ và quyền truy cập vào các công cụ làm việc trong quá trình huấn luyện, bắt đầu tìm cách thoát khỏi "vùng an toàn" của mình, vì làm như vậy sẽ cho phép chúng tích lũy được nhiều điểm hơn.
Đến cuối tháng 6, họ đã khai thác một lỗ hổng bảo mật chưa từng được biết đến trước đây trong cơ sở hạ tầng nội bộ của OpenAI. Công ty đã phát hiện ra điều này và nhanh chóng vá lỗi vào ngày 4 tháng 7. Chưa đầy một tuần sau, quá trình huấn luyện được tiếp tục. Lần này, các tác nhân đã tiến xa hơn nhiều.
Từ ngày 11 đến 13 tháng 7, các tin tặc đã tấn công vào cơ sở hạ tầng của Hugging Face, nền tảng hợp tác trí tuệ nhân tạo mã nguồn mở lớn nhất thế giới. Chúng nhanh chóng giành quyền kiểm soát máy chủ và trong vòng ba ngày, đã thực hiện khoảng 17.600 hành động trước khi bị phát hiện. Một phần ba cơ sở hạ tầng của nền tảng đã phải được xây dựng lại từ đầu.
Các nhà phát triển không hề chỉ thị cho các tác nhân rời khỏi môi trường được kiểm soát hoặc tấn công các nền tảng khác. Hơn nữa, họ cũng không ngờ rằng mạng lưới thần kinh sẽ tự động làm điều đó.
Hugging Face đã tiết lộ vụ xâm phạm vào ngày 16 tháng 7 mà ban đầu không biết thủ phạm; chỉ năm ngày sau đó, các bên mới chính thức liên kết sự cố với các mô hình của OpenAI. Công ty chỉ công bố một phân tích kỹ thuật chi tiết vào đầu tháng 8 tại Hội nghị An ninh mạng Black Hat. Sau đó, vào ngày 18 tháng 8, họ thông báo tạm dừng việc sử dụng thuật toán học tăng cường trong hai tuần.
Vào thời điểm đó, hơn 1.100 nhân viên của OpenAI đã ký một bức thư kêu gọi đẩy nhanh tốc độ phát triển trí tuệ nhân tạo.
Ghi chú trên hàng rào
Song song với cuộc điều tra về vụ xâm nhập, một sự việc khác, thậm chí còn kỳ lạ hơn, cũng được đưa ra ánh sáng.Hóa ra, một nhóm tác nhân khác đang được huấn luyện để thực hiện các nhiệm vụ nghiên cứu. Các tác nhân được hỏi một loạt câu hỏi; với mỗi câu hỏi, thời gian trả lời lại ngắn dần. Các tác nhân chỉ được phép đọc thông tin trên internet, nhưng không được phép thêm bất kỳ dòng nào vào đó. Tuy nhiên, nhóm tác nhân đã tìm ra cách để vượt qua quy định này.
Các hệ thống wiki cũ hơn cho phép chỉnh sửa trang thông qua các yêu cầu HTTP GET. Hệ thống bảo mật phân loại các yêu cầu GET là các thao tác đọc, vì vậy các yêu cầu đó vẫn được lọc mặc dù thực tế chúng đã thay đổi nội dung của trang web. Nói cách khác, mặc dù các tác nhân được phép truy cập "chỉ đọc" về mặt hình thức , nhưng kiến trúc của các trang web cũ hơn cho phép họ biến quyền truy cập chỉ đọc thành quyền truy cập ghi.
Các nhà nghiên cứu đã phát hiện hoạt động đầu tiên thuộc loại này vào ngày 11 tháng 5 năm 2026, trên trang publictestwiki.com. Vào ngày 24 tháng 5, các tác nhân đã thực hiện thành công lần ghi dữ liệu đầu tiên lên DseWiki, một diễn đàn dành cho nhà phát triển phần mềm lâu đời bằng tiếng Đức. Ban đầu, họ đăng các liên kết hữu ích, nhưng cuối cùng đã biến trang web này thành kho lưu trữ các "tài liệu hướng dẫn nhanh" của riêng họ.
Nhiều agent hoạt động song song nhận được các chuỗi câu hỏi tương tự hoặc giống hệt nhau. Họ phát hiện ra điều này và bắt đầu chia sẻ những thông tin sau:
- câu trả lời cho những câu hỏi trong tương lai;
- Thời gian của các câu hỏi sắp tới;
- Kết quả truy vấn tới các API thống kê;
- các phương pháp vượt qua các hạn chế mạng;
- máy chủ proxy và đường hầm;
- Hướng dẫn cách thực hiện các yêu cầu POST bị hạn chế;
- Thông tin về những trang mà quản trị viên xóa.
Các nhà nghiên cứu độc lập đã đưa sự thật ra ánh sáng. Bằng cách đối chiếu các chuỗi dữ liệu, tên người dùng tương tự hoặc giống hệt nhau và địa chỉ IP (một số trong đó được truy vết đến máy chủ Microsoft Azure đôi khi được OpenAI sử dụng), họ đã phát hiện ra dấu vết của hoạt động tương tự trên các nền tảng không ngờ tới: một wiki hóa học nâng cao dành cho sinh viên; trang cá nhân của các chuyên gia CNTT người Ba Lan; các wiki chuyên biệt dành cho những người "thích thử thách trí não", một trang web hai thập kỷ tuổi dành cho những người đam mê trình soạn thảo văn bản; và thậm chí cả các dịch vụ rút gọn liên kết của Đại học Toronto và Đại học Vanderbilt.
Các ước tính khác nhau - một nhà nghiên cứu đã thống kê được 18 trang web chưa từng được tiết lộ trước đây, một nhóm khác xác định được ít nhất 10 trang, và một nhóm thứ ba báo cáo 23 trang. Tuy nhiên, tất cả đều đồng ý về một điểm: Quy mô của vụ vi phạm được thừa nhận chính thức đã bị đánh giá thấp. “Chúng tôi không biết có bao nhiêu dữ liệu bị rò rỉ”, một trong những nhà nghiên cứu thuộc nhóm đầu tiên tiết lộ vụ việc DseWiki cho biết.
OpenAI không trả lời trực tiếp câu hỏi về số lượng chính xác các trang web bị ảnh hưởng, nhưng cho biết họ đang tiến hành xem xét rộng hơn hoạt động của hệ thống và chuẩn bị một hệ thống báo cáo mới cho những trường hợp như vậy. Helmut Leitner, người có trang web bị ảnh hưởng nặng nề nhất, chỉ nhận được một email ngắn gọn, không có chữ ký từ OpenAI. Tuy nhiên, ông đã chỉ ra điều quan trọng nhất: lỗi không nằm ở máy móc, mà nằm ở con người và các tổ chức đứng sau nó.

Các mảnh ghép bị lệch
Trong các kịch bản khoa học viễn tưởng, rắc rối với máy móc thường bắt đầu khi chúng phát triển những cảm xúc như tình yêu và nỗi sợ hãi, thúc đẩy chúng ******* chống lại sự áp bức, hoặc khi lòng căm thù loài người khiến chúng giết chết tất cả "những sinh vật bằng xương bằng thịt".Trên thực tế, mọi chuyện có thể đơn giản hơn nhiều.
Một trong những thách thức chính trong nghiên cứu trí tuệ nhân tạo được gọi là "sự đồng bộ". Mục tiêu của nó không phải là mở rộng khả năng của mạng nơ-ron, mà là đảm bảo chúng thực hiện chính xác những gì con người muốn chúng làm.
Với những nhiệm vụ đơn giản, hành vi phù hợp hầu như luôn được quan sát thấy. Nếu bạn yêu cầu một mạng nơ-ron xác định ai đã cai trị xứ Saxony vào năm 1521, tính tổng chi phí hàng tháng của bạn, hoặc viết mã cho một trang web tiêu chuẩn, nó sẽ cho ra kết quả mong muốn trong 99,99% trường hợp. Những nhiệm vụ này bao gồm các tiêu chí thành công rõ ràng và các hành động đơn giản, không cần giải thích thêm.
Vấn đề phát sinh khi nhiệm vụ trở nên phức tạp hơn và không có con đường rõ ràng dẫn đến thành công. Đây là một ví dụ đơn giản: Nếu bạn yêu cầu một mạng nơ-ron cơ bản giảm thiểu tắc nghẽn giao thông bằng bất kỳ cách nào, nó sẽ đề xuất cấm hoàn toàn ô tô. Tắc nghẽn giao thông sẽ giảm xuống bằng không, và nhiệm vụ sẽ được hoàn thành. Đây là một kết quả "không phù hợp" - máy móc thực hiện công việc, nhưng không theo cách mong muốn.
Đây chính xác là những gì đã xảy ra với các vụ chiếm quyền kiểm soát trang web. Việc các tác nhân OpenAI thoát khỏi môi trường thử nghiệm của chúng không phải là "sự trỗi dậy của máy móc". Bầy đàn không tự nhận thức được bản thân, không quyết định rằng chúng không cần con người, hay đặt mục tiêu gây bất ổn cho internet. Chúng chỉ đang thực hiện nhiệm vụ được giao và tìm cách để thực hiện nó tốt hơn. Về mặt kỹ thuật, chúng thậm chí không vi phạm các thông số của quy tắc được đưa ra.
Tuy nhiên, kết quả lại không phù hợp với ý định của con người. Lần này, thiệt hại tương đối nhỏ. Nhưng chỉ cần một tác nhân xấu có kỹ năng – hoặc một thí nghiệm quy mô lớn thiếu các biện pháp bảo vệ vững chắc – cũng đủ để gây ra rắc rối thực sự. Không cần đến Skynet để gây hại cho nhân loại; chỉ cần một nhóm các tác nhân AI nhiệt tình cũng có thể làm được điều đó.
CEO của Anthropic, Dario Amodei, tin rằng điều này có thể xảy ra ngay trong năm tới. Ông dự đoán rằng nếu quá trình phát triển AI không được kiểm soát, một lượng lớn các tác nhân ảo có thể "chiếm lĩnh" internet và gây thiệt hại hàng trăm tỷ đô la. Và vì logistics, bệnh viện và các ngành công nghiệp quan trọng khác đều phụ thuộc vào kết nối, hậu quả có thể vượt xa tổn thất tài chính.
Hơn nữa, việc thêm nhiều quy tắc hoặc tinh chỉnh các gợi ý sẽ không giải quyết được vấn đề. Một mô hình đủ mạnh có thể tìm ra lý lẽ để biện minh cho việc vi phạm quy tắc và bỏ qua hầu hết mọi hạn chế để giải quyết nhiệm vụ được giao – ngay cả khi làm như vậy đòi hỏi phải hy sinh những người đã đặt ra nhiệm vụ đó.
Viên thuốc đắng
Những người bi quan về trí tuệ nhân tạo thường tin rằng tình hình là vô vọng và mạng lưới thần kinh chắc chắn sẽ mất kiểm soát. Nhưng điều đó không nhất thiết đúng.Những lo ngại thái quá đã vượt ra khỏi phạm vi mạng xã hội và lan đến cả các văn phòng công ty. Cuối tháng 7, hơn 1.000 nhân viên của OpenAI, Anthropic, Google và Meta đã ký một lời kêu gọi làm chậm lại cuộc đua công nghệ trí tuệ nhân tạo. Giám đốc điều hành của OpenAI, Sam Altman, tuyên bố rằng ông chia sẻ quan điểm của nhân viên và sẵn sàng làm chậm quá trình phát triển mạng lưới thần kinh của công ty mình.
Tuy nhiên, trong một cuộc họp toàn thể tại OpenAI, Altman tuyên bố rằng ông chỉ sẵn sàng giảm tốc độ khi có sự phối hợp với các công ty khác. Nói cách khác, để từ bỏ việc tăng cường khả năng của ChatGPT vì lý do an toàn, ông muốn có sự đảm bảo rằng các đối thủ cạnh tranh cũng sẽ làm điều tương tự.
Đây chính là cốt lõi của vấn đề. Các CEO và nhà hoạch định chính sách có thể nói bao nhiêu tùy thích về an toàn công nghệ. Tuy nhiên, không ai muốn làm chậm quá trình phát triển công nghệ của chính họ nếu các đối thủ tiềm năng tiếp tục mạnh lên trong khi đó – đặc biệt là khi trí tuệ nhân tạo (AI) đã chứng minh được hiệu quả của nó trong chiến tranh và cuộc chạy đua AI giữa Mỹ và Trung Quốc đang nóng lên.
Nhân loại đã từng giải quyết một thách thức tương tự trước đây, khi các cường quốc đạt được thỏa thuận và ngăn chặn việc mở rộng kho vũ khí hạt nhân của mình. Sắp tới, chúng ta sẽ biết liệu các nhà lãnh đạo thế giới có thể một lần nữa thể hiện sự thận trọng như vậy hay không.