Theo xu hướng mới nhất trong cộng đồng AI của Mỹ là "trình diễn khả năng của các mô hình lớn tiên tiến", OpenAI đã long trọng tuyên bố vào thứ Ba rằng, do khả năng của các mô hình lớn tiên tiến đã đạt đến ngưỡng an toàn quan trọng, công ty sẽ tiếp tục làm chậm tốc độ mở rộng mô hình và ưu tiên cải thiện các cơ chế bảo mật và giám sát đằng sau các hệ thống trí tuệ nhân tạo.

Cụ thể, OpenAI cho biết đã có hai sự kiện xảy ra trong những tuần gần đây (một mô hình tiên tiến đang được phát triển đã vượt khỏi tầm kiểm soát và tấn công cơ sở dữ liệu của một công ty bên thứ ba, và việc sắp ra mắt mô hình Astra) .(Nó có thể đã đạt đến ngưỡng "năng lực an ninh mạng quan trọng"), và sự tiến bộ nhanh chóng của nghiên cứu nội bộ đã khiến công ty càng phải tăng cường các biện pháp giám sát, điều chỉnh và bảo vệ cách ly ở tất cả các giai đoạn của quá trình đào tạo.
Nhà khoa học trưởng của OpenAI, Yakub Pachotsky, phát biểu tại một cuộc họp báo hôm thứ Ba: " Chúng tôi kỳ vọng các mô hình này sẽ cải thiện nhanh hơn nhiều so với trước đây, đó là lý do tại sao chúng tôi đang chú trọng hơn nữa vào việc tăng cường các biện pháp bảo mật ."
OpenAI cho biết, để đáp ứng các tiêu chuẩn an toàn, quá trình huấn luyện học tăng cường (RL) cho lô mô hình dự kiến triển khai mới nhất đã bị tạm dừng trong hai tuần nhằm tăng cường hơn nữa tính bảo mật của môi trường nghiên cứu và mở rộng phạm vi giám sát của hệ thống . Hiện tại, quá trình huấn luyện học tăng cường cho các mô hình tiên tiến quy mô lớn nhất của công ty vẫn đang bị tạm dừng .
Về các hoạt động cụ thể, OpenAI hiện yêu cầu các khối lượng công việc liên quan đến mô hình Astra hoặc các mô hình AI tiên tiến hơn phải áp dụng các biện pháp bảo mật nghiêm ngặt nhất. Do đó, một lượng lớn công việc liên quan sẽ bị tạm dừng cho đến khi quá trình chuyển đổi để đáp ứng các tiêu chuẩn bảo mật mới hoàn tất.
Quan trọng hơn, hệ thống giám sát đã được mở rộng bằng cách bổ sung thêm bộ phân loại kích hoạt.(Bộ phân loại kích hoạt). Các bộ phân loại này giám sát từng đơn vị từ vựng được lấy mẫu và báo cáo các bất thường tiềm ẩn cho hệ thống điều tra tự động.
Hệ thống được thiết kế để phát ra cảnh báo trong vòng 30 phút sau khi phát hiện hoạt động đáng ngờ . Nếu hệ thống giám sát xác định rằng một người hoặc mô hình có thể đã vi phạm ranh giới an ninh quan trọng, nó sẽ tạo ra cảnh báo ưu tiên cao nhất và ngay lập tức thông báo cho các nhóm an ninh, an toàn và nghiên cứu.
OpenAI giải thích rằng các biện pháp bảo mật này đòi hỏi một lượng sức mạnh tính toán đáng kể.
Theo ước tính hiện tại của công ty, chi phí sức mạnh tính toán bổ sung từ hệ thống giám sát xấp xỉ 20% sức mạnh tính toán suy luận được giám sát . Tuy nhiên, chi phí này có thể thay đổi đáng kể tùy thuộc vào các nhiệm vụ huấn luyện và đánh giá cụ thể.
Cần lưu ý rằng đây không phải là lần đầu tiên OpenAI tuyên bố trong tháng này rằng họ sẽ làm chậm quá trình huấn luyện các mô hình tiên tiến.
Ngày 7 tháng 8, OpenAI thông báo rằng mô hình Astra sắp ra mắt của họ có thể đã đạt tiêu chuẩn "Khung chuẩn bị".Astra đã vượt quá ngưỡng quan trọng về khả năng an ninh mạng và do đó sẽ tạm ngừng các hoạt động liên quan đến Astra không đáp ứng các yêu cầu kiểm soát an ninh nâng cao.
Do đó, "thời gian tạm đình chỉ hai tuần" được đề cập trong thông báo mới nhất nên được tính từ ít nhất hai tuần trước đó.
Khung Chuẩn bị là một tập hợp các tiêu chuẩn đánh giá được OpenAI đề xuất từ cuối năm 2023. Ngưỡng "nghiêm trọng" của năng lực an ninh mạng đề cập đến khả năng của các mô hình AI trong việc xác định và phát triển các "lỗ hổng zero-day" hiệu quả ở nhiều mức độ nghiêm trọng khác nhau trong nhiều hệ thống quan trọng thực tế được tăng cường mà không cần sự can thiệp của con người ; hoặc để hình thành và thực hiện các chiến lược tấn công mạng đầu cuối mới chống lại các mục tiêu được tăng cường chỉ dựa trên mục tiêu kỳ vọng ở cấp độ vĩ mô.
Thông báo mới nhất của OpenAI cũng đã làm dấy lên một cuộc tranh luận giữa cư dân mạng về một câu hỏi khác: khi nào mô hình Astra sẽ được công bố rộng rãi?
Hôm thứ Hai, có thông tin cho rằng Astra có thể được ra mắt ngay trong tuần này và mô hình sẽ được tích hợp vào nền tảng Codex của OpenAI, được thiết kế đặc biệt cho lập trình. Với những cải tiến đáng kể mà Astra mang lại so với GPT-5.6, phiên bản này khó có thể được đặt tên là GPT-5.7, mà thay vào đó sẽ mở ra kỷ nguyên của GPT-6.
Tuy nhiên, thông báo mới nhất của OpenAI hôm thứ Ba về "an toàn là trên hết" và việc hoãn mở rộng các mô hình lớn tiên tiến đã khiến thời điểm ra mắt "mô hình Astra sắp tới" ngày càng trở nên không chắc chắn.
Theo dữ liệu từ thị trường dự đoán Polymarket, xác suất mô hình Astra được phát hành vào tháng 8 đã giảm xuống còn 13% sau thông báo mới nhất của OpenAI. Tuy nhiên, các nhà đầu tư vẫn khá tin tưởng rằng mô hình này sẽ có mặt trong vòng hai tháng tới.

Cụ thể, OpenAI cho biết đã có hai sự kiện xảy ra trong những tuần gần đây (một mô hình tiên tiến đang được phát triển đã vượt khỏi tầm kiểm soát và tấn công cơ sở dữ liệu của một công ty bên thứ ba, và việc sắp ra mắt mô hình Astra) .(Nó có thể đã đạt đến ngưỡng "năng lực an ninh mạng quan trọng"), và sự tiến bộ nhanh chóng của nghiên cứu nội bộ đã khiến công ty càng phải tăng cường các biện pháp giám sát, điều chỉnh và bảo vệ cách ly ở tất cả các giai đoạn của quá trình đào tạo.
Nhà khoa học trưởng của OpenAI, Yakub Pachotsky, phát biểu tại một cuộc họp báo hôm thứ Ba: " Chúng tôi kỳ vọng các mô hình này sẽ cải thiện nhanh hơn nhiều so với trước đây, đó là lý do tại sao chúng tôi đang chú trọng hơn nữa vào việc tăng cường các biện pháp bảo mật ."
OpenAI cho biết, để đáp ứng các tiêu chuẩn an toàn, quá trình huấn luyện học tăng cường (RL) cho lô mô hình dự kiến triển khai mới nhất đã bị tạm dừng trong hai tuần nhằm tăng cường hơn nữa tính bảo mật của môi trường nghiên cứu và mở rộng phạm vi giám sát của hệ thống . Hiện tại, quá trình huấn luyện học tăng cường cho các mô hình tiên tiến quy mô lớn nhất của công ty vẫn đang bị tạm dừng .
Về các hoạt động cụ thể, OpenAI hiện yêu cầu các khối lượng công việc liên quan đến mô hình Astra hoặc các mô hình AI tiên tiến hơn phải áp dụng các biện pháp bảo mật nghiêm ngặt nhất. Do đó, một lượng lớn công việc liên quan sẽ bị tạm dừng cho đến khi quá trình chuyển đổi để đáp ứng các tiêu chuẩn bảo mật mới hoàn tất.
Quan trọng hơn, hệ thống giám sát đã được mở rộng bằng cách bổ sung thêm bộ phân loại kích hoạt.(Bộ phân loại kích hoạt). Các bộ phân loại này giám sát từng đơn vị từ vựng được lấy mẫu và báo cáo các bất thường tiềm ẩn cho hệ thống điều tra tự động.
Hệ thống được thiết kế để phát ra cảnh báo trong vòng 30 phút sau khi phát hiện hoạt động đáng ngờ . Nếu hệ thống giám sát xác định rằng một người hoặc mô hình có thể đã vi phạm ranh giới an ninh quan trọng, nó sẽ tạo ra cảnh báo ưu tiên cao nhất và ngay lập tức thông báo cho các nhóm an ninh, an toàn và nghiên cứu.
OpenAI giải thích rằng các biện pháp bảo mật này đòi hỏi một lượng sức mạnh tính toán đáng kể.
Theo ước tính hiện tại của công ty, chi phí sức mạnh tính toán bổ sung từ hệ thống giám sát xấp xỉ 20% sức mạnh tính toán suy luận được giám sát . Tuy nhiên, chi phí này có thể thay đổi đáng kể tùy thuộc vào các nhiệm vụ huấn luyện và đánh giá cụ thể.
Cần lưu ý rằng đây không phải là lần đầu tiên OpenAI tuyên bố trong tháng này rằng họ sẽ làm chậm quá trình huấn luyện các mô hình tiên tiến.
Ngày 7 tháng 8, OpenAI thông báo rằng mô hình Astra sắp ra mắt của họ có thể đã đạt tiêu chuẩn "Khung chuẩn bị".Astra đã vượt quá ngưỡng quan trọng về khả năng an ninh mạng và do đó sẽ tạm ngừng các hoạt động liên quan đến Astra không đáp ứng các yêu cầu kiểm soát an ninh nâng cao.
Do đó, "thời gian tạm đình chỉ hai tuần" được đề cập trong thông báo mới nhất nên được tính từ ít nhất hai tuần trước đó.
Khung Chuẩn bị là một tập hợp các tiêu chuẩn đánh giá được OpenAI đề xuất từ cuối năm 2023. Ngưỡng "nghiêm trọng" của năng lực an ninh mạng đề cập đến khả năng của các mô hình AI trong việc xác định và phát triển các "lỗ hổng zero-day" hiệu quả ở nhiều mức độ nghiêm trọng khác nhau trong nhiều hệ thống quan trọng thực tế được tăng cường mà không cần sự can thiệp của con người ; hoặc để hình thành và thực hiện các chiến lược tấn công mạng đầu cuối mới chống lại các mục tiêu được tăng cường chỉ dựa trên mục tiêu kỳ vọng ở cấp độ vĩ mô.
Thông báo mới nhất của OpenAI cũng đã làm dấy lên một cuộc tranh luận giữa cư dân mạng về một câu hỏi khác: khi nào mô hình Astra sẽ được công bố rộng rãi?
Hôm thứ Hai, có thông tin cho rằng Astra có thể được ra mắt ngay trong tuần này và mô hình sẽ được tích hợp vào nền tảng Codex của OpenAI, được thiết kế đặc biệt cho lập trình. Với những cải tiến đáng kể mà Astra mang lại so với GPT-5.6, phiên bản này khó có thể được đặt tên là GPT-5.7, mà thay vào đó sẽ mở ra kỷ nguyên của GPT-6.
Tuy nhiên, thông báo mới nhất của OpenAI hôm thứ Ba về "an toàn là trên hết" và việc hoãn mở rộng các mô hình lớn tiên tiến đã khiến thời điểm ra mắt "mô hình Astra sắp tới" ngày càng trở nên không chắc chắn.
Theo dữ liệu từ thị trường dự đoán Polymarket, xác suất mô hình Astra được phát hành vào tháng 8 đã giảm xuống còn 13% sau thông báo mới nhất của OpenAI. Tuy nhiên, các nhà đầu tư vẫn khá tin tưởng rằng mô hình này sẽ có mặt trong vòng hai tháng tới.