OpenAI vừa chính thức ra mắt GPT-6 Astra, mô hình mới được hãng định vị là “mô hình sử dụng máy tính mạnh mẽ nhất thế giới”. Điểm khác biệt lớn của Astra không nằm ở việc trả lời câu hỏi hay viết nội dung tốt hơn, mà ở khả năng trực tiếp thao tác trên máy tính và liên tục thực hiện một công việc từ đầu đến cuối.
Thay vì yêu cầu doanh nghiệp phải xây dựng API hoặc plugin riêng cho từng phần mềm, Astra có thể tương tác trực tiếp với giao diện bằng chuột, bàn phím và trình duyệt. Nó có thể điền biểu mẫu, cập nhật CRM, tìm kiếm trên web, xử lý Excel và Power BI, mở Python để phân tích dữ liệu, sử dụng KiCad và FreeCAD cho thiết kế kỹ thuật, cài đặt phần mềm, kiểm thử giao diện và xử lý lỗi xuất hiện trên màn hình.
Một màn trình diễn khá ấn tượng là thiết kế PCB trong KiCad. Astra nhận sơ đồ mạch, bố trí linh kiện lên bo mạch rồi tự định tuyến các đường đồng. Theo OpenAI, quá trình trình diễn này chỉ mất khoảng 15 giây. Trong một ví dụ khác, AI tạo mô hình ngôi nhà bằng Blender rồi đưa sang Unreal Engine 5 để biến nó thành không gian 3D có thể đi lại và quan sát.
Khả năng sử dụng máy tính cũng cải thiện đáng kể. Trong OSWorld 2.0, Astra đạt 72,6%, so với 65,7% của GPT-5.6 Sol. Thời gian trung bình hoàn thành một nhiệm vụ giảm từ khoảng 75 phút xuống 40 phút. ScreenSpot-Pro đạt 92,7%, so với 76,9% của GPT-5.6 Sol.
OpenAI cũng muốn Astra tiến xa hơn khái niệm “AI viết code”. Mục tiêu là một AI có thể nhận cả công việc kỹ thuật phần mềm, tự thao tác công cụ, kiểm tra kết quả, phát hiện lỗi rồi tiếp tục làm. Trong Terminal-Bench 4.0, Astra đạt 57,9%, cao hơn GPT-5.6 Sol ở mức 37,3% và Claude Fable 5.1 ở mức 55,8%.
Một thay đổi quan trọng khác liên quan đến các nhiệm vụ kéo dài. Thay vì liên tục nén lịch sử làm việc khi cửa sổ ngữ cảnh đầy và có nguy cơ đánh mất chi tiết, Astra có thể lưu giữ những thông tin quan trọng trong Codex rồi tìm lại yêu cầu cũ, kết quả kiểm thử và lịch sử sử dụng công cụ khi cần. Điều này giúp AI có khả năng theo đuổi những dự án dài hơi hơn.
Không chỉ lập trình, Astra được OpenAI hướng tới công việc chuyên môn và nghiên cứu khoa học. Mô hình có thể tạo bài thuyết trình theo mẫu, xử lý bảng tính và tài liệu, phân tích dữ liệu khoa học, sử dụng phần mềm chuyên ngành và tự xác định bước phân tích tiếp theo. Khi yêu cầu thiếu thông tin quan trọng, nó có thể dừng lại để hỏi; nếu chi tiết đó không ảnh hưởng lớn đến kết quả, AI có thể đưa ra giả định hợp lý và tiếp tục công việc.

Khả năng mạnh hơn cũng kéo theo vấn đề an toàn lớn hơn. Trong ExploitBench, Astra đạt 100%, so với 78,5% của GPT-5.6 Sol. OpenAI cho biết mô hình đã đạt tới ngưỡng mà nó có thể phát hiện những lỗ hổng phần mềm chưa từng được biết đến và hình thành chuỗi khai thác. Vì vậy, một số khả năng an ninh mạng nâng cao bị hạn chế và chỉ được mở dần cho các chuyên gia bảo mật đáng tin cậy.
Đây cũng cho thấy vấn đề an toàn AI đang thay đổi. Khi AI chỉ trò chuyện, câu hỏi lớn là “nó có trả lời sai không?”. Khi AI có quyền sử dụng máy tính, câu hỏi trở thành “nó được phép làm gì, được truy cập vào đâu và khi nào con người phải ngăn nó lại?”. OpenAI vì thế bổ sung hệ thống giám sát hành động và có thể tạm dừng nhiệm vụ nếu phát hiện hành vi trái phép.
Đổi lại, Astra không hề rẻ. API tiêu chuẩn có giá 10 USD cho một triệu token đầu vào và 50 USD cho một triệu token đầu ra, cao gấp 2,5 lần GPT-5.6 Sol. OpenAI lập luận rằng chi phí token cao hơn chưa chắc đồng nghĩa chi phí hoàn thành công việc cao hơn, bởi Astra có thể sử dụng ít token và cần ít lần thử hơn. Dữ liệu của Artificial Analysis lại cho thấy bức tranh phức tạp hơn: trên một số phép đo, chi phí cho một nhiệm vụ của Astra vẫn cao hơn đáng kể.
Astra hiện mới được cung cấp cho một số tổ chức và dự kiến triển khai tới người dùng ChatGPT Plus, Pro, Business và Enterprise trong những ngày tới, đồng thời có mặt qua API và Amazon Bedrock.
Điều đáng chú ý nhất vì thế không phải Astra đứng thứ mấy trên bảng benchmark. OpenAI đang chuyển từ chatbot sang một dạng “nhân viên AI” có thể trực tiếp ngồi trước máy tính, sử dụng phần mềm và làm việc trong thời gian dài. Chính Greg Brockman cũng cho rằng chưa có tiêu chuẩn thống nhất để khẳng định Astra là AGI, nhưng một hệ thống có thể xử lý hàng loạt nhiệm vụ từ trình duyệt, lập trình, toán học đến khoa học và luật pháp đã khiến câu hỏi về AGI trở nên thực tế hơn trước rất nhiều.
>> OpenAI hé lộ mô hình thế hệ mới Astra: có khả năng tự tìm kiếm lỗ hổng và thực hiện các cuộc tấn công
Thay vì yêu cầu doanh nghiệp phải xây dựng API hoặc plugin riêng cho từng phần mềm, Astra có thể tương tác trực tiếp với giao diện bằng chuột, bàn phím và trình duyệt. Nó có thể điền biểu mẫu, cập nhật CRM, tìm kiếm trên web, xử lý Excel và Power BI, mở Python để phân tích dữ liệu, sử dụng KiCad và FreeCAD cho thiết kế kỹ thuật, cài đặt phần mềm, kiểm thử giao diện và xử lý lỗi xuất hiện trên màn hình.
Một màn trình diễn khá ấn tượng là thiết kế PCB trong KiCad. Astra nhận sơ đồ mạch, bố trí linh kiện lên bo mạch rồi tự định tuyến các đường đồng. Theo OpenAI, quá trình trình diễn này chỉ mất khoảng 15 giây. Trong một ví dụ khác, AI tạo mô hình ngôi nhà bằng Blender rồi đưa sang Unreal Engine 5 để biến nó thành không gian 3D có thể đi lại và quan sát.
Khả năng sử dụng máy tính cũng cải thiện đáng kể. Trong OSWorld 2.0, Astra đạt 72,6%, so với 65,7% của GPT-5.6 Sol. Thời gian trung bình hoàn thành một nhiệm vụ giảm từ khoảng 75 phút xuống 40 phút. ScreenSpot-Pro đạt 92,7%, so với 76,9% của GPT-5.6 Sol.
OpenAI cũng muốn Astra tiến xa hơn khái niệm “AI viết code”. Mục tiêu là một AI có thể nhận cả công việc kỹ thuật phần mềm, tự thao tác công cụ, kiểm tra kết quả, phát hiện lỗi rồi tiếp tục làm. Trong Terminal-Bench 4.0, Astra đạt 57,9%, cao hơn GPT-5.6 Sol ở mức 37,3% và Claude Fable 5.1 ở mức 55,8%.
Một thay đổi quan trọng khác liên quan đến các nhiệm vụ kéo dài. Thay vì liên tục nén lịch sử làm việc khi cửa sổ ngữ cảnh đầy và có nguy cơ đánh mất chi tiết, Astra có thể lưu giữ những thông tin quan trọng trong Codex rồi tìm lại yêu cầu cũ, kết quả kiểm thử và lịch sử sử dụng công cụ khi cần. Điều này giúp AI có khả năng theo đuổi những dự án dài hơi hơn.
Không chỉ lập trình, Astra được OpenAI hướng tới công việc chuyên môn và nghiên cứu khoa học. Mô hình có thể tạo bài thuyết trình theo mẫu, xử lý bảng tính và tài liệu, phân tích dữ liệu khoa học, sử dụng phần mềm chuyên ngành và tự xác định bước phân tích tiếp theo. Khi yêu cầu thiếu thông tin quan trọng, nó có thể dừng lại để hỏi; nếu chi tiết đó không ảnh hưởng lớn đến kết quả, AI có thể đưa ra giả định hợp lý và tiếp tục công việc.

Khả năng mạnh hơn cũng kéo theo vấn đề an toàn lớn hơn. Trong ExploitBench, Astra đạt 100%, so với 78,5% của GPT-5.6 Sol. OpenAI cho biết mô hình đã đạt tới ngưỡng mà nó có thể phát hiện những lỗ hổng phần mềm chưa từng được biết đến và hình thành chuỗi khai thác. Vì vậy, một số khả năng an ninh mạng nâng cao bị hạn chế và chỉ được mở dần cho các chuyên gia bảo mật đáng tin cậy.
Đây cũng cho thấy vấn đề an toàn AI đang thay đổi. Khi AI chỉ trò chuyện, câu hỏi lớn là “nó có trả lời sai không?”. Khi AI có quyền sử dụng máy tính, câu hỏi trở thành “nó được phép làm gì, được truy cập vào đâu và khi nào con người phải ngăn nó lại?”. OpenAI vì thế bổ sung hệ thống giám sát hành động và có thể tạm dừng nhiệm vụ nếu phát hiện hành vi trái phép.
Đổi lại, Astra không hề rẻ. API tiêu chuẩn có giá 10 USD cho một triệu token đầu vào và 50 USD cho một triệu token đầu ra, cao gấp 2,5 lần GPT-5.6 Sol. OpenAI lập luận rằng chi phí token cao hơn chưa chắc đồng nghĩa chi phí hoàn thành công việc cao hơn, bởi Astra có thể sử dụng ít token và cần ít lần thử hơn. Dữ liệu của Artificial Analysis lại cho thấy bức tranh phức tạp hơn: trên một số phép đo, chi phí cho một nhiệm vụ của Astra vẫn cao hơn đáng kể.
Astra hiện mới được cung cấp cho một số tổ chức và dự kiến triển khai tới người dùng ChatGPT Plus, Pro, Business và Enterprise trong những ngày tới, đồng thời có mặt qua API và Amazon Bedrock.
Điều đáng chú ý nhất vì thế không phải Astra đứng thứ mấy trên bảng benchmark. OpenAI đang chuyển từ chatbot sang một dạng “nhân viên AI” có thể trực tiếp ngồi trước máy tính, sử dụng phần mềm và làm việc trong thời gian dài. Chính Greg Brockman cũng cho rằng chưa có tiêu chuẩn thống nhất để khẳng định Astra là AGI, nhưng một hệ thống có thể xử lý hàng loạt nhiệm vụ từ trình duyệt, lập trình, toán học đến khoa học và luật pháp đã khiến câu hỏi về AGI trở nên thực tế hơn trước rất nhiều.
>> OpenAI hé lộ mô hình thế hệ mới Astra: có khả năng tự tìm kiếm lỗ hổng và thực hiện các cuộc tấn công