Mẫn Nhi✔
Admin xinh gái
Hôm 22/9, Anthropic đã chính thức giới thiệu Claude Opus 5.5 và khẳng định đây là hệ thống trí tuệ nhân tạo mạnh nhất từng được công ty thử nghiệm thành công. Ở thời điểm hiện tại, người dùng đã có thể trải nghiệm mô hình này qua giao diện Claude trên trình duyệt web, thiết bị di động, thông qua cổng API với tên định danh claude-opus-5-5, cũng như trên các nền tảng đám mây gồm Amazon Web Services, Google Cloud và Microsoft Azure.

Sự xuất hiện của Opus 5.5 tạo nên một vị trí khá đặc biệt trong danh mục sản phẩm của Anthropic. Đại diện công ty cho biết mô hình mới có thể giải quyết phần lớn yêu cầu công việc ở mức độ tương đương với Claude Fable 5.1, phiên bản đầu bảng dành cho nhóm người dùng đại chúng vừa ra mắt hồi đầu tháng 9. Điểm nổi bật là phí vận hành của Opus 5.5 đã giảm khoảng 40% so với thế hệ Opus 5 tiền nhiệm ở các tác vụ thông thường, đồng thời tốc độ đưa ra phản hồi tăng thêm hơn 30%.

Trong khi đó, Fable 5.1 hiện duy trì mức phí 10 USD (khoảng 262.000 đồng) cho token nạp vào và 50 USD (khoảng 1,31 triệu đồng) cho token xuất ra. Theo tính toán từ VentureBeat, giá token tiêu chuẩn của Opus 5.5 rẻ hơn tới khoảng 60% nếu đặt cạnh Fable 5.1.
Chi phí sử dụng tính năng lưu bộ nhớ đệm (prompt caching), công cụ giúp hệ thống tránh phải đọc lại các dữ liệu trùng lặp, cũng được điều chỉnh hạ xuống. Mỗi một triệu token được truy xuất từ bộ nhớ đệm hiện có giá 0,2 USD (khoảng 5.200 đồng), tương đương mức giảm 60% so với Opus 5. Nhóm khách hàng có nhu cầu xử lý khẩn cấp có thể kích hoạt tùy chọn Fast với mức phí tăng gấp hai lần, ở mức 8 USD đầu vào và 40 USD đầu ra (xấp xỉ 210.000 và 1,05 triệu đồng).

Đối với các tác vụ văn phòng tổng hợp, mô hình mới đạt 1.846 điểm Elo trên thang đo GDPval-AA v2.1, xếp trên cả Fable 5.1 với 1.735 điểm và Opus 5 với 1.708 điểm. Dẫu vậy, ở những bài thử nghiệm khả năng tương tác hệ điều hành như OSWorld 2.0 hay phân tích trực quan cùng Chartography, mức cách biệt giữa các mô hình chỉ dao động quanh ngưỡng một phần trăm.
Anthropic cũng chia sẻ thêm số liệu từ các thử nghiệm thực tế trong nội bộ. Khi thực hiện quy trình chuyển đổi toàn bộ mã nguồn từ C sang Rust, Opus 5.5 hoàn tất sau 9,5 giờ với tổng chi phí giảm 51%, trong khi Fable 5.1 cần tới 12 giờ. Ở một bài thử nghiệm khác về rà soát mã nguồn, Opus 5 cần hơn 20 giờ để xử lý, nhưng Opus 5.5 giải quyết trọn vẹn chỉ trong vòng chưa đầy 3 giờ.
So sánh với các sản phẩm khác trên thị trường, dữ liệu do OfficeChai tổng hợp cho thấy Opus 5.5 chiếm ưu thế trước GPT-6 Astra của OpenAI ở phần lớn bài kiểm tra, bao gồm Terminal-Bench 4.0 (66,4% so với 57,9%) hay bài kiểm tra Humanity's Last Exam khi kết hợp công cụ bổ trợ (67,7% so với 57,2%). Tuy nhiên, GPT-6 Astra vẫn duy trì vị thế dẫn đầu ở bài kiểm tra tự động hóa quy trình AutomationBench và bài đo Terminal-Bench-Science với kết quả 64,6% so với 58,7%.
Bản thân Anthropic cũng đưa ra lưu ý rằng ở ngưỡng phát triển hiện nay, các chỉ số benchmark đơn thuần chưa phản ánh trọn vẹn năng lực thực tế, và khoảng cách vận hành ngoài đời thực giữa Opus 5.5 và Fable 5.1 trên thực tế thu hẹp hơn những gì điểm số đang biểu thị.
Về mặt tích hợp kỹ thuật, các lập trình viên cần thực hiện một số điều chỉnh khi chuyển sang Opus 5.5. Chế độ suy luận sâu (thinking mode) hiện được kích hoạt mặc định và không cho phép tắt. Việc cưỡng ép mô hình gọi một công cụ nhất định có thể phát sinh cảnh báo lỗi. Ngoài ra, những hệ thống có thói quen tận dụng đoạn văn bản hiển thị giữa các chu kỳ gọi công cụ để làm thông báo trạng thái cũng cần được cấu hình lại.
Đi kèm với việc ra mắt mô hình mới, Anthropic đã nâng cao trần giới hạn sử dụng trong mỗi chu kỳ 5 giờ dành cho người dùng các gói Pro, Max, Team và Enterprise dựa trên số lượng tài khoản. Các khách hàng đăng ký thuê bao cũng được cấp một lượt đặt lại giới hạn sử dụng, có thể kích hoạt tùy ý bất kỳ lúc nào từ nay cho đến hết ngày 22/10.
Anthropic cũng cho biết thêm rằng các phiên bản tiếp theo gồm Claude Sonnet 5.5 và Haiku 5.5 dự kiến sẽ sớm được công bố trong vài tuần tới.

Sự xuất hiện của Opus 5.5 tạo nên một vị trí khá đặc biệt trong danh mục sản phẩm của Anthropic. Đại diện công ty cho biết mô hình mới có thể giải quyết phần lớn yêu cầu công việc ở mức độ tương đương với Claude Fable 5.1, phiên bản đầu bảng dành cho nhóm người dùng đại chúng vừa ra mắt hồi đầu tháng 9. Điểm nổi bật là phí vận hành của Opus 5.5 đã giảm khoảng 40% so với thế hệ Opus 5 tiền nhiệm ở các tác vụ thông thường, đồng thời tốc độ đưa ra phản hồi tăng thêm hơn 30%.
Chi phí API thấp hơn phân nửa so với Fable 5.1
Mức phí API được áp dụng cho Opus 5.5 là 4 USD (tương đương khoảng 105.000 đồng) cho mỗi một triệu token đầu vào và 20 USD (khoảng 524.000 đồng) cho một triệu token đầu ra. Để so sánh, mức giá tương ứng trên thế hệ Opus 5 trước đó lần lượt là 5 USD và 25 USD. Với vai trò là đơn vị cơ bản cấu thành văn bản mà mô hình tiếp nhận và phản hồi, giá token đóng vai trò then chốt trong tổng chi phí của các lập trình viên cùng các doanh nghiệp.
Trong khi đó, Fable 5.1 hiện duy trì mức phí 10 USD (khoảng 262.000 đồng) cho token nạp vào và 50 USD (khoảng 1,31 triệu đồng) cho token xuất ra. Theo tính toán từ VentureBeat, giá token tiêu chuẩn của Opus 5.5 rẻ hơn tới khoảng 60% nếu đặt cạnh Fable 5.1.
Chi phí sử dụng tính năng lưu bộ nhớ đệm (prompt caching), công cụ giúp hệ thống tránh phải đọc lại các dữ liệu trùng lặp, cũng được điều chỉnh hạ xuống. Mỗi một triệu token được truy xuất từ bộ nhớ đệm hiện có giá 0,2 USD (khoảng 5.200 đồng), tương đương mức giảm 60% so với Opus 5. Nhóm khách hàng có nhu cầu xử lý khẩn cấp có thể kích hoạt tùy chọn Fast với mức phí tăng gấp hai lần, ở mức 8 USD đầu vào và 40 USD đầu ra (xấp xỉ 210.000 và 1,05 triệu đồng).
Vượt trội Fable 5.1 ở các bài thử nghiệm lập trình
Theo công bố từ Anthropic, Opus 5.5 đạt điểm số 66,4% trên bài đánh giá Terminal-Bench 4.0, công cụ đo lường mức độ tự động hóa thao tác dòng lệnh. Kết quả này vượt trội so với mức 55,8% của Fable 5.1 và 52,3% của Opus 5. Tại bài kiểm tra CursorBench 4.0, Opus 5.5 ghi nhận 57,8% trong khi Fable 5.1 dừng ở mức 51,8%. Mức chênh lệch tại FrontierCode v1.1 được thu hẹp hơn, lần lượt là 54,4% và 50,3%.
Đối với các tác vụ văn phòng tổng hợp, mô hình mới đạt 1.846 điểm Elo trên thang đo GDPval-AA v2.1, xếp trên cả Fable 5.1 với 1.735 điểm và Opus 5 với 1.708 điểm. Dẫu vậy, ở những bài thử nghiệm khả năng tương tác hệ điều hành như OSWorld 2.0 hay phân tích trực quan cùng Chartography, mức cách biệt giữa các mô hình chỉ dao động quanh ngưỡng một phần trăm.
Anthropic cũng chia sẻ thêm số liệu từ các thử nghiệm thực tế trong nội bộ. Khi thực hiện quy trình chuyển đổi toàn bộ mã nguồn từ C sang Rust, Opus 5.5 hoàn tất sau 9,5 giờ với tổng chi phí giảm 51%, trong khi Fable 5.1 cần tới 12 giờ. Ở một bài thử nghiệm khác về rà soát mã nguồn, Opus 5 cần hơn 20 giờ để xử lý, nhưng Opus 5.5 giải quyết trọn vẹn chỉ trong vòng chưa đầy 3 giờ.
So sánh với các sản phẩm khác trên thị trường, dữ liệu do OfficeChai tổng hợp cho thấy Opus 5.5 chiếm ưu thế trước GPT-6 Astra của OpenAI ở phần lớn bài kiểm tra, bao gồm Terminal-Bench 4.0 (66,4% so với 57,9%) hay bài kiểm tra Humanity's Last Exam khi kết hợp công cụ bổ trợ (67,7% so với 57,2%). Tuy nhiên, GPT-6 Astra vẫn duy trì vị thế dẫn đầu ở bài kiểm tra tự động hóa quy trình AutomationBench và bài đo Terminal-Bench-Science với kết quả 64,6% so với 58,7%.
Bản thân Anthropic cũng đưa ra lưu ý rằng ở ngưỡng phát triển hiện nay, các chỉ số benchmark đơn thuần chưa phản ánh trọn vẹn năng lực thực tế, và khoảng cách vận hành ngoài đời thực giữa Opus 5.5 và Fable 5.1 trên thực tế thu hẹp hơn những gì điểm số đang biểu thị.
Cơ chế điều hướng tác vụ nhạy cảm và thay đổi kỹ thuật
Do sở hữu năng lực chuyên sâu về an ninh mạng và nghiên cứu sinh học tương đương Fable 5.1, Opus 5.5 cũng áp dụng hệ thống bảo đảm an toàn tương tự. Một số câu lệnh liên quan đến an ninh mạng sẽ được hệ thống tự động chuyển tiếp cho phiên bản Opus 4.8 giải quyết. Trang tin The New Stack nhận định điều này có thể tạo ra rủi ro cho các chuỗi tác vụ AI tự động nhiều giai đoạn, khi hệ thống nhận dữ liệu phản hồi từ các mô hình có năng lực không đồng nhất mà không hề hay biết. Các chuyên gia an ninh mạng và nhà khoa học sự sống đáp ứng điều kiện có thể đăng ký kênh xác minh riêng để được gỡ bỏ các rào cản này.Về mặt tích hợp kỹ thuật, các lập trình viên cần thực hiện một số điều chỉnh khi chuyển sang Opus 5.5. Chế độ suy luận sâu (thinking mode) hiện được kích hoạt mặc định và không cho phép tắt. Việc cưỡng ép mô hình gọi một công cụ nhất định có thể phát sinh cảnh báo lỗi. Ngoài ra, những hệ thống có thói quen tận dụng đoạn văn bản hiển thị giữa các chu kỳ gọi công cụ để làm thông báo trạng thái cũng cần được cấu hình lại.
Đi kèm với việc ra mắt mô hình mới, Anthropic đã nâng cao trần giới hạn sử dụng trong mỗi chu kỳ 5 giờ dành cho người dùng các gói Pro, Max, Team và Enterprise dựa trên số lượng tài khoản. Các khách hàng đăng ký thuê bao cũng được cấp một lượt đặt lại giới hạn sử dụng, có thể kích hoạt tùy ý bất kỳ lúc nào từ nay cho đến hết ngày 22/10.
Anthropic cũng cho biết thêm rằng các phiên bản tiếp theo gồm Claude Sonnet 5.5 và Haiku 5.5 dự kiến sẽ sớm được công bố trong vài tuần tới.