Bí ẩn Codex “ngốn” token bất thường đã có lời giải

Phạm Thanh Bình
Phạm Thanh Bình
Phản hồi: 0
Sau nhiều ngày người dùng phàn nàn rằng hạn mức sử dụng Codex tụt nhanh bất thường, nguyên nhân cuối cùng đã dần được làm rõ. Điều đáng chú ý là vấn đề không chỉ nằm ở các tác vụ AI phức tạp, mà còn liên quan đến một số tính năng chạy nền, trong đó có cả chức năng tưởng như rất đơn giản: tự động đặt tiêu đề cho cuộc hội thoại.

Từ giữa đến cuối tháng 8, một số người dùng trả phí bắt đầu phản ánh rằng hạn mức Codex của họ được tiêu thụ nhanh hơn đáng kể so với trước. Có trường hợp cho biết những công việc trước đây có thể thực hiện trong thời gian dài mà không gặp vấn đề, nay lại nhanh chóng tiến sát giới hạn sử dụng. Thậm chí, một người dùng cho biết đã tiêu thụ khoảng 80% hạn mức của gói Pro 200 USD chỉ trong 16 giờ. Điều này khiến cộng đồng nghi ngờ OpenAI đã âm thầm giảm hạn mức sử dụng, nhất là trong bối cảnh lượng người sử dụng Codex tăng mạnh.

Ban đầu, bộ nhớ cache bị cho là nguyên nhân

Ngày 22/8, Tibo Sottiaux, người đứng đầu OpenAI Codex, lên tiếng giải thích rằng một số người dùng có tỷ lệ cache hit thấp hơn bình thường. Hiểu đơn giản, AI có thể tận dụng dữ liệu tính toán trước đó được lưu trong cache để giảm lượng xử lý cần thực hiện lại. Nếu cache không được sử dụng hiệu quả, hệ thống phải xử lý lại nhiều thông tin, từ đó làm tăng lượng tài nguyên tiêu thụ. Tuy nhiên lời giải thích này chưa thuyết phục được cộng đồng. Người dùng đặt câu hỏi liệu việc giảm hiệu quả cache có thực sự đủ để giải thích mức tiêu hao hạn mức lớn mà họ quan sát được hay không.

Trong phần phân tích sau sự cố, Tibo cho biết có ba vấn đề đáng chú ý liên quan đến mức sử dụng tài nguyên cao hơn dự kiến.

1. Compaction trong các cuộc hội thoại dài

Khi một phiên làm việc với Codex trở nên quá dài, hệ thống có thể thực hiện compaction, tức nén hoặc tóm tắt phần lịch sử cũ để giải phóng không gian ngữ cảnh cho các bước tiếp theo. Cơ chế này vốn giúp Codex tiếp tục xử lý những tác vụ kéo dài. Tuy nhiên khi cuộc hội thoại chứa nhiều hình ảnh và trải qua nhiều vòng compaction, quá trình xử lý có thể tạo ra lượng tính toán bổ sung đáng kể.

Nói đơn giản: Context càng dài + nhiều hình ảnh + compaction nhiều lần = lượng tài nguyên xử lý có thể tăng mạnh.

2. Computer History làm tăng mức sử dụng

Nguyên nhân thứ hai được đề cập là Computer History, một tính năng có thể đưa lịch sử hoạt động từ các ứng dụng và website được lựa chọn trên máy Mac vào ChatGPT và Codex. Theo nội dung được chia sẻ, nhóm thường xuyên sử dụng tính năng này có mức tiêu thụ tài nguyên cao hơn đáng kể.

Điều này cũng khá dễ hiểu. Khi Codex phải xử lý thêm lượng lớn dữ liệu lịch sử, context đầu vào trở nên lớn hơn và hệ thống cần nhiều tài nguyên hơn để suy luận.
1787580514975.png
3. Tự động đặt tiêu đề cuộc trò chuyện cũng tiêu tốn tài nguyên

Đây lại là chi tiết khiến cộng đồng chú ý nhất. Codex có một chức năng rất nhỏ: tự động tạo tiêu đề cho mỗi cuộc hội thoại để người dùng dễ tìm lại trong danh sách lịch sử. Về lý thuyết, đây chỉ là một tác vụ phụ chạy nền và gần như không được người dùng chú ý. Nhưng theo phần giải thích được chia sẻ, lượng tài nguyên mà tính năng này sử dụng lại cao hơn dự kiến.

Chính điều này khiến một số người dùng gọi nó là “hố đen hạn mức ẩn”, bởi một chức năng phụ có thể sử dụng tài nguyên trong khi người dùng gần như không nhận biết được.

Sau khi xác định các vấn đề, Tibo cho biết hệ thống sẽ tiến hành reset hoàn toàn hạn mức cho người dùng. Động thái này được xem như biện pháp bù lại lượng tài nguyên đã bị tiêu hao bất thường trong thời gian xảy ra sự cố. Một số thành viên cộng đồng thậm chí ước tính rằng nếu việc reset được thực hiện trên quy mô rất lớn, lượng tài nguyên tính toán mà OpenAI phải cung cấp bổ sung có thể có giá trị lên tới hàng triệu USD.

Có phải Codex thực sự là “hố đen ngốn token”?

Cách gọi này hơi cường điệu, nhưng nó mô tả khá đúng cảm giác của người dùng gặp sự cố. Điểm đáng chú ý nhất không phải là một tính năng đặt tiêu đề tự nó ngốn toàn bộ hạn mức, bởi theo nội dung được công bố, vấn đề xuất phát từ nhiều yếu tố kết hợp, bao gồm cache, compaction, Computer History và tác vụ tạo tiêu đề.

Sự việc cũng cho thấy một vấn đề đặc thù của các AI coding agent hiện nay: người dùng có thể chỉ nhìn thấy Codex đang thực hiện một nhiệm vụ, nhưng phía sau nhiệm vụ đó còn có nhiều tác vụ AI khác chạy ngầm. Với những phiên lập trình kéo dài, context lớn và nhiều lần xử lý lại, chi phí tính toán thực tế có thể lớn hơn rất nhiều so với những gì người dùng nhìn thấy trên màn hình.
 
Back
Top