Mẫn Nhi✔
Admin xinh gái
Mô hình bí ẩn càn quét bảng xếp hạng coding suốt tuần qua vừa lộ diện là GLM-5.3-Flash của Zhipu AI. Bất ngờ lớn nhất không nằm ở hiệu năng, mà ở dàn hạ tầng đứng sau: 100.000 con chip hoàn toàn nội địa, minh chứng cho thấy công nghệ Trung Quốc đang tìm được đường sống mà không cần dựa dẫm vào Nvidia.

Suốt nhiều ngày qua, cộng đồng lập trình viên quốc tế liên tục bàn tán về một mô hình bí ẩn mang mã Ox Alpha khi nó bất ngờ leo thẳng lên top đầu các nền tảng OpenRouter và OpenCode. Danh tính của con "quái vật" này đã chính thức lộ diện: đó là GLM-5.3-Flash, mô hình trọng số mở thế hệ mới nhất do Zhipu AI phát triển.
Trước khi công bố chính thức, hệ thống này đã âm thầm xử lý tới 62 nghìn tỷ token trong giai đoạn thử nghiệm kín. Riêng trên OpenRouter, mô hình cán mốc hơn 11 nghìn tỷ token chỉ sau 3 ngày đầu tiên, tạo nên màn ra mắt có quy mô lưu lượng lớn nhất từ trước đến nay trên nền tảng này. Dữ liệu ghi nhận Ox Alpha chiếm gần 31% tổng lưu lượng tuần của mảng AI hỗ trợ viết code, trực tiếp đẩy cổ phiếu Zhipu AI tại sàn Hong Kong tăng vọt hơn 12%.
Ai cũng hiểu chip nội địa Trung Quốc hiện vẫn thua thiệt đáng kể so với GPU đầu bảng của Nvidia về băng thông lẫn dung lượng bộ nhớ. Để giải quyết nút thắt cổ chai này, Zhipu đã xây dựng một công cụ suy luận chuyên biệt, chia nhỏ quy trình xử lý thành các cụm tính toán độc lập. Hãng khẳng định giải pháp kiến trúc này giúp tăng hiệu năng phục vụ thực tế lên gấp ba lần so với ban đầu, kéo chi phí phần cứng trên mỗi token xuống mức tương đương các dòng chip phổ biến của Nvidia.
Dù Zhipu không nêu đích danh nhà cung cấp chip cụ thể cho cụm 100.000 đơn vị này, hãng vốn có lịch sử hợp tác sâu với các tên tuổi bán dẫn hàng đầu như Huawei, Cambricon và Moore Threads. Cả Cambricon lẫn Moore Threads đều nhanh chóng xác nhận việc hỗ trợ tương thích tuyệt đối ngay từ ngày đầu tiên cho GLM-5.3-Flash.
Để lôi kéo giới phát triển quốc tế, Zhipu tung ra chính sách giá cực kỳ hung hãn. GLM-5.3-Flash có giá chỉ bằng 1/10 bản GLM-5.3 tiêu chuẩn, thậm chí giảm xuống 1/20 trong đợt khuyến mại. Hãng tự tin mức giá này rẻ hơn khoảng 40 lần so với Opus 4.8 của Anthropic dù cung cấp mức độ thông minh tương đương.
Dẫu vậy, phản hồi từ người dùng thực tế không hoàn toàn là màu hồng. Dù được khen ngợi ở khả năng sửa lỗi mã nguồn phức tạp với việc giải được 28% trong số 175 bài toán LiveCodeBench, mô hình vẫn bộc lộ một số vấn đề như hiện tượng "ảo giác", thỉnh thoảng bỏ sót tác vụ và tốc độ phản hồi còn chậm. Đánh giá từ Artificial Analysis cũng chỉ ra tốc độ sinh từ của GLM-5.3-Flash hiện vẫn xếp sau mức trung bình của ngành.
Cuộc đua mã nguồn mở tại Trung Quốc rõ ràng đang nóng lên từng ngày khi các đối thủ cũng không ngồi yên. Ngay cùng thời điểm, Alibaba đã tung ra bản xem trước Qwen3.8-Flash-Next với cơ chế kích hoạt 6 tỷ trên tổng số 125 tỷ tham số nhằm kéo chi phí sử dụng xuống mức sàn, báo hiệu một cuộc chiến hạ giá và tối ưu phần cứng ngày càng khốc liệt.
Cú "đánh úp" ngoạn mục mang tên Ox Alpha

Suốt nhiều ngày qua, cộng đồng lập trình viên quốc tế liên tục bàn tán về một mô hình bí ẩn mang mã Ox Alpha khi nó bất ngờ leo thẳng lên top đầu các nền tảng OpenRouter và OpenCode. Danh tính của con "quái vật" này đã chính thức lộ diện: đó là GLM-5.3-Flash, mô hình trọng số mở thế hệ mới nhất do Zhipu AI phát triển.
Trước khi công bố chính thức, hệ thống này đã âm thầm xử lý tới 62 nghìn tỷ token trong giai đoạn thử nghiệm kín. Riêng trên OpenRouter, mô hình cán mốc hơn 11 nghìn tỷ token chỉ sau 3 ngày đầu tiên, tạo nên màn ra mắt có quy mô lưu lượng lớn nhất từ trước đến nay trên nền tảng này. Dữ liệu ghi nhận Ox Alpha chiếm gần 31% tổng lưu lượng tuần của mảng AI hỗ trợ viết code, trực tiếp đẩy cổ phiếu Zhipu AI tại sàn Hong Kong tăng vọt hơn 12%.
Bù đắp khoảng cách phần cứng bằng kiến trúc phần mềm
Điểm gây chấn động nhất trong đợt phát hành lần này chính là hạ tầng vận hành. Zhipu AI xác nhận toàn bộ khối lượng công việc khổng lồ trên đều chạy trên một cụm 100.000 vi xử lý sản xuất hoàn toàn tại Trung Quốc. Đây là bài kiểm tra quy mô lớn đầu tiên chứng minh khả năng xử lý các tác vụ suy luận toàn cầu bằng phần cứng nội địa, giữa bối cảnh các lệnh kiểm soát xuất khẩu chip cao cấp từ Mỹ ngày càng siết chặt.Ai cũng hiểu chip nội địa Trung Quốc hiện vẫn thua thiệt đáng kể so với GPU đầu bảng của Nvidia về băng thông lẫn dung lượng bộ nhớ. Để giải quyết nút thắt cổ chai này, Zhipu đã xây dựng một công cụ suy luận chuyên biệt, chia nhỏ quy trình xử lý thành các cụm tính toán độc lập. Hãng khẳng định giải pháp kiến trúc này giúp tăng hiệu năng phục vụ thực tế lên gấp ba lần so với ban đầu, kéo chi phí phần cứng trên mỗi token xuống mức tương đương các dòng chip phổ biến của Nvidia.
Dù Zhipu không nêu đích danh nhà cung cấp chip cụ thể cho cụm 100.000 đơn vị này, hãng vốn có lịch sử hợp tác sâu với các tên tuổi bán dẫn hàng đầu như Huawei, Cambricon và Moore Threads. Cả Cambricon lẫn Moore Threads đều nhanh chóng xác nhận việc hỗ trợ tương thích tuyệt đối ngay từ ngày đầu tiên cho GLM-5.3-Flash.
Giá rẻ giật mình nhưng trải nghiệm thực tế vẫn còn gợn
Về mặt kỹ thuật, GLM-5.3-Flash sở hữu tổng cộng 320 tỷ tham số, nhưng chỉ kích hoạt 18 tỷ tham số cho mỗi yêu cầu để tiết kiệm tối đa tài nguyên tính toán. Đây cũng là phiên bản đầu tiên trong dòng GLM-5 có khả năng xử lý thị giác song song với văn bản. Trên bảng xếp hạng Intelligence Index của đơn vị đánh giá Artificial Analysis, mô hình đạt 57 điểm, đứng thứ 10 toàn cầu và xếp thứ ba trong nhóm mô hình trọng số mở, đứng sau Kimi K3 và Qwen3.8.Để lôi kéo giới phát triển quốc tế, Zhipu tung ra chính sách giá cực kỳ hung hãn. GLM-5.3-Flash có giá chỉ bằng 1/10 bản GLM-5.3 tiêu chuẩn, thậm chí giảm xuống 1/20 trong đợt khuyến mại. Hãng tự tin mức giá này rẻ hơn khoảng 40 lần so với Opus 4.8 của Anthropic dù cung cấp mức độ thông minh tương đương.
Dẫu vậy, phản hồi từ người dùng thực tế không hoàn toàn là màu hồng. Dù được khen ngợi ở khả năng sửa lỗi mã nguồn phức tạp với việc giải được 28% trong số 175 bài toán LiveCodeBench, mô hình vẫn bộc lộ một số vấn đề như hiện tượng "ảo giác", thỉnh thoảng bỏ sót tác vụ và tốc độ phản hồi còn chậm. Đánh giá từ Artificial Analysis cũng chỉ ra tốc độ sinh từ của GLM-5.3-Flash hiện vẫn xếp sau mức trung bình của ngành.
Cuộc đua mã nguồn mở tại Trung Quốc rõ ràng đang nóng lên từng ngày khi các đối thủ cũng không ngồi yên. Ngay cùng thời điểm, Alibaba đã tung ra bản xem trước Qwen3.8-Flash-Next với cơ chế kích hoạt 6 tỷ trên tổng số 125 tỷ tham số nhằm kéo chi phí sử dụng xuống mức sàn, báo hiệu một cuộc chiến hạ giá và tối ưu phần cứng ngày càng khốc liệt.