Điều đáng sợ ở DeepSeek V4.1 Flash không phải 552 tỷ tham số!

Trung Đào
Trung Đào
Phản hồi: 0
Hôm nay DeepSeek vừa tung V4.1 Flash, phiên bản được định vị là một model nhanh, nhẹ và rẻ hơn V4 Pro. Nhìn vào thông số, thứ gây chú ý đầu tiên là con số 552 tỷ tham số. Nhưng đây không phải điều mình quan tâm nhất. Điểm đáng nói nằm ở cách DeepSeek chỉ kích hoạt khoảng 8 tỷ tham số khi xử lý đầu vào và 16 tỷ tham số khi tạo đầu ra. Nếu những con số hiệu năng mà DeepSeek công bố được kiểm chứng trong thực tế, V4.1 Flash có thể trở thành một trong những model đáng chú ý nhất ở nhóm phục vụ công việc hàng ngày.

Về hiệu năng, DeepSeek cho biết V4.1 Flash vượt V4 Pro ở nhiều bài benchmark, trong đó GPQA Diamond đạt 90,9 điểm. Đây là con số rất đẹp, nhưng mình sẽ chưa vội kết luận Flash đã thực sự mạnh hơn Pro. Benchmark của chính nhà sản xuất chỉ nên xem là một chỉ dấu. Điều đáng chờ hơn là trải nghiệm thực tế khi dùng để code, xử lý tài liệu, làm agent hay chạy các tác vụ dài.

Nếu thông tin cộng đồng ghi nhận tốc độ khoảng 300 đến 500 token/giây là chính xác, đây mới là điểm rất đáng chú ý. Một model phản hồi nhanh như vậy sẽ đặc biệt phù hợp với những công việc phải gọi AI liên tục, chẳng hạn coding agent hoặc các workflow tự động hóa. Người dùng không chỉ nhận được câu trả lời nhanh hơn mà còn có thể chạy nhiều bước liên tiếp mà không phải ngồi chờ quá lâu.

DeepSeek cũng đang đánh mạnh vào chi phí vận hành. V4.1 Flash được cho là giảm đáng kể nhu cầu KV cache và dung lượng SSD so với thế hệ trước. Đây là thứ người dùng cuối có thể không nhìn thấy, nhưng lại cực kỳ quan trọng với nhà cung cấp AI. Nếu một model vừa đủ mạnh, vừa chạy nhanh, lại tốn ít tài nguyên hơn, DeepSeek có thêm rất nhiều dư địa để hạ giá API.

Giá mới thực sự là thứ khiến mình chú ý. Theo thông tin được công bố, V4.1 Flash có mức giá rất thấp, nhất là ở thời điểm ngoài giờ cao điểm. Nếu mức giá này giữ được trong thực tế, bài toán cạnh tranh sẽ không còn đơn giản là model nào thông minh hơn. Một model đủ mạnh nhưng rẻ hơn rất nhiều có thể khiến người dùng thay đổi luôn thói quen sử dụng.
1789048450846.png
Tất nhiên V4.1 Flash không phải không có điểm đáng ngại. 552 tỷ tham số là tổng số tham số của một kiến trúc MoE, không thể hiểu đơn giản rằng nó tương đương một model dense 552 tỷ tham số. Tốc độ 300 đến 500 token/giây cũng là kết quả được cộng đồng ghi nhận, không có nghĩa mọi người dùng đều đạt được tốc độ này. Hiệu năng thực tế còn phụ thuộc hạ tầng, độ dài ngữ cảnh, số người dùng cùng lúc và cách nhà cung cấp phân bổ tài nguyên.

Một điểm nữa mình sẽ theo dõi là khả năng xử lý các tác vụ dài. Context lớn nghe rất hấp dẫn, nhưng với agent thì càng nhiều context chưa chắc càng tốt. Nếu model có xu hướng đọc và xử lý quá nhiều dữ liệu không cần thiết, chi phí thực tế của cả workflow vẫn có thể tăng dù giá mỗi token rất rẻ.

Nhìn tổng thể, mình đánh giá V4.1 Flash có một hướng đi khá rõ: không nhất thiết phải trở thành model mạnh nhất tuyệt đối, mà phải trở thành model đủ mạnh để người dùng có thể dùng thoải mái. Nếu hiệu năng thực tế đúng như những gì DeepSeek công bố, Flash có khả năng trở thành “workhorse” của hệ sinh thái DeepSeek, đặc biệt trong coding, agent và các ứng dụng cần gọi model với tần suất cao.

DeepSeek đã bước vào “cuộc chiến của các ông trùm”​

Điều thú vị là cuộc chiến AI bây giờ không chỉ còn là cuộc đua xem ai có model thông minh nhất. Các ông lớn đang tìm mọi cách để giữ người dùng trong hệ sinh thái của mình: người thì tăng quota, người cấp thêm credit, người điều chỉnh hạn mức sử dụng.

DeepSeek chọn một cách khác: làm cho model đủ rẻ để người dùng gần như không cần phải nghĩ đến quota nữa.

Đó mới là thứ mình thấy đáng chú ý ở V4.1 Flash. Nếu một model vừa nhanh, đủ mạnh, lại có giá thấp đến mức người dùng có thể gọi liên tục, thì “vũ khí” của DeepSeek không nằm ở việc cho thêm vài lượt sử dụng. Nó nằm ngay trong bản thân model.

Cui Tianyi có thể đang bước vào “cuộc chiến của các ông trùm” theo cách đó. Không nhất thiết phải thắng bằng một model đắt đỏ nhất. Chỉ cần khiến người dùng thấy dùng DeepSeek là không phải tính toán từng lượt, thế là đủ để kéo họ về phía mình.
 
Back
Top