Rẻ hơn 100 lần, DeepSeek đẩy Claude vào thế khó

Mr. Darcy
Mr. Darcy
Phản hồi: 0

Mr. Darcy

Editor
Thành viên BQT
Sáng nay giới công nghệ Trung Quốc xôn xao vì một con số: rẻ hơn 100 lần. Đó là mức chênh lệch chi phí giữa mô hình AI mới của DeepSeek và Claude của Anthropic, hai đối thủ đang chạy đua ở tuyến đầu ngành AI.

DeepSeek vừa khởi động vòng gọi vốn thứ hai, dự kiến huy động 500 tỷ nhân dân tệ, định giá trước gọi vốn khoảng 5 nghìn tỷ nhân dân tệ. Chỉ hai tháng trước, công ty này vừa hoàn tất vòng gọi vốn đầu tiên cùng số tiền, với định giá sau gọi vốn hơn 3,5 nghìn tỷ nhân dân tệ. Sau hai vòng, tổng số tiền huy động được sẽ vượt 1 nghìn tỷ nhân dân tệ.

Điều khiến giới đầu tư tự tin đến vậy nằm ở kết quả kiểm thử thực tế. Artificial Analysis, đơn vị chuyên đánh giá mô hình AI, đã chạy cùng một bộ bài kiểm tra trên nhiều mô hình để so sánh chi phí trung bình cho mỗi tác vụ. Kết quả cho thấy DeepSeek V4-Flash chỉ tốn khoảng 3 xu cho mỗi tác vụ. Trong khi đó, mô hình chủ lực Claude Fable 5 của Anthropic tốn trung bình 3,15 đô la Mỹ, tương đương khoảng 82.000 đồng, còn GPT-5.6 Sol tốn 1,86 đô la, khoảng 48.000 đồng. Nói cách khác, DeepSeek rẻ hơn Claude tới 100 lần.
1785921665361.png
Không chỉ rẻ, DeepSeek còn nhanh hơn. Tốc độ xử lý của V4-Flash đạt khoảng 113 token mỗi giây, trong khi Claude Opus 5 chỉ đạt khoảng 74 token mỗi giây. Nghĩa là khi DeepSeek hoàn thành xong bài kiểm tra, Claude mới đi được nửa chặng đường.

Dĩ nhiên cái gì cũng có giá của nó. Để đạt tốc độ và chi phí thấp như vậy, DeepSeek phải đánh đổi một phần độ thông minh. V4-Flash đạt 50 điểm trên thang đo trí tuệ, ngang Gemini 3.6 Flash của Google, và thấp hơn khoảng 10 điểm so với các mô hình hàng đầu như Claude Opus 5 (61 điểm) hay Fable 5 (60 điểm). Tóm lại, rẻ hơn 100 lần, nhanh hơn khoảng 1,5 lần, nhưng hiệu năng chỉ thấp hơn chưa đến 20%.

Vì sao DeepSeek làm được điều này. Mô hình V4-Flash có tổng cộng 284 tỷ tham số nhưng mỗi lần xử lý chỉ kích hoạt 13 tỷ tham số, chưa đến 5% tổng số. Ngoài ra, mô hình còn dùng cơ chế chú ý mới, kết hợp hai mô-đun CSA và HCA, hoạt động theo nguyên tắc giống trí nhớ con người: chuyện gần đây thì nhớ rõ, chuyện xa hơn thì chỉ còn ấn tượng mờ nhạt. Nhờ vậy, với ngữ cảnh 1 triệu token, lượng tính toán trên mỗi token của V4-Flash chỉ bằng 10% so với phiên bản trước, giúp tiết kiệm đáng kể tài nguyên.

Bên cạnh kiến trúc, DeepSeek còn cải tiến ở khâu huấn luyện, dùng hai bước: đầu tiên đào tạo chuyên sâu cho từng lĩnh vực như toán học, lập trình, sau đó hợp nhất khả năng của các chuyên gia vào một mô hình duy nhất mà không làm mô hình quên kiến thức cũ. Kết quả là điểm số ở nhiều bài kiểm tra tăng mạnh, có bài tăng tới 645% so với phiên bản trước.

Với doanh nghiệp, khoảng cách chi phí này không còn là chuyện nhỏ. Nếu xử lý 1 triệu lượt gọi API mỗi ngày, dùng Claude sẽ tốn khoảng 31.500 đô la, tương đương hơn 800 triệu đồng mỗi ngày. Dùng DeepSeek chỉ tốn khoảng 300 đô la, gần 8 triệu đồng. Tính theo năm, chênh lệch lên tới 11,3 triệu đô la, tương đương gần 300 tỷ đồng.

Chính vì vậy xu hướng mới trong ngành không còn là chọn một mô hình duy nhất, mà là phân việc cho đúng mô hình. Việc phức tạp, giá trị cao thì giao cho các mô hình mạnh như Claude Opus 5 hay GPT-5.6. Việc lặp lại, rủi ro thấp như phân loại dữ liệu, sàng lọc mã nguồn thì giao cho DeepSeek. Theo khảo sát của Menlo Ventures, 37% doanh nghiệp hiện dùng hơn 5 mô hình cùng lúc. Một nghiên cứu công bố tại hội nghị ICLR 2025 cũng cho thấy cách phân việc thông minh có thể giảm chi phí tới 85% mà vẫn giữ được 95% chất lượng so với dùng riêng một mô hình mạnh.

Nhìn vào biểu đồ so sánh chi phí và độ thông minh của các mô hình AI hiện nay, gần 70% mô hình trên thế giới đang rơi vào vùng bị xem là kém hiệu quả so với DeepSeek. Ngay cả những mô hình có độ suy luận thấp hơn cũng khó thoát khỏi so sánh này.

Câu chuyện DeepSeek cho thấy một điều đơn giản: giá rẻ trên giấy tờ không có ý nghĩa nếu không quy đổi ra chi phí thực tế để hoàn thành một công việc. Và trong cuộc đua AI, ai tính đúng bài toán chi phí, người đó mới thực sự thắng.
 
Back
Top