Phạm Thanh Bình✔
Writer
Vào tối ngày 12 tháng 8, DeepSeekDeepSeek-V4-Pro-0813 đã được phát hành một cách âm thầm thông qua bản cập nhật tài liệu API; đây là phiên bản V4 Pro chính thức mà cộng đồng mạng đã chờ đợi gần bốn tháng nay.
Trong khi giá của các mẫu sản phẩm chủ lực ở nước ngoài vẫn ở mức hàng chục đô la cho mỗi triệu token, công ty Trung Quốc này đang đưa các Agent của mình, những sản phẩm đang tiến gần đến phân khúc cao cấp, vào thị trường.Khả năng này được thể hiện bằng mức giá 3 nhân dân tệ cho mỗi triệu token đầu vào và 6 nhân dân tệ cho mỗi triệu token đầu ra, xấp xỉ 1/57 so với Claude Fable 5.
Đây không phải là một phiên bản cải tiến thông thường. Phiên bản cuối cùng V4 Pro không thay đổi kiến trúc mô hình hay kích thước tham số; nó chỉ trải qua quá trình huấn luyện lại .Sau đó, nó đã cho thấy một bước tiến đáng kể trong một số bài kiểm tra hiệu năng so với phiên bản xem trước: DeepSWEĐiểm số đã tăng gần gấp bốn lần, và điểm số của Terminal Bench 2.1 chỉ còn kém Fable 5 0,1 điểm.
Từ phiên bản chính thức V4-Flash đang làm mưa làm gió trên thị trường nhà phát triển với khẩu hiệu "đầu vào 1 nhân dân tệ, đầu ra 2 nhân dân tệ", đến phiên bản chính thức V4 Pro mang hiệu năng cao cấp vào phân khúc giá một chữ số, DeepSeek đang viết lại chuẩn mực giá cả cho các sản phẩm trí tuệ nhân tạo tiên tiến.
Ngay trước khi phát hành, tài liệu API chính thức đã thông báo rằng giá sẽ tăng trên diện rộng trong thời gian tới, với "mức tăng đáng kể dự kiến" - cuộc chiến giành quyền định giá này chỉ mới bắt đầu.
Dựa trên các thông số kỹ thuật kiến trúc được công bố, V4 Pro là một chuyên gia về thiết bị lai.Mô hình (MoE) có tổng cộng khoảng 1,5 nghìn tỷ đến 1,6 nghìn tỷ tham số (con số này có thể khác nhau tùy cách diễn giải; SemiAnalysis cho biết là 1,5 nghìn tỷ, trong khi con số chính thức trước đây là 1,6 nghìn tỷ), kích hoạt khoảng 49 tỷ tham số cho mỗi lần suy luận. Mô hình V4 Flash có tổng cộng khoảng 284 tỷ tham số, kích hoạt khoảng 13 tỷ tham số cho mỗi lần suy luận. Cả hai đều cung cấp ngữ cảnh 1 triệu token và đầu ra tối đa là 384.000 token.
Thay đổi quan trọng nhất trong phiên bản chính thức này không phải là kích thước mà là hiệu năng được cải thiện. Với cùng trọng số, khả năng của tác nhân đã có một bước nhảy vọt về chất lượng chỉ đơn giản thông qua các lần lặp lại chính sách sau huấn luyện.
Trong số đó, DeepSWE tăng vọt từ 12,8 điểm lên 62,7 điểm, tăng gần gấp 4 lần; Terminal Bench tăng từ 2,1 lên 87,9 điểm, chỉ kém Fable 5 0,1 điểm và vượt qua Opus 4,8; CyberGym đạt được kết quả ngược lại. Trong cả bảy bài kiểm tra, Pro đều vượt trội hơn Flash, với sự khác biệt rõ rệt về hiệu năng.
Về giá cả, theo tài liệu API chính thức của DeepSeek, tính đến ngày 13 tháng 8, phiên bản chính thức V4 Pro vẫn giữ nguyên giá của phiên bản xem trước, tức là gấp ba lần so với Flash.
Về mặt chuyển đổi, giá trị mỗi lần truy cập thành công vào bộ nhớ cache gần như tương đương nhau đối với cả hai, sự khác biệt tập trung ở số lần truy cập thất bại vào bộ nhớ cache đối với đầu vào và đầu ra, cả hai đều cao gấp 3 lần so với Flash; giới hạn về khả năng xử lý đồng thời thì ngược lại, với phiên bản Pro chỉ bằng một phần năm so với Flash, cho thấy các doanh nghiệp có nhu cầu xử lý đồng thời cao vẫn có thể ưu tiên Flash.
Ngoài ra, phiên bản chính thức V4 Pro đã hoàn thiện các khả năng giao diện. Nó bổ sung hỗ trợ cho API Phản hồi và thích ứng với Codex, đồng thời tương thích với cả định dạng API của OpenAI và Anthropic, giúp giảm chi phí chuyển đổi khi di chuyển từ hệ sinh thái Claude.
Một bước đột phá khác là điện toán đa phương thức. Theo một báo cáo của GeekPark vào ngày 13 tháng 8, phiên bản xem trước là một mô hình thuần túy dựa trên văn bản, trong khi phiên bản chính thức lần đầu tiên hỗ trợ suy luận hình ảnh một cách tự nhiên. Công cụ DeepThink có thể phân tích hình ảnh, diễn giải ảnh chụp màn hình và xử lý các tài liệu hỗn hợp văn bản và hình ảnh trong cùng một quy trình tư duy — một bước đột phá từ con số không lên một đối với các kịch bản tác nhân yêu cầu "thực hiện các tác vụ từ hình ảnh".
Tuy nhiên, tính đến thời điểm bài viết này được đăng tải, tài liệu API chính thức của DeepSeek vẫn chưa liệt kê hướng dẫn về cách gọi hàm nhập hình ảnh, và lịch trình triển khai đầy đủ tính năng này vẫn chưa được xác nhận.
Nói cách khác, DeepSeek đã đạt được sự phân khúc thị trường với hai dòng sản phẩm: Flash, với giá chỉ bằng khoảng một phần ba và giới hạn xử lý đồng thời gấp 5 lần, đảm nhận các tác vụ khối lượng lớn, trong khi Pro đẩy giới hạn hiệu năng của các agent trong nước lên hàng đầu.
Xét về sự chênh lệch giá, giá thành của V4 Pro xấp xỉ 0,87 đô la Mỹ/triệu token, trong khi giá thành của Claude Fable 5 là 50 đô la Mỹ/triệu token, nghĩa là giá của V4 Pro chỉ bằng khoảng 1/57 so với Claude Fable 5.
Phản hồi tích cực từ thị trường cũng tập trung vào tính hiệu quả về chi phí. Công ty nghiên cứu bên thứ ba SemiAnalysis khẳng định rằng nó vượt trội hơn hẳn Nvidia trong các tác vụ của tác nhân thông minh.Nemotron3 Ultra; các bài đánh giá từ giới truyền thông công nghệ sau khi thử nghiệm cho rằng nó "rất gần với Fable 5"; các báo cáo nghiên cứu từ các công ty chứng khoán như Shenwan Hongyuan, Guolian Securities và Minsheng Securities cũng chỉ ra rằng tính hiệu quả về chi phí của nó mang lại lợi ích cho chuỗi ngành ứng dụng AI.
Bên cạnh những lời khen ngợi, cũng có rất nhiều nghi ngờ, và những nghi ngờ này đã phản ánh chính xác những kỳ vọng tiếp theo của thị trường.
Một số người dùng API đã báo cáo rằng hiệu năng của phiên bản chính thức V4 Pro của CoT (CoT) không đạt kỳ vọng.
Các bài kiểm tra của GeekPark cho thấy rằng trong các tác vụ tạo mã phức tạp, các token suy luận ở chế độ tư duy có thể chiếm hơn 80% hạn mức đầu ra, làm thu hẹp không gian mã chính và gây ra hiện tượng cắt ngắn mã. Các nhà phát triển cần chủ động tắt chế độ tư duy hoặc tăng giới hạn đầu ra. Các điểm chuẩn hiện đang được lưu hành đến từ các kênh chính thức và từ công cụ Harness tự phát triển chưa được phát hành.Việc thử nghiệm môi trường đã được tiến hành, nhưng việc tái tạo bởi bên thứ ba vẫn cần thời gian, và kiến thức thuần túy cùng các thử nghiệm kỹ thuật phức tạp như HLE và NL2Repo vẫn còn tụt hậu so với Opus 4.8 và Fable 5.
Hơn nữa, do sức mạnh tính toán suy luận không đủ, API chính thức gần đây đã gặp phải nhiều vấn đề về hiệu suất, và giới hạn 500 kết nối đồng thời của phiên bản Pro không thân thiện với các doanh nghiệp có nhu cầu xử lý đồng thời cao. Trong khi đó, thông báo tăng giá chính thức vẫn chưa được giải quyết. Mức giá hiện tại là 3 nhân dân tệ/triệu token cho phiên bản trả phí và 6 nhân dân tệ/triệu token cho phiên bản trả phí dường như chỉ là "mức giá thấp tạm thời".
Tuy nhiên, những nghi ngờ đó không làm lung lay đánh giá cơ bản của thị trường về phiên bản chính thức của V4 Pro. Giới hạn trên về khả năng của mẫu máy này đã được xác nhận; câu hỏi còn lại là khi nào sẽ lấp đầy những khoảng trống.
Sự chú trọng của thị trường hiện đã chuyển sang ba vấn đề.
Một trong số đó là Harness. Phóng viên được biết DeepSeek gần đây đang tích cực xây dựng đội ngũ Harness (khung thời gian chạy cho tác nhân thông minh), do Cui Tianyi đứng đầu, và đang tích cực tuyển dụng. Tài khoản WeChat chính thức của "Đội ngũ DeepSeek Harness" đã được đăng ký.
DeepSeek có một công thức nội bộ: Mô hình + Hệ thống điều khiển = Tác nhân. Mô hình là động cơ, còn hệ thống điều khiển là vô lăng, hộp số và phanh. Không có hệ thống điều khiển, mô hình chỉ là một API thô sơ. Với hệ thống điều khiển, mô hình trở thành một sản phẩm thực sự có chức năng.

Sự khác biệt về trải nghiệm người dùng giữa Claude Code và Codex chưa bao giờ chỉ được quyết định bởi mô hình nền tảng. Do đó, thời điểm Harness ra mắt được xem là bước đi lớn tiếp theo của DeepSeek.
Thứ hai, có vấn đề về tốc độ phát hành đa phương thức. Việc hoàn thiện khả năng xử lý hình ảnh cho phép phiên bản V4 Pro chính thức tiến bước đầu tiên từ văn bản thuần túy sang khả năng đa phương thức, nhưng tài liệu chính thức và báo cáo kỹ thuật chưa xác nhận khả năng này, và lịch trình phát hành đầy đủ vẫn chưa rõ ràng. Hơn nữa, các khả năng đa phương thức hoàn chỉnh hơn, chẳng hạn như video, có thể vẫn phải chờ đến các phiên bản tiếp theo. Vì các đối thủ cạnh tranh như Opus và GPT đã tích hợp khả năng xử lý hình ảnh như một tính năng tiêu chuẩn, tốc độ triển khai này đặc biệt quan trọng.
Thứ ba, đó là vấn đề về chiến lược định giá và nguồn cung cấp sức mạnh tính toán. DeepSeek đã triển khai mô hình định giá theo giờ cao điểm và thấp điểm, và quy mô cũng như tốc độ của đợt tăng giá tổng thể mới sẽ trực tiếp kiểm chứng hiệu quả của luận điểm về tính tiết kiệm chi phí của họ. Trong khi đó, lịch trình sản xuất hàng loạt và ra mắt siêu máy tính Ascend 950 của Huawei sẽ quyết định liệu nguồn cung cấp sức mạnh suy luận cho các mô hình chuyên nghiệp có đáp ứng được nhu cầu hay không.
Đối với ngành công nghiệp, ý nghĩa của phiên bản V4 Pro chính thức nằm ở chỗ mức giá tham khảo cho các tính năng tiên tiến đã được hạ xuống một lần nữa. Khi hiệu năng gần bằng với phân khúc cao cấp nhất được cung cấp với mức giá chỉ bằng một phần trăm, các mẫu máy tầm trung sẽ là những sản phẩm đầu tiên chịu áp lực.
Trong khi giá của các mẫu sản phẩm chủ lực ở nước ngoài vẫn ở mức hàng chục đô la cho mỗi triệu token, công ty Trung Quốc này đang đưa các Agent của mình, những sản phẩm đang tiến gần đến phân khúc cao cấp, vào thị trường.Khả năng này được thể hiện bằng mức giá 3 nhân dân tệ cho mỗi triệu token đầu vào và 6 nhân dân tệ cho mỗi triệu token đầu ra, xấp xỉ 1/57 so với Claude Fable 5.
Đây không phải là một phiên bản cải tiến thông thường. Phiên bản cuối cùng V4 Pro không thay đổi kiến trúc mô hình hay kích thước tham số; nó chỉ trải qua quá trình huấn luyện lại .Sau đó, nó đã cho thấy một bước tiến đáng kể trong một số bài kiểm tra hiệu năng so với phiên bản xem trước: DeepSWEĐiểm số đã tăng gần gấp bốn lần, và điểm số của Terminal Bench 2.1 chỉ còn kém Fable 5 0,1 điểm.
Từ phiên bản chính thức V4-Flash đang làm mưa làm gió trên thị trường nhà phát triển với khẩu hiệu "đầu vào 1 nhân dân tệ, đầu ra 2 nhân dân tệ", đến phiên bản chính thức V4 Pro mang hiệu năng cao cấp vào phân khúc giá một chữ số, DeepSeek đang viết lại chuẩn mực giá cả cho các sản phẩm trí tuệ nhân tạo tiên tiến.
Ngay trước khi phát hành, tài liệu API chính thức đã thông báo rằng giá sẽ tăng trên diện rộng trong thời gian tới, với "mức tăng đáng kể dự kiến" - cuộc chiến giành quyền định giá này chỉ mới bắt đầu.
Dựa trên các thông số kỹ thuật kiến trúc được công bố, V4 Pro là một chuyên gia về thiết bị lai.Mô hình (MoE) có tổng cộng khoảng 1,5 nghìn tỷ đến 1,6 nghìn tỷ tham số (con số này có thể khác nhau tùy cách diễn giải; SemiAnalysis cho biết là 1,5 nghìn tỷ, trong khi con số chính thức trước đây là 1,6 nghìn tỷ), kích hoạt khoảng 49 tỷ tham số cho mỗi lần suy luận. Mô hình V4 Flash có tổng cộng khoảng 284 tỷ tham số, kích hoạt khoảng 13 tỷ tham số cho mỗi lần suy luận. Cả hai đều cung cấp ngữ cảnh 1 triệu token và đầu ra tối đa là 384.000 token.
Thay đổi quan trọng nhất trong phiên bản chính thức này không phải là kích thước mà là hiệu năng được cải thiện. Với cùng trọng số, khả năng của tác nhân đã có một bước nhảy vọt về chất lượng chỉ đơn giản thông qua các lần lặp lại chính sách sau huấn luyện.
Trong số đó, DeepSWE tăng vọt từ 12,8 điểm lên 62,7 điểm, tăng gần gấp 4 lần; Terminal Bench tăng từ 2,1 lên 87,9 điểm, chỉ kém Fable 5 0,1 điểm và vượt qua Opus 4,8; CyberGym đạt được kết quả ngược lại. Trong cả bảy bài kiểm tra, Pro đều vượt trội hơn Flash, với sự khác biệt rõ rệt về hiệu năng.
Về giá cả, theo tài liệu API chính thức của DeepSeek, tính đến ngày 13 tháng 8, phiên bản chính thức V4 Pro vẫn giữ nguyên giá của phiên bản xem trước, tức là gấp ba lần so với Flash.
Về mặt chuyển đổi, giá trị mỗi lần truy cập thành công vào bộ nhớ cache gần như tương đương nhau đối với cả hai, sự khác biệt tập trung ở số lần truy cập thất bại vào bộ nhớ cache đối với đầu vào và đầu ra, cả hai đều cao gấp 3 lần so với Flash; giới hạn về khả năng xử lý đồng thời thì ngược lại, với phiên bản Pro chỉ bằng một phần năm so với Flash, cho thấy các doanh nghiệp có nhu cầu xử lý đồng thời cao vẫn có thể ưu tiên Flash.
Ngoài ra, phiên bản chính thức V4 Pro đã hoàn thiện các khả năng giao diện. Nó bổ sung hỗ trợ cho API Phản hồi và thích ứng với Codex, đồng thời tương thích với cả định dạng API của OpenAI và Anthropic, giúp giảm chi phí chuyển đổi khi di chuyển từ hệ sinh thái Claude.
Một bước đột phá khác là điện toán đa phương thức. Theo một báo cáo của GeekPark vào ngày 13 tháng 8, phiên bản xem trước là một mô hình thuần túy dựa trên văn bản, trong khi phiên bản chính thức lần đầu tiên hỗ trợ suy luận hình ảnh một cách tự nhiên. Công cụ DeepThink có thể phân tích hình ảnh, diễn giải ảnh chụp màn hình và xử lý các tài liệu hỗn hợp văn bản và hình ảnh trong cùng một quy trình tư duy — một bước đột phá từ con số không lên một đối với các kịch bản tác nhân yêu cầu "thực hiện các tác vụ từ hình ảnh".
Tuy nhiên, tính đến thời điểm bài viết này được đăng tải, tài liệu API chính thức của DeepSeek vẫn chưa liệt kê hướng dẫn về cách gọi hàm nhập hình ảnh, và lịch trình triển khai đầy đủ tính năng này vẫn chưa được xác nhận.
Nói cách khác, DeepSeek đã đạt được sự phân khúc thị trường với hai dòng sản phẩm: Flash, với giá chỉ bằng khoảng một phần ba và giới hạn xử lý đồng thời gấp 5 lần, đảm nhận các tác vụ khối lượng lớn, trong khi Pro đẩy giới hạn hiệu năng của các agent trong nước lên hàng đầu.
Xét về sự chênh lệch giá, giá thành của V4 Pro xấp xỉ 0,87 đô la Mỹ/triệu token, trong khi giá thành của Claude Fable 5 là 50 đô la Mỹ/triệu token, nghĩa là giá của V4 Pro chỉ bằng khoảng 1/57 so với Claude Fable 5.
Phản hồi tích cực từ thị trường cũng tập trung vào tính hiệu quả về chi phí. Công ty nghiên cứu bên thứ ba SemiAnalysis khẳng định rằng nó vượt trội hơn hẳn Nvidia trong các tác vụ của tác nhân thông minh.Nemotron3 Ultra; các bài đánh giá từ giới truyền thông công nghệ sau khi thử nghiệm cho rằng nó "rất gần với Fable 5"; các báo cáo nghiên cứu từ các công ty chứng khoán như Shenwan Hongyuan, Guolian Securities và Minsheng Securities cũng chỉ ra rằng tính hiệu quả về chi phí của nó mang lại lợi ích cho chuỗi ngành ứng dụng AI.
Bên cạnh những lời khen ngợi, cũng có rất nhiều nghi ngờ, và những nghi ngờ này đã phản ánh chính xác những kỳ vọng tiếp theo của thị trường.
Một số người dùng API đã báo cáo rằng hiệu năng của phiên bản chính thức V4 Pro của CoT (CoT) không đạt kỳ vọng.
Các bài kiểm tra của GeekPark cho thấy rằng trong các tác vụ tạo mã phức tạp, các token suy luận ở chế độ tư duy có thể chiếm hơn 80% hạn mức đầu ra, làm thu hẹp không gian mã chính và gây ra hiện tượng cắt ngắn mã. Các nhà phát triển cần chủ động tắt chế độ tư duy hoặc tăng giới hạn đầu ra. Các điểm chuẩn hiện đang được lưu hành đến từ các kênh chính thức và từ công cụ Harness tự phát triển chưa được phát hành.Việc thử nghiệm môi trường đã được tiến hành, nhưng việc tái tạo bởi bên thứ ba vẫn cần thời gian, và kiến thức thuần túy cùng các thử nghiệm kỹ thuật phức tạp như HLE và NL2Repo vẫn còn tụt hậu so với Opus 4.8 và Fable 5.
Hơn nữa, do sức mạnh tính toán suy luận không đủ, API chính thức gần đây đã gặp phải nhiều vấn đề về hiệu suất, và giới hạn 500 kết nối đồng thời của phiên bản Pro không thân thiện với các doanh nghiệp có nhu cầu xử lý đồng thời cao. Trong khi đó, thông báo tăng giá chính thức vẫn chưa được giải quyết. Mức giá hiện tại là 3 nhân dân tệ/triệu token cho phiên bản trả phí và 6 nhân dân tệ/triệu token cho phiên bản trả phí dường như chỉ là "mức giá thấp tạm thời".
Tuy nhiên, những nghi ngờ đó không làm lung lay đánh giá cơ bản của thị trường về phiên bản chính thức của V4 Pro. Giới hạn trên về khả năng của mẫu máy này đã được xác nhận; câu hỏi còn lại là khi nào sẽ lấp đầy những khoảng trống.
Sự chú trọng của thị trường hiện đã chuyển sang ba vấn đề.
Một trong số đó là Harness. Phóng viên được biết DeepSeek gần đây đang tích cực xây dựng đội ngũ Harness (khung thời gian chạy cho tác nhân thông minh), do Cui Tianyi đứng đầu, và đang tích cực tuyển dụng. Tài khoản WeChat chính thức của "Đội ngũ DeepSeek Harness" đã được đăng ký.
DeepSeek có một công thức nội bộ: Mô hình + Hệ thống điều khiển = Tác nhân. Mô hình là động cơ, còn hệ thống điều khiển là vô lăng, hộp số và phanh. Không có hệ thống điều khiển, mô hình chỉ là một API thô sơ. Với hệ thống điều khiển, mô hình trở thành một sản phẩm thực sự có chức năng.

Sự khác biệt về trải nghiệm người dùng giữa Claude Code và Codex chưa bao giờ chỉ được quyết định bởi mô hình nền tảng. Do đó, thời điểm Harness ra mắt được xem là bước đi lớn tiếp theo của DeepSeek.
Thứ hai, có vấn đề về tốc độ phát hành đa phương thức. Việc hoàn thiện khả năng xử lý hình ảnh cho phép phiên bản V4 Pro chính thức tiến bước đầu tiên từ văn bản thuần túy sang khả năng đa phương thức, nhưng tài liệu chính thức và báo cáo kỹ thuật chưa xác nhận khả năng này, và lịch trình phát hành đầy đủ vẫn chưa rõ ràng. Hơn nữa, các khả năng đa phương thức hoàn chỉnh hơn, chẳng hạn như video, có thể vẫn phải chờ đến các phiên bản tiếp theo. Vì các đối thủ cạnh tranh như Opus và GPT đã tích hợp khả năng xử lý hình ảnh như một tính năng tiêu chuẩn, tốc độ triển khai này đặc biệt quan trọng.
Thứ ba, đó là vấn đề về chiến lược định giá và nguồn cung cấp sức mạnh tính toán. DeepSeek đã triển khai mô hình định giá theo giờ cao điểm và thấp điểm, và quy mô cũng như tốc độ của đợt tăng giá tổng thể mới sẽ trực tiếp kiểm chứng hiệu quả của luận điểm về tính tiết kiệm chi phí của họ. Trong khi đó, lịch trình sản xuất hàng loạt và ra mắt siêu máy tính Ascend 950 của Huawei sẽ quyết định liệu nguồn cung cấp sức mạnh suy luận cho các mô hình chuyên nghiệp có đáp ứng được nhu cầu hay không.
Đối với ngành công nghiệp, ý nghĩa của phiên bản V4 Pro chính thức nằm ở chỗ mức giá tham khảo cho các tính năng tiên tiến đã được hạ xuống một lần nữa. Khi hiệu năng gần bằng với phân khúc cao cấp nhất được cung cấp với mức giá chỉ bằng một phần trăm, các mẫu máy tầm trung sẽ là những sản phẩm đầu tiên chịu áp lực.