DeepSeek-V4-Pro-0813 lên general availability ngày 13/8, và mức chênh benchmark từ preview lên GA thực sự lớn: DeepSWE nhảy từ 12,8 lên 62,7, CyberGym từ 52,7 lên 83,3, Terminal-Bench 2.1 từ 72,1 lên 87,9. Trên Artificial Analysis Intelligence Index, model này giờ đạt 53, so với 63 của Claude Opus 5 và 62 của Fable 5 — thu hẹp một khoảng cách trông rộng hơn nhiều chỉ vài tháng trước.
Đó là tiêu đề mà mọi người đang viết. Câu chuyện tôi nghĩ thực sự quan trọng với bất kỳ ai đang dùng DeepSeek trong stack của mình lại nằm sâu hơn trong thông báo: giá API tăng tới 12 lần cùng với bản release này.
Vì sao điều này quan trọng hơn bảng benchmark
Nếu bạn từng xây bất kỳ phần nào trong cost model dựa trên danh tiếng giá rẻ gần sát chi phí của DeepSeek — câu chuyện “race to zero” đã định hình thị trường API open-weight suốt gần hai năm qua — thì mô hình đó vừa gãy. Không phải gãy từ từ. Mức tăng 12 lần không phải một điều chỉnh giá thông thường; đó là một sự kiện định giá lại, và nó cho bạn biết điều gì đó về việc DeepSeek giờ nghĩ họ có thể cạnh tranh ở đâu: bằng năng lực, không chỉ bằng việc là lựa chọn rẻ nhất.
Điều này đáng để dừng lại suy nghĩ, vì nó thay đổi phép tính cho một quyết định mà nhiều team đã đưa ra mà không xem xét kỹ: “dùng DeepSeek vì nó rẻ và đủ tốt” là một default hợp lý suốt nhiều tháng. Nó không còn tự động đúng ngay khi khoảng cách giá thu hẹp lại. Bạn phải chạy lại phép so sánh, không phải giả định các con số cũ vẫn còn đúng.
Một cost model bạn nên thực sự chạy trong tuần này
Nếu DeepSeek nằm trong routing layer hoặc logic chọn model của agent bạn, đừng tin lời tôi về độ lớn của con số — hãy lấy giá hiện tại và tính toán trên chính traffic mix thực tế của bạn:
# so sánh chi phí hàng tháng ước tính — thay bằng số token thực tế theo model của bạn
models = {
"deepseek-v4-pro-0813": {"input_per_1m": 2.80, "output_per_1m": 11.20}, # sau khi tăng giá, cần verify lại
"claude-sonnet-5": {"input_per_1m": 3.00, "output_per_1m": 15.00},
"gemini-3.7-flash": {"input_per_1m": 0.75, "output_per_1m": 3.75},
}
monthly_input_tokens = 400_000_000 # lấy từ log thực tế của bạn
monthly_output_tokens = 120_000_000
for name, price in models.items():
cost = (monthly_input_tokens / 1_000_000) * price["input_per_1m"] \
+ (monthly_output_tokens / 1_000_000) * price["output_per_1m"]
print(f"{name}: ${cost:,.2f}/mo")
Các con số trên chỉ mang tính minh họa — hãy lấy trang giá DeepSeek hiện tại trước khi hành động dựa vào bài này, vì điểm mấu chốt không phải con số USD cụ thể, mà là khoảng cách giữa “open model giá rẻ” và “closed model gần frontier” đã thu hẹp đủ nhiều để bạn cần chạy lại phép so sánh này, thay vì tin vào kết luận bạn đưa ra sáu tháng trước.
Pattern đằng sau đợt tăng giá
Tôi không nghĩ đây là DeepSeek đang cơ hội chủ nghĩa, mà đúng hơn là kinh tế học của DeepSeek đang bắt kịp những tuyên bố về năng lực. Phục vụ một model đạt 62,7 điểm DeepSWE và 87,9 điểm Terminal-Bench 2.1 tốn compute nhiều hơn đáng kể so với phục vụ bản preview đạt 12,8 và 72,1 trên cùng benchmark — hiệu năng agentic tốt hơn thường đồng nghĩa với chuỗi reasoning dài hơn, nhiều lượt tool-call hơn, hoặc sử dụng context hiệu quả lớn hơn mỗi request, tất cả đều thể hiện trực tiếp trên hóa đơn inference bất kể ai đang host model. Một đợt tăng giá đi cùng một bước nhảy năng lực thực sự là câu chuyện khác hẳn so với tăng giá trên một model tĩnh không đổi, và đây có vẻ là trường hợp đầu.
Dù vậy, “đợt tăng giá có cơ sở kinh tế hợp lý” và “bạn nên tiếp tục lập ngân sách cho DeepSeek theo mức giá cũ” là hai khẳng định khác nhau, và chỉ một trong hai là đúng. Hãy lập kế hoạch theo mức giá mới, không phải theo danh tiếng cũ.
Điều tôi thực sự sẽ làm
- Chạy lại so sánh model ngay bây giờ, không phải quý sau. Bất kỳ cost model nào xây trên giá cũ của DeepSeek đã lỗi thời kể từ 13/8. Nếu DeepSeek là default cho các workload nhạy cảm về chi phí của bạn, hãy verify xem nó có còn thắng phép so sánh đó ở mức giá hiện tại không — có thể nó không còn thắng với mọi workload nữa.
- Tách workload “rẻ” khỏi workload “cần năng lực cao” trong logic routing. Nếu bạn từng dùng DeepSeek làm default cho mọi thứ, đây là dịp tốt để thực sự phân tầng việc chọn model: route các lệnh gọi khối lượng lớn, độ phức tạp thấp tới bất cứ thứ gì đang rẻ nhất hiện nay (Gemini 3.7 Flash là ứng viên mạnh với 0,75$/3,75$ mỗi 1M token), và dành DeepSeek hoặc một model frontier cho những lệnh gọi mà bước nhảy năng lực thực sự đáng giá.
- Đừng giả định open-weight nghĩa là mãi mãi rẻ. DeepSeek vẫn là open-weight — bạn có thể tự host V4-Pro nếu giá API không còn phù hợp với bài toán kinh tế của bạn — nhưng tự host một model với các con số benchmark này cũng có chi phí GPU không hề nhỏ. Hãy chạy phép so sánh đó trước khi giả định tự host là câu trả lời mặc định.
Tín hiệu lớn hơn
Các nhà cung cấp model open-weight đã dành hai năm qua cạnh tranh chủ yếu bằng giá, dùng chi phí API làm đòn bẩy chống lại các closed lab frontier. Một đợt tăng giá 12 lần từ một trong những đối thủ cạnh tranh giá quyết liệt nhất trong nhóm này, đúng lúc đi cùng một bước nhảy năng lực thực sự, cho thấy đòn bẩy đó đang thu hẹp — các nhà cung cấp bắt đầu định giá gần hơn với giá trị thực của năng lực thay vì đua nhau xuống đáy. Nếu hạ tầng hay chiến lược chi phí của bạn giả định “giá API open model chỉ có giảm,” đây là dữ liệu điểm bạn nên dùng để stress-test giả định đó trước khi nó khiến bạn bất ngờ với ngân sách.
Nguồn: DeepSeek-V4-Pro-0813 trên Hugging Face, Benchmark chính thức khi release