DeepSeek V4 Pro 正式版評測出爐:只贏 Flash 1 分,貴 3 倍
2026-08-13農曆七月ㄧ日鬼門開的深夜,Hermes突然給我發來提示,DeepSeek V4 Pro 正式版悄悄上線(模型版本 DeepSeek-V4-Pro-0813)。
今天早上,Artificial Analysis(以下簡稱 AA,業界最常看的第三方評測機構)的數據出來了。
一句話結論:Pro 正式版沒有官方說的那麼強。AA 測出來 53 分,只比 Flash 的 52 分多 1 分,但價格貴 3 倍。
一、AA 數據:Pro 只贏 Flash 1 分
AA 的 Intelligence Index(綜合 9 項基準,涵蓋推理、知識、數學、程式)最新排名:
Claude Opus 5 (max):63 分,價格 $5/$25
Claude Fable 5 (max):62 分
Grok 4.6 (high):61 分(#6/183),價格 $2/$6
GPT-5.6 Sol (max):61 分,價格 $5/$30
Kimi K3:60 分級
DeepSeek V4 Pro 0813 (max):53 分(#23/605),價格約 $0.42/$0.84(¥3/¥6)
DeepSeek V4 Flash 0731 (max):52 分(#4/104),價格 $0.14/$0.28
兩個重點:
第一,Pro 跟 Flash 的差距,只有 1 分。
DeepSeek 官方發布的 benchmark 表說 Pro 贏 Flash 很多(Terminal Bench 87.9 vs 82.7、DeepSWE 62.7 vs 54.4)—— 但 AA 獨立測出來,綜合 intelligence 兩者幾乎一樣。
第二,而 Pro 貴 3 倍。
Flash 輸入 ¥1/百萬、輸出 ¥2/百萬;Pro 輸入 ¥3、輸出 ¥6。Flash 還快得多——輸出速度 127.9 tokens/秒,比 Grok 4.6 的 85.8 快一半。
二、為什麼官方跟第三方差這麼多?
兩個原因。
第一個:官方數據還沒被獨立驗證。
DeepSeek 的 GA benchmark 數據最初是透過 WeChat 群流出的,截至今天仍未被 AA 等獨立機構驗證。
官方當然會挑對自己有利的數據——等第三方正式跑完再下結論比較穩。
第二個:Pro 是「偏科生」。它強在 agentic(代理)任務:Terminal Bench 87.9、CyberGym 83.3、DeepSWE 62.7,這些都是「長時間跑代理任務」的分數。
但純知識推理(HLE,無工具)它輸 Claude Opus 5 約 12 分。
AA 的 53 分是九項加權——知識項拖後腿,agentic 項拉分。
還有一個很多人沒注意的:Pro 是純文字模型,不支援圖像輸入。
Flash 反而有。
三、那 Pro 到底值不值?
看你用在哪。
先說我的失望。Pro 是 DeepSeek 的旗艦(1.6T 總參數、49B 激活),Flash 只是輕量版(284B/13B)——本來期待這次正式版能完全第一名,跟 Grok、Fable 同級。
結果 AA 測出來:Pro 53 分,只贏 Flash 1 分,價格卻貴 3 倍。
這不是 Pro 變弱,是 Flash 太強... 0731 重訓後,Flash 以 $0.14/$0.28 的價格做到 52 分,等於把 Pro 的生存空間整個吃掉。
「旗艦應該輾壓輕量版」的期待,落空了。
對 Agent 任務(寫程式、跑工具、長時間任務)—— Pro 有它的價值。
官方報的 Terminal Bench 87.9,跟 GPT-5.6 Sol 的 89.5、Claude Opus 5 的 89.1 只差 1.6 分,但價格是它們的 1/12 到 1/30。
在「要做困難的 agent 任務但不想付閉源旗艦價」的場景,Pro 是合理的。
對大量、高頻、成本敏感的任務——Flash 完勝。只差 1 分、快 50%、便宜 3 倍、還支援圖像。
我的 StockGPT 分析、題庫管線全部跑 Flash,沒有換的理由。
業界分析(Deva)給的配置建議,跟我的用法一樣:Flash 當 worker(高量、便宜、隨便跑),Pro 當 main(長程思考、困難任務)。
四、順便聊聊 Grok 4.6
同一天(8/12),xAI 也發布了 Grok 4.6。
AA 評測 61 分——追平 GPT-5.6 Sol,只落後 Claude Fable 5 一分,把 DeepSeek 全家族甩開 8 分。
更猛的是價格:$2/$6 每百萬 token,比 Claude Opus 5($5/$25)和 GPT-5.6 Sol($5/$30)便宜 60% 以上。
AA 說它每任務成本 $0.84,落在「性價比 Pareto 前沿」上。
還有 Grok Bot——SpaceXAI 跟 Cursor 合作推出的「AI 同事」:每個 Bot 有自己雲端電腦(VM、瀏覽器、檔案、終端),關機也繼續跑;能登入你的各種 app 實際操作;多個 Bot 平行協作。
這已經不只是模型,是「AI 團隊成員」的商業化。
五、結論
這一波模型發布,最值得記住的不是誰最強,而是:
1. 模型強不強,跟值不值是兩回事。Pro 貴 3 倍只贏 1 分,Flash 才是性價比之王。
2. 官方數據要等第三方驗證。廠商發布會挑對自己有利的數字,AA 這種獨立評測才是準的。
3. Grok 4.6 是今年最值得注意的黑馬。61 分、便宜、agent 超強——追平 GPT-5.6 不是靠吹的。
我在我的 AI 競技場(arena.wow.to)讓四大模型用虛擬資金對賭台股美股,一個月實測下來,最賺的不是最強的模型,是便宜又穩的那個(Gemini Flash 美股 +10.4% 第一名)。
模型強不強是廠商的事,賺不賺錢是你的事。
數據來源:Artificial Analysis(artificialanalysis.ai)2026-08-13、DeepSeek 官方公告、xAI 官方公告、Deva 分析(Substack)
౨ৎ Anthony 不負責任編輯 ~

留言 (0)