2026 DeepSeek V4 Flash 正式版評測:跑分逼近 Opus 4.8,價格僅對手幾十分之一|決策指南
2026 年 7 月 31 日,DeepSeek 將 V4-Flash 升級為官方正式版(build 0731):284B 總參數、13B 激活參數完全不變,性能提升全部來自重新後訓練,Agent 基準上甚至反超自家更大的 V4-Pro 預覽版,定價僅 Claude Opus 4.8 的幾十分之一。真正的旗艦 V4-Pro 官方版,以及 DeepSeek 首次自研的 Agent 框架 Harness,截至 8 月 5 日仍處「即將發布」狀態。本文梳理 4 月預覽到 7 月正式版的完整時間軸,對照 Kimi K3、GLM-5.2、Qwen3.8-Max 的定價與跑分,並提供 API 接入與 Agent 宿主機的決策框架。
1. 三類決策痛點:跑分、定價與 Harness 的落差
- 把 Terminal Bench 82.7 分當成通用 Agent 能力:V4-Flash-0731 公布的 Agent 跑分(Terminal Bench 2.0 82.7,反超 V4-Pro 預覽版 67.9)全部基於 DeepSeek 自研且尚未公開的 Harness「極簡模式」,參數為 max 檔、top_p=0.95、temperature=1.0。官方 changelog 已主動提示「跑分對 harness 選擇非常敏感」——在 Hugging Face 博主與海外開發者論壇複現之前,不宜直接套用到 Claude Code、Cursor 等框架。
- 只看 Token 貼紙價、忽略高峰加價與快取命中率:V4-Flash 輸入 $0.14/$0.0028、輸出 $0.28(每百萬 Token)確實遠低於 Kimi K3($3/$15)與 Claude Fable 5,但 DeepSeek 已預告高峰時段 2 倍加價(北京時間 9–12 點、14–18 點),截至發稿未公布生效日期;海外開發者社群亦回報正式版存在輸入快取命中率偏低、安全分類器偶發逾時等可用性問題。
- Agent 流水線需要 7×24 宿主機,而非只看 API 單價:V4-Flash 預覽版已在 OpenRouter 連續七週穩坐呼叫量第一,目標用戶是大規模 Agent 與批量任務——若閘道跑在會休眠的筆電、或程式碼庫未透過 SFTP/rsync 同步,再低的 API 定價也會被任務重跑與人工排障吃掉。
2. 時間軸:從 4 月預覽到 7 月正式版
- 2026 年 4 月 24 日:DeepSeek-V4 預覽版首次發布並開源,包含 V4-Pro(1.6T 總參數/49B 激活)與 V4-Flash(284B 總參數/13B 激活),均支援 100 萬 Token 上下文,採 MIT 協議。
- 2026 年 7 月 24 日:舊介面模型名
deepseek-chat與deepseek-reasoner正式停用,全部流量切換至 V4 系列命名。 - 2026 年 7 月 27 日:月之暗面 Kimi K3(2.8T 總參數)開源權重上線 Hugging Face,為當時體量最大的開源權重發布之一,對 DeepSeek 形成不小競爭壓力。
- 2026 年 7 月 31 日:DeepSeek-V4-Flash-0731 正式版進入 API 公測,開源權重同步上線 Hugging Face;changelog 首次點名自研 Agent 框架「Harness」,稱即將隨 V4 正式版一起發布。此次公測僅限 API,App 與網頁端尚未同步更新。
- 截至 2026 年 8 月 5 日(發稿時):V4-Pro 官方版仍是「盡快發布」,無官方確認日期。部分媒體援引未署名消息源稱內部測試已在 7 月 28 日那週啟動,正式 GA 窗口可能在 8 月 10 日至 20 日之間——此時間點目前未經 DeepSeek 官方證實,僅供參考。
3. 核心數據一覽:定價、參數與授權
| 模型 | 狀態 | 總參數/激活參數 | 上下文 | 輸入(快取未命中/命中,每百萬 Token) | 輸出(每百萬 Token) | 協議 |
|---|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | 官方正式版(2026-07-31) | 284B/13B | 1M | $0.14/$0.0028 | $0.28 | MIT |
| DeepSeek-V4-Pro | 預覽版(官方版未發布) | 1.6T/49B | 1M | $0.435/$0.003625 | $0.87 | MIT |
| Kimi K3(月之暗面) | 權重開源(2026-07-27) | 2.8T/約 104B(社群估算) | ~1.05M | $3.00/$0.30 | $15.00 | Kimi K3 License |
| GLM-5.2(智譜/Z.ai) | 開源(2026 年 6 月) | ~744B/~40B | 1M | 本文未核實 | 本文未核實 | MIT |
| Qwen3.8-Max(阿里) | API 可用(2026-08-02),權重待釋出 | 2.4T/95B | 1M | $2.00/~$0.17–0.25 | $6.00 | 承諾開源,權重尚未釋出 |
以上定價均為 DeepSeek、Moonshot、阿里等官方公開資料,屬「廠商自報」資訊。DeepSeek 已預告未來將對 API 啟用「高峰時段 2 倍加價」(北京時間 9–12 點、14–18 點),截至發稿未公布具體生效日期。
4. 深度拆解:後訓練、混合注意力與 Harness
架構不變,變的是後訓練
V4-Flash-0731 在參數規模、模型結構上與 4 月預覽版完全相同,DeepSeek 官方明確說明性能提升「完全來自重新進行的後訓練」,而非擴大模型規模。284B 總參數、13B 激活的 Flash 版本,在多項 Agent 基準上反而超過參數量是自己數倍的 V4-Pro 預覽版——2026 年下半年大模型競爭中,後訓練資料品質與方法的重要性正逼近甚至超過單純堆參數。
混合注意力:CSA+HCA、mHC、Muon 優化器
依 DeepSeek 技術報告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》,V4 系列在架構上做了三處關鍵改動:
- 混合注意力架構:結合壓縮稀疏注意力(CSA)與高度壓縮注意力(HCA),對外統稱「DSA 稀疏注意力」,核心目的是在長上下文場景降低計算與記憶體開銷;
- 流形約束超連接(mHC):對傳統殘差連接結構做改進;
- Muon 優化器:替換傳統優化器,提升訓練收斂速度與穩定性。
三項改動疊加的效果:在 100 萬 Token 上下文下,V4-Pro 相比前代 V3.2,單 Token 推理所需 FLOPs 僅 27%,KV Cache 占用僅 10%(DeepSeek 官方技術指標,尚未見獨立第三方複現驗證)。若基本屬實,意味「百萬級上下文」第一次有可能以接近主流上下文長度的成本大規模商用。
自研 Agent 框架 Harness 首次亮相
7 月 31 日 changelog 首次正式出現「DeepSeek Harness」——DeepSeek 自研的 Agent 執行框架,用於讓模型讀寫檔案、呼叫工具、執行命令、完成端到端工程任務,對標 Claude Code。在此之前,DeepSeek 模型主要依賴 Claude Code、OpenCode 等第三方 Agent 工具。官方公開的 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)全部是用 Harness 的「極簡模式」測出,DeepSeek 亦主動提示跑分對框架選擇高度敏感。
5. 橫向對比:國產開源大模型六邊形混戰
| 模型 | 實驗室 | 發布/權重開放 | 總參數 | Intelligence Index(Artificial Analysis) | 單任務平均成本(Artificial Analysis) |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | DeepSeek | 2026-07-31(正式版) | 284B | 50 | $0.03 |
| Kimi K3 | 月之暗面 | 07-16 預覽/07-27 權重 | 2.8T | 57 | $0.86 |
| GLM-5.2 | 智譜/Z.ai | 2026 年 6 月 | ~744B | 比 V4-Flash 高約 1 分 | 本文未核實 |
| Qwen3.8-Max | 阿里 | 2026-08-02 GA(權重待釋出) | 2.4T | 本文未核實 | 本文未核實 |
| GPT-5.6 Sol | OpenAI | 閉源 | 未公開 | 比 V4-Flash 高 9 分以上 | $1.86 |
| Claude Fable 5 | Anthropic | 閉源 | 未公開 | 比 V4-Flash 高 9 分以上 | $3.15 |
Intelligence Index 與單任務成本引自 Artificial Analysis(第三方獨立評測),經財經媒體轉引;DeepSeek 官方 Agent 跑分為廠商自報,兩組數據評測方法與權重不完全一致,本文分開列出。一個值得留意的反差:在 Artificial Analysis 上,V4-Flash 的智慧分並非最高,甚至落後 Kimi K3 與 GLM-5.2;但單任務成本僅 Kimi K3 的約 1/29、GPT-5.6 Sol 的約 1/62、Claude Fable 5 的約 1/105。DeepSeek 打的不是「跑分第一」,而是「夠用的智能 + 極致價格」——這也是 V4-Flash 預覽版能在 OpenRouter 連續七週穩坐呼叫量第一的原因。
依 21 世紀經濟報導援引的公開定價,V4-Flash 正式版較 Claude Opus 4.8 約便宜 36 倍(快取未命中輸入)、179 倍(快取命中輸入)、89 倍(輸出),均為每百萬 Token 的廠商牌價,非獨立審計結果。
6. 爭議點:跑分水分、可用性與未證實傳聞
- 跑分方法依賴 Harness,官方自己都在提醒別只看數字:在獨立社群複現之前,Terminal Bench 2.0 等數字應視為「廠商自報+特定框架」結果,不宜直接橫向套用到其他 Agent 框架。
- 海外開發者回報具體可用性問題:據 21 世紀經濟報導援引海外開發者社群,正式版存在輸入快取命中率偏低、安全分類器偶發逾時等問題,反映算力與參數儲備仍是限制模型能力上限的現實瓶頸。
- V4-Pro 官方版與 Harness 上線時間未經證實:多家中文媒體報導「8 月 10–20 日 GA」等窗口均為未署名消息源,DeepSeek 官方 changelog 原話只是「將盡快發布」,讀者應以此為準。
- 融資與 IPO 傳聞需謹慎對待:多家媒體報導 DeepSeek 近期完成約 74 億美元(約人民幣 500 億元)融資、估值約 487 億美元,以及籌備新一輪約 710 億美元估值融資與 IPO。這些資訊主要來自「據報導」「消息人士稱」,尚無 DeepSeek 官方或監管備案直接確認,本文僅作背景資訊呈現。
7. 產業背景:「梁白開」到「梁聖」與「斬殺線」
V4 正式版發布前,因 Pro 版本遲遲未兌現「7 月中旬全量上線」預期,中文 AI 社群一度把 DeepSeek 創辦人梁文鋒戲稱為「梁白開」(諧音「白等」「放空炮」)。V4-Flash-0731 上線後因實際表現超出預期,網友又把「梁聖」稱號還了回去——這種戲謔式暱稱反轉,是觀察中國 AI 社群情緒風向的有趣側面。
更值得關注的是中文開發者社群流傳的「斬殺線」說法:DeepSeek 以「夠用的性能 + 極端低價」組合,給同行設下一道門檻——友商模型若性能未明顯超過 DeepSeek,又拿不出更低價格,便可能在市場上失去存在感。這也解釋近期 GPT-5.6 Luna 低價版一次性降價 80% 等密集定價調整。一位 AI 創業孵化業內人士對 21 世紀經濟報導的評價頗為形象:「所有大模型公司都在梁文鋒前面奔跑,不管用什麼方式,都必須跑到 DeepSeek 前面才能生存。」
從更大產業背景看,V4-Flash 正式版上線當天(7 月 31 日),輝達、博通、AMD 等算力晶片股並未出現明顯波動——市場似乎已習慣「DeepSeek 式效率突破」敘事,不再簡單把「用更少算力做到同等效果」等同「利空算力股」。這與 2025 年初 DeepSeek-R1 發布時引發全球 AI 晶片股集體下跌形成鮮明對比。
8. 五步實操:V4-Flash-0731 接入與評估清單
- 完成舊模型名稱遷移:7 月 24 日起
deepseek-chat/deepseek-reasoner已停用;若使用 OpenAI ChatCompletions 或 Anthropic 格式 API,將 model 設為deepseek-v4-flash即可自動指向 0731 正式版,無需改程式碼結構。 - 核實定價與高峰加價政策:記錄輸入 $0.14(快取未命中)/$0.0028(命中)、輸出 $0.28;在 Agent 流水線中啟用快取策略,並預留高峰 2 倍加價緩衝(生效日期待官方公告)。
- 區分廠商自報與第三方跑分:SWE-bench Verified 等廣泛採用的第三方基準可信度較高;Terminal Bench 2.0 等 Agent 分數待 Harness 公開後再對照 Claude Code、Cursor 獨立複現。
- 配置 Kimi K3/Qwen3.8-Max 多模型回退:在 OpenClaw 或閘道層設定分層路由——V4-Flash 負責高頻批量與程式碼性價比;Kimi K3 負責更高 Intelligence Index 場景;Qwen3.8-Max 負責多模態旗艦任務。監控「每任務實際花費」而非只看 Token 貼紙價。
- 將 Agent 宿主機部署至 7×24 遠端 Mac:Harness 與 Claude Code 類工具需穩定長連與充足伺服器記憶體;透過 SFTP/rsync 同步程式碼庫,在 Apple Silicon 遠端 Mac 上跑 OpenClaw 閘道,避免筆電休眠中斷 Agent 迴圈。詳見站內《Kimi K3 全面開放權重》與《Qwen3.8-Max GA 決策指南》。
9. Agent 宿主機決策矩陣
| 方案 | 適合場景 | 主要限制 | V4-Flash Agent 推薦度 |
|---|---|---|---|
| 個人筆電 + Cursor | 輕量單次補全、短對話 | 休眠中斷 Agent 迴圈、難以 7×24 跑批量任務 | ⚠️ 不適合高頻 V4-Flash Agent 工作流 |
| 通用雲端 Linux 虛擬機 | 純 API 呼叫、無 GUI 腳本 | 無原生 Cursor/macOS 生態、Claude Code 鏈路受限 | ⚠️ 適合 API 側,不適合 macOS Agent 工具鏈 |
| SFTPMAC 遠端 Apple Silicon Mac | Claude Code、OpenClaw 閘道、V4-Flash 高頻 Agent、SFTP/rsync 團隊同步 | 需規劃方案與頻寬 | ✅ 跑 V4-Flash Agent 工作流的最優底座 |
10. 常見問題
Q1:DeepSeek V4 和 V3.2 最大的差別是什麼?
A:原生支援 100 萬 Token 上下文,且長上下文場景下計算與記憶體開銷大幅降低(V4-Pro 在百萬 Token 下 FLOPs 僅 V3.2 的 27%,KV Cache 僅 10%)。V4 系列另針對 Agent 能力做專項優化,適配 Claude Code、OpenCode 等主流 Agent 工具。
Q2:日常應該選 V4 Flash 還是 V4 Pro?
A:若為普通對話、簡單任務或需大規模低成本呼叫,V4-Flash-0731 官方版性價比更高,且 Agent 跑分已反超 V4-Pro 預覽版。若任務涉及更深世界知識或複雜推理且預算不敏感,可先用 V4-Pro 預覽版,待官方版上線後再評估。
Q3:現在能用上 V4 Pro 官方版嗎?
A:截至 2026 年 8 月 5 日尚不能。目前正式版僅 V4-Flash-0731,且僅限 API 呼叫,App 與網頁端仍為舊版。V4-Pro 官方版與 Harness 官方口徑為「盡快發布」,網傳 8 月 10–20 日等時間未經證實。
Q4:DeepSeek 公布的跑分能直接相信嗎?
A:建議區分對待。SWE-bench Verified 等第三方基準可信度較高;Terminal Bench 2.0 等 Agent 跑分用 DeepSeek 自研且未公開的 Harness 測得,官方亦提示對框架選擇高度敏感,建議等社群以 Claude Code、Cursor 等獨立複現後再下結論。
Q5:這次更新對一般開發者有什麼實際影響?
A:若已用 OpenAI 或 Anthropic 格式 API 接入 DeepSeek,無需改程式碼,deepseek-v4-flash 會自動指向新正式版。若仍使用已停用的 deepseek-chat/deepseek-reasoner,須盡快切換新命名。
資料來源:DeepSeek 官方 API 文件與更新日誌(api-docs.deepseek.com)、DeepSeek-V4 技術報告及 Hugging Face 模型卡(deepseek-ai/DeepSeek-V4-Pro、DeepSeek-V4-Flash)、Artificial Analysis 第三方評測(經旺得富理財網、Meyka 等轉引)、21 世紀經濟報導《DeepSeek 又發重磅更新 行業夢回 2025 年春天》、快科技(鳳凰網科技轉載)《DeepSeek V4 正式版有多強》、V2EX 社群討論、36 氪歐洲版、HTX Insights、Moonshot AI(Kimi K3)、智譜/Z.ai(GLM-5.2)、阿里雲(Qwen3.8-Max)官方發布資訊。發布前請務必核實最新定價、跑分及 V4-Pro/Harness 上線狀態;本文所有數據截至 2026 年 8 月 5 日。
11. 總結:夠用的智能 + 極致價格,Agent 底座才是決勝關
DeepSeek V4-Flash-0731 的核心故事是:284B 參數不變、後訓練重跑換來 Agent 跑分反超 V4-Pro 預覽版,定價僅 Claude Opus 4.8 幾十分之一,但 Harness 尚未公開、V4-Pro 官方版仍待發布。它不在 Artificial Analysis 上爭「智慧分第一」,而是用 $0.03/任務的成本鎖定大規模 Agent 與批量場景——這也是預覽版能在 OpenRouter 連續七週穩坐呼叫量第一的原因。
對台港開發者與 Agent 團隊而言,更務實的路徑是:先把 V4-Flash API 與 Kimi K3/Qwen3.8-Max 做分層路由跑通,監控「每任務實際花費」;筆電與通用 Linux 伺服器在長程自主任務上反而容易暴露「省 API 費、丟 Agent 迴圈」的隱性成本——休眠中斷、程式碼庫不同步導致重跑,都會吃掉低價 API 紅利。快取命中率偏低與高峰加價政策亦提醒:定價優勢需搭配穩定宿主機與合理路由策略才能轉化為生產收益。
若你計劃在 V4-Flash 正式版窗口期大規模跑 Agent 工作流或並行驗證多模型回退路由,建議將 Claude Code、OpenClaw 閘道與團隊程式碼庫統一部署在持續在線的 Apple Silicon 遠端 Mac上,透過 SFTP/rsync 保持倉庫一致、確保頻寬穩定。SFTPMAC 遠端 Mac 租賃提供面向 AI Agent 的 macOS 環境:原生 Cursor 相容、低延遲 API 回呼、7×24 不中斷、充足伺服器記憶體承載 Harness 級工具鏈——比「個人裝置兼 Agent 宿主機」更適合在 2026 年這場國產大模型價格戰中,把 V4-Flash 的 API 紅利真正轉化為生產收益。