DeepSeek V4 Flash 正式版跑分、定價與 Agent Harness 決策示意圖

2026 DeepSeek V4 Flash 正式版評測:跑分逼近 Opus 4.8,價格僅對手幾十分之一|決策指南

2026 年 7 月 31 日,DeepSeek 將 V4-Flash 升級為官方正式版(build 0731):284B 總參數、13B 激活參數完全不變,性能提升全部來自重新後訓練,Agent 基準上甚至反超自家更大的 V4-Pro 預覽版,定價僅 Claude Opus 4.8 的幾十分之一。真正的旗艦 V4-Pro 官方版,以及 DeepSeek 首次自研的 Agent 框架 Harness,截至 8 月 5 日仍處「即將發布」狀態。本文梳理 4 月預覽到 7 月正式版的完整時間軸,對照 Kimi K3、GLM-5.2、Qwen3.8-Max 的定價與跑分,並提供 API 接入與 Agent 宿主機的決策框架。

1. 三類決策痛點:跑分、定價與 Harness 的落差

  1. 把 Terminal Bench 82.7 分當成通用 Agent 能力:V4-Flash-0731 公布的 Agent 跑分(Terminal Bench 2.0 82.7,反超 V4-Pro 預覽版 67.9)全部基於 DeepSeek 自研且尚未公開的 Harness「極簡模式」,參數為 max 檔、top_p=0.95、temperature=1.0。官方 changelog 已主動提示「跑分對 harness 選擇非常敏感」——在 Hugging Face 博主與海外開發者論壇複現之前,不宜直接套用到 Claude Code、Cursor 等框架。
  2. 只看 Token 貼紙價、忽略高峰加價與快取命中率:V4-Flash 輸入 $0.14/$0.0028、輸出 $0.28(每百萬 Token)確實遠低於 Kimi K3($3/$15)與 Claude Fable 5,但 DeepSeek 已預告高峰時段 2 倍加價(北京時間 9–12 點、14–18 點),截至發稿未公布生效日期;海外開發者社群亦回報正式版存在輸入快取命中率偏低、安全分類器偶發逾時等可用性問題。
  3. Agent 流水線需要 7×24 宿主機,而非只看 API 單價:V4-Flash 預覽版已在 OpenRouter 連續七週穩坐呼叫量第一,目標用戶是大規模 Agent 與批量任務——若閘道跑在會休眠的筆電、或程式碼庫未透過 SFTP/rsync 同步,再低的 API 定價也會被任務重跑與人工排障吃掉。

2. 時間軸:從 4 月預覽到 7 月正式版

  • 2026 年 4 月 24 日:DeepSeek-V4 預覽版首次發布並開源,包含 V4-Pro(1.6T 總參數/49B 激活)與 V4-Flash(284B 總參數/13B 激活),均支援 100 萬 Token 上下文,採 MIT 協議。
  • 2026 年 7 月 24 日:舊介面模型名 deepseek-chatdeepseek-reasoner 正式停用,全部流量切換至 V4 系列命名。
  • 2026 年 7 月 27 日:月之暗面 Kimi K3(2.8T 總參數)開源權重上線 Hugging Face,為當時體量最大的開源權重發布之一,對 DeepSeek 形成不小競爭壓力。
  • 2026 年 7 月 31 日:DeepSeek-V4-Flash-0731 正式版進入 API 公測,開源權重同步上線 Hugging Face;changelog 首次點名自研 Agent 框架「Harness」,稱即將隨 V4 正式版一起發布。此次公測僅限 API,App 與網頁端尚未同步更新。
  • 截至 2026 年 8 月 5 日(發稿時):V4-Pro 官方版仍是「盡快發布」,無官方確認日期。部分媒體援引未署名消息源稱內部測試已在 7 月 28 日那週啟動,正式 GA 窗口可能在 8 月 10 日至 20 日之間——此時間點目前未經 DeepSeek 官方證實,僅供參考

3. 核心數據一覽:定價、參數與授權

模型 狀態 總參數/激活參數 上下文 輸入(快取未命中/命中,每百萬 Token) 輸出(每百萬 Token) 協議
DeepSeek-V4-Flash-0731 官方正式版(2026-07-31) 284B/13B 1M $0.14/$0.0028 $0.28 MIT
DeepSeek-V4-Pro 預覽版(官方版未發布) 1.6T/49B 1M $0.435/$0.003625 $0.87 MIT
Kimi K3(月之暗面) 權重開源(2026-07-27) 2.8T/約 104B(社群估算) ~1.05M $3.00/$0.30 $15.00 Kimi K3 License
GLM-5.2(智譜/Z.ai) 開源(2026 年 6 月) ~744B/~40B 1M 本文未核實 本文未核實 MIT
Qwen3.8-Max(阿里) API 可用(2026-08-02),權重待釋出 2.4T/95B 1M $2.00/~$0.17–0.25 $6.00 承諾開源,權重尚未釋出

以上定價均為 DeepSeek、Moonshot、阿里等官方公開資料,屬「廠商自報」資訊。DeepSeek 已預告未來將對 API 啟用「高峰時段 2 倍加價」(北京時間 9–12 點、14–18 點),截至發稿未公布具體生效日期。

4. 深度拆解:後訓練、混合注意力與 Harness

架構不變,變的是後訓練

V4-Flash-0731 在參數規模、模型結構上與 4 月預覽版完全相同,DeepSeek 官方明確說明性能提升「完全來自重新進行的後訓練」,而非擴大模型規模。284B 總參數、13B 激活的 Flash 版本,在多項 Agent 基準上反而超過參數量是自己數倍的 V4-Pro 預覽版——2026 年下半年大模型競爭中,後訓練資料品質與方法的重要性正逼近甚至超過單純堆參數。

混合注意力:CSA+HCA、mHC、Muon 優化器

依 DeepSeek 技術報告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》,V4 系列在架構上做了三處關鍵改動:

  1. 混合注意力架構:結合壓縮稀疏注意力(CSA)與高度壓縮注意力(HCA),對外統稱「DSA 稀疏注意力」,核心目的是在長上下文場景降低計算與記憶體開銷;
  2. 流形約束超連接(mHC):對傳統殘差連接結構做改進;
  3. Muon 優化器:替換傳統優化器,提升訓練收斂速度與穩定性。

三項改動疊加的效果:在 100 萬 Token 上下文下,V4-Pro 相比前代 V3.2,單 Token 推理所需 FLOPs 僅 27%,KV Cache 占用僅 10%(DeepSeek 官方技術指標,尚未見獨立第三方複現驗證)。若基本屬實,意味「百萬級上下文」第一次有可能以接近主流上下文長度的成本大規模商用。

自研 Agent 框架 Harness 首次亮相

7 月 31 日 changelog 首次正式出現「DeepSeek Harness」——DeepSeek 自研的 Agent 執行框架,用於讓模型讀寫檔案、呼叫工具、執行命令、完成端到端工程任務,對標 Claude Code。在此之前,DeepSeek 模型主要依賴 Claude Code、OpenCode 等第三方 Agent 工具。官方公開的 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)全部是用 Harness 的「極簡模式」測出,DeepSeek 亦主動提示跑分對框架選擇高度敏感。

5. 橫向對比:國產開源大模型六邊形混戰

模型 實驗室 發布/權重開放 總參數 Intelligence Index(Artificial Analysis) 單任務平均成本(Artificial Analysis)
DeepSeek-V4-Flash-0731 DeepSeek 2026-07-31(正式版) 284B 50 $0.03
Kimi K3 月之暗面 07-16 預覽/07-27 權重 2.8T 57 $0.86
GLM-5.2 智譜/Z.ai 2026 年 6 月 ~744B 比 V4-Flash 高約 1 分 本文未核實
Qwen3.8-Max 阿里 2026-08-02 GA(權重待釋出) 2.4T 本文未核實 本文未核實
GPT-5.6 Sol OpenAI 閉源 未公開 比 V4-Flash 高 9 分以上 $1.86
Claude Fable 5 Anthropic 閉源 未公開 比 V4-Flash 高 9 分以上 $3.15

Intelligence Index 與單任務成本引自 Artificial Analysis(第三方獨立評測),經財經媒體轉引;DeepSeek 官方 Agent 跑分為廠商自報,兩組數據評測方法與權重不完全一致,本文分開列出。一個值得留意的反差:在 Artificial Analysis 上,V4-Flash 的智慧分並非最高,甚至落後 Kimi K3 與 GLM-5.2;但單任務成本僅 Kimi K3 的約 1/29、GPT-5.6 Sol 的約 1/62、Claude Fable 5 的約 1/105。DeepSeek 打的不是「跑分第一」,而是「夠用的智能 + 極致價格」——這也是 V4-Flash 預覽版能在 OpenRouter 連續七週穩坐呼叫量第一的原因。

依 21 世紀經濟報導援引的公開定價,V4-Flash 正式版較 Claude Opus 4.8 約便宜 36 倍(快取未命中輸入)、179 倍(快取命中輸入)、89 倍(輸出),均為每百萬 Token 的廠商牌價,非獨立審計結果。

6. 爭議點:跑分水分、可用性與未證實傳聞

  • 跑分方法依賴 Harness,官方自己都在提醒別只看數字:在獨立社群複現之前,Terminal Bench 2.0 等數字應視為「廠商自報+特定框架」結果,不宜直接橫向套用到其他 Agent 框架。
  • 海外開發者回報具體可用性問題:據 21 世紀經濟報導援引海外開發者社群,正式版存在輸入快取命中率偏低、安全分類器偶發逾時等問題,反映算力與參數儲備仍是限制模型能力上限的現實瓶頸。
  • V4-Pro 官方版與 Harness 上線時間未經證實:多家中文媒體報導「8 月 10–20 日 GA」等窗口均為未署名消息源,DeepSeek 官方 changelog 原話只是「將盡快發布」,讀者應以此為準。
  • 融資與 IPO 傳聞需謹慎對待:多家媒體報導 DeepSeek 近期完成約 74 億美元(約人民幣 500 億元)融資、估值約 487 億美元,以及籌備新一輪約 710 億美元估值融資與 IPO。這些資訊主要來自「據報導」「消息人士稱」,尚無 DeepSeek 官方或監管備案直接確認,本文僅作背景資訊呈現。

7. 產業背景:「梁白開」到「梁聖」與「斬殺線」

V4 正式版發布前,因 Pro 版本遲遲未兌現「7 月中旬全量上線」預期,中文 AI 社群一度把 DeepSeek 創辦人梁文鋒戲稱為「梁白開」(諧音「白等」「放空炮」)。V4-Flash-0731 上線後因實際表現超出預期,網友又把「梁聖」稱號還了回去——這種戲謔式暱稱反轉,是觀察中國 AI 社群情緒風向的有趣側面。

更值得關注的是中文開發者社群流傳的「斬殺線」說法:DeepSeek 以「夠用的性能 + 極端低價」組合,給同行設下一道門檻——友商模型若性能未明顯超過 DeepSeek,又拿不出更低價格,便可能在市場上失去存在感。這也解釋近期 GPT-5.6 Luna 低價版一次性降價 80% 等密集定價調整。一位 AI 創業孵化業內人士對 21 世紀經濟報導的評價頗為形象:「所有大模型公司都在梁文鋒前面奔跑,不管用什麼方式,都必須跑到 DeepSeek 前面才能生存。」

從更大產業背景看,V4-Flash 正式版上線當天(7 月 31 日),輝達、博通、AMD 等算力晶片股並未出現明顯波動——市場似乎已習慣「DeepSeek 式效率突破」敘事,不再簡單把「用更少算力做到同等效果」等同「利空算力股」。這與 2025 年初 DeepSeek-R1 發布時引發全球 AI 晶片股集體下跌形成鮮明對比。

8. 五步實操:V4-Flash-0731 接入與評估清單

  1. 完成舊模型名稱遷移:7 月 24 日起 deepseek-chatdeepseek-reasoner 已停用;若使用 OpenAI ChatCompletions 或 Anthropic 格式 API,將 model 設為 deepseek-v4-flash 即可自動指向 0731 正式版,無需改程式碼結構。
  2. 核實定價與高峰加價政策:記錄輸入 $0.14(快取未命中)/$0.0028(命中)、輸出 $0.28;在 Agent 流水線中啟用快取策略,並預留高峰 2 倍加價緩衝(生效日期待官方公告)。
  3. 區分廠商自報與第三方跑分:SWE-bench Verified 等廣泛採用的第三方基準可信度較高;Terminal Bench 2.0 等 Agent 分數待 Harness 公開後再對照 Claude Code、Cursor 獨立複現。
  4. 配置 Kimi K3/Qwen3.8-Max 多模型回退:在 OpenClaw 或閘道層設定分層路由——V4-Flash 負責高頻批量與程式碼性價比;Kimi K3 負責更高 Intelligence Index 場景;Qwen3.8-Max 負責多模態旗艦任務。監控「每任務實際花費」而非只看 Token 貼紙價。
  5. 將 Agent 宿主機部署至 7×24 遠端 Mac:Harness 與 Claude Code 類工具需穩定長連與充足伺服器記憶體;透過 SFTP/rsync 同步程式碼庫,在 Apple Silicon 遠端 Mac 上跑 OpenClaw 閘道,避免筆電休眠中斷 Agent 迴圈。詳見站內《Kimi K3 全面開放權重》與《Qwen3.8-Max GA 決策指南》。

9. Agent 宿主機決策矩陣

方案 適合場景 主要限制 V4-Flash Agent 推薦度
個人筆電 + Cursor 輕量單次補全、短對話 休眠中斷 Agent 迴圈、難以 7×24 跑批量任務 ⚠️ 不適合高頻 V4-Flash Agent 工作流
通用雲端 Linux 虛擬機 純 API 呼叫、無 GUI 腳本 無原生 Cursor/macOS 生態、Claude Code 鏈路受限 ⚠️ 適合 API 側,不適合 macOS Agent 工具鏈
SFTPMAC 遠端 Apple Silicon Mac Claude Code、OpenClaw 閘道、V4-Flash 高頻 Agent、SFTP/rsync 團隊同步 需規劃方案與頻寬 ✅ 跑 V4-Flash Agent 工作流的最優底座

10. 常見問題

Q1:DeepSeek V4 和 V3.2 最大的差別是什麼?
A:原生支援 100 萬 Token 上下文,且長上下文場景下計算與記憶體開銷大幅降低(V4-Pro 在百萬 Token 下 FLOPs 僅 V3.2 的 27%,KV Cache 僅 10%)。V4 系列另針對 Agent 能力做專項優化,適配 Claude Code、OpenCode 等主流 Agent 工具。

Q2:日常應該選 V4 Flash 還是 V4 Pro?
A:若為普通對話、簡單任務或需大規模低成本呼叫,V4-Flash-0731 官方版性價比更高,且 Agent 跑分已反超 V4-Pro 預覽版。若任務涉及更深世界知識或複雜推理且預算不敏感,可先用 V4-Pro 預覽版,待官方版上線後再評估。

Q3:現在能用上 V4 Pro 官方版嗎?
A:截至 2026 年 8 月 5 日尚不能。目前正式版僅 V4-Flash-0731,且僅限 API 呼叫,App 與網頁端仍為舊版。V4-Pro 官方版與 Harness 官方口徑為「盡快發布」,網傳 8 月 10–20 日等時間未經證實。

Q4:DeepSeek 公布的跑分能直接相信嗎?
A:建議區分對待。SWE-bench Verified 等第三方基準可信度較高;Terminal Bench 2.0 等 Agent 跑分用 DeepSeek 自研且未公開的 Harness 測得,官方亦提示對框架選擇高度敏感,建議等社群以 Claude Code、Cursor 等獨立複現後再下結論。

Q5:這次更新對一般開發者有什麼實際影響?
A:若已用 OpenAI 或 Anthropic 格式 API 接入 DeepSeek,無需改程式碼,deepseek-v4-flash 會自動指向新正式版。若仍使用已停用的 deepseek-chatdeepseek-reasoner,須盡快切換新命名。

資料來源:DeepSeek 官方 API 文件與更新日誌(api-docs.deepseek.com)、DeepSeek-V4 技術報告及 Hugging Face 模型卡(deepseek-ai/DeepSeek-V4-Pro、DeepSeek-V4-Flash)、Artificial Analysis 第三方評測(經旺得富理財網、Meyka 等轉引)、21 世紀經濟報導《DeepSeek 又發重磅更新 行業夢回 2025 年春天》、快科技(鳳凰網科技轉載)《DeepSeek V4 正式版有多強》、V2EX 社群討論、36 氪歐洲版、HTX Insights、Moonshot AI(Kimi K3)、智譜/Z.ai(GLM-5.2)、阿里雲(Qwen3.8-Max)官方發布資訊。發布前請務必核實最新定價、跑分及 V4-Pro/Harness 上線狀態;本文所有數據截至 2026 年 8 月 5 日。

11. 總結:夠用的智能 + 極致價格,Agent 底座才是決勝關

DeepSeek V4-Flash-0731 的核心故事是:284B 參數不變、後訓練重跑換來 Agent 跑分反超 V4-Pro 預覽版,定價僅 Claude Opus 4.8 幾十分之一,但 Harness 尚未公開、V4-Pro 官方版仍待發布。它不在 Artificial Analysis 上爭「智慧分第一」,而是用 $0.03/任務的成本鎖定大規模 Agent 與批量場景——這也是預覽版能在 OpenRouter 連續七週穩坐呼叫量第一的原因。

對台港開發者與 Agent 團隊而言,更務實的路徑是:先把 V4-Flash API 與 Kimi K3/Qwen3.8-Max 做分層路由跑通,監控「每任務實際花費」;筆電與通用 Linux 伺服器在長程自主任務上反而容易暴露「省 API 費、丟 Agent 迴圈」的隱性成本——休眠中斷、程式碼庫不同步導致重跑,都會吃掉低價 API 紅利。快取命中率偏低與高峰加價政策亦提醒:定價優勢需搭配穩定宿主機與合理路由策略才能轉化為生產收益。

若你計劃在 V4-Flash 正式版窗口期大規模跑 Agent 工作流或並行驗證多模型回退路由,建議將 Claude Code、OpenClaw 閘道與團隊程式碼庫統一部署在持續在線的 Apple Silicon 遠端 Mac上,透過 SFTP/rsync 保持倉庫一致、確保頻寬穩定。SFTPMAC 遠端 Mac 租賃提供面向 AI Agent 的 macOS 環境:原生 Cursor 相容、低延遲 API 回呼、7×24 不中斷、充足伺服器記憶體承載 Harness 級工具鏈——比「個人裝置兼 Agent 宿主機」更適合在 2026 年這場國產大模型價格戰中,把 V4-Flash 的 API 紅利真正轉化為生產收益。