DeepSeek V4 Flash 正式版:284B MoE 架構と Agent ベンチマーク比較の概念図

2026年 DeepSeek V4 Flash 正式版:Agent ベンチが Opus 4.8 に迫る低価格判断ガイド

2026年7月31日、DeepSeek は V4-Flash-0731 正式版を API 公測として公開しました。284B 総パラメータ・13B 活性化という架構は4月プレビュー版と完全に同一で、性能向上は後訓練の再実行のみによるものです。それでも Agent ベンチでは自社の V4-Pro プレビュー(1.6T/49B)を上回り、Claude Opus 4.8 と比べて最大約179倍安い料金体系を実現しています。本稿はタイムライン、料金・競合比較表、Harness 依存の注意点、五手順 HowTo と FAQ により、Flash 正式版を本番 Agent パイプラインに載せる判断材料を整理します。

1. 選定の三大痛点:正式版の誤解、Harness 依存、Pro 未公開

  1. 「V4 正式版=新モデル」という誤読:7月31日の更新は新規架構ではなく、同一 284B Flash の後訓練刷新です。フラッグシップ V4-Pro 正式版と自研 Agent フレームワーク DeepSeek Harness は依然「近日公開」で、App・Web チャットも未更新です。API のみが対象です。
  2. Agent ベンチが Harness に依存:Terminal Bench 2.0 で Flash 正式版 82.7 点、V4-Pro プレビュー 67.9 点という数値は、未公開の Harness minimal mode(max 推論・top_p=0.95・temperature=1.0)で測定されたベンダー自報値です。DeepSeek 自身も「harness 選択に極めて敏感」と明記しており、Claude Code や Cursor への単純移植はできません。
  3. 「最強スコア」ではなく「最強コスパ」:Artificial Analysis の独立 Intelligence Index では V4-Flash(50点)は Kimi K3(57点)や GLM-5.2 に劣ります。しかし単タスク平均コストは $0.03 で、Kimi K3 の約1/29、Claude Fable 5 の約1/105 です。絶対性能より Agent 大量呼び出しの単価最適化が目的のモデルです。

2. タイムライン:4月プレビューから7月31日「公式版」へ

日付 イベント
2026-04-24 V4 プレビュー公開・MIT オープンソース。V4-Pro(1.6T/49B)と V4-Flash(284B/13B)、いずれも 1M token コンテキスト
2026-07-24 旧モデル名 deepseek-chat / deepseek-reasoner 正式停止、全トラフィックを V4 系へ移行
2026-07-27 月之暗面 Kimi K3(2.8T)が Hugging Face でフルウェイト公開、競合圧力が高まる
2026-07-31 V4-Flash-0731 正式版が API 公測開始。Hugging Face 同期、changelog で Harness 初言及(API のみ
2026-08-05 本稿執筆時点:V4-Pro 正式版・Harness 公開日は未確定。8月10–20日 GA は未確認の噂

3. 料金・性能の決定マトリックス

モデル 状態 総/活性パラメータ 入力(未命中/命中)/M 出力/M Intelligence Index 単タスクコスト
V4-Flash-0731 正式版(07-31) 284B / 13B $0.14 / $0.0028 $0.28 50 $0.03
V4-Pro プレビューのみ 1.6T / 49B $0.435 / $0.003625 $0.87
Kimi K3 07-27 ウェイト公開 2.8T / ~104B $3.00 / $0.30 $15.00 57 $0.86
Qwen3.8-Max 08-02 API GA 2.4T / 95B $2.00 / ~$0.17–0.25 $6.00 未確認 未確認
Claude Fable 5 クローズド 非公開 Flash より +9点以上 $3.15

Intelligence Index と単タスクコストは Artificial Analysis(第三者)経由。Agent ベンチ(Terminal Bench 2.0 等)は DeepSeek 自報で方法論が異なります。DeepSeek は北京時間ピーク帯(9–12時・14–18時)の2倍課金を予告していますが、2026年8月5日時点で発効日は未公表です。

4. 後訓練と架構:なぜ小さい Flash が Pro を上回るのか

DeepSeek 技術報告(DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence)によると、V4 系の架構変更は三つです。

  • 混合注意機構(CSA + HCA):長コンテキストでの計算・VRAM 削減。100万 token 時、V4-Pro の per-token FLOPs は V3.2 の 27%、KV Cache は 10%(ベンダー公表値)。
  • 流形制約超接続(mHC):従来残差接続の改良。
  • Muon 最適化器:収束速度と安定性の向上。

7月31日の changelog で初めて名前が登場した DeepSeek Harness は、ファイル I/O・ツール呼び出し・多段エンジニアリングタスク向けの自研 Agent 実行フレームワークで、Claude Code の対抗製品です。これまで DeepSeek チームは Claude Code や OpenCode に依存してきました。Harness は未公開のまま、公式 Agent ベンチはすべて Harness minimal mode で計測されています。

5. 引用可能データ:ベンチ・単価・市場反応

  • Terminal Bench 2.0:V4-Flash-0731 82.7 vs V4-Pro プレビュー 67.9(Harness minimal mode、ベンダー自報)。
  • Claude Opus 4.8 比較:キャッシュ未命中入力で約 36倍、キャッシュ命中で約 179倍、出力で約 89倍安い(21世紀経済報道・ベンダー公表料金)。
  • OpenRouter 利用量:プレビュー版 Flash が7週連続で最多呼び出しモデル(コミュニティ報告)。
  • 実運用フィードバック:海外開発者コミュニティから、入力キャッシュ命中率の低さ、安全分類器のタイムアウト等が報告されています(21世紀経済報道)。
  • 算力株:7月31日、NVIDIA・Broadcom・AMD は DeepSeek 更新当日に大きな変動なし。2025年初の R1 ショックと対照的です。

6. 五手順:API 移行と Agent 受け入れ検証

  1. 旧モデル名を全リポジトリ検索:コード、CI、環境変数で deepseek-chatdeepseek-reasoner を洗い出します(7月24日で既に停止済み)。
  2. deepseek-v4-flash へ更新:OpenAI 互換 SDK では model のみ変更。Anthropic 形式も base_url="https://api.deepseek.com" を維持します。
  3. Prompt Cache を設計:System Prompt を固定し、キャッシュ命中入力 $0.0028/M の恩恵を最大化します。
  4. 自前 Agent Harness で再ベンチ:Claude Code、Cursor、OpenClaw 等で Terminal Bench 相当のタスクを再現し、公式 82.7 点との差を記録します。
  5. ピーク帯を避けた cron と1週間観測:北京時間ピーク帯の2倍課金を避け、ステージングでトークン消費・レイテンシ・キャッシュ命中率を計測してから本番切り替えます。
# 新写法(V4-Flash-0731 正式版)
client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[...],
    # Agent 思考モード例:
    # extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

7. 争点と注意:ベンチの水分、V4-Pro 日程、資金噂

中国 AI コミュニティでは、V4-Pro 正式版の延期を揶揄する「梁白開(空約束)」から、Flash 正式版の好調で「梁圣(賢人)」へとニックネームが反転する現象も報告されています。より実務的な概念として 「斩杀线(キルライン)」 —— DeepSeek の「十分な性能+極端な低価格」が競合の生存ラインを引く —— も議論されています。

  • Harness 依存のベンチ:公式 Agent スコアはフレームワーク固有。独立再現前は過信しないでください。
  • V4-Pro GA 日程:8月10–20日等は未署名消息源の噂。公式は「できるだけ早く」のみ。
  • 資金・IPO 報道:約74億ドル調達、487億ドル評価等は財経メディア「据报道」レベル。DeepSeek 公式確認なし。

8. よくある質問

Q:V4-Flash-0731 は新モデルですか?
いいえ。架構・パラメータ数は4月プレビュー版と同一で、後訓練のみ刷新です。

Q:Flash と Pro プレビューはどちらを選びますか?
Agent 大量呼び出し・バッチ処理なら Flash 正式版。深い推論で予算に余裕があれば Pro プレビューを検討し、正式版 GA 後に再評価します。

Q:App でも使えますか?
2026年7月31日時点では API のみです。コンシューマ App と Web は旧バージョンのままです。

9. まとめ:十分な知能+極限コストとリモート Mac の接続

V4-Flash-0731 正式版は、Agent パイプラインの大量呼び出し、予算制約のあるプロダクトチーム、OpenRouter 経由のルーティング分流にとって、2026年下半期の最有力候補の一つです。Harness 依存のベンチ数字と Pro 未公開という制約は残りますが、「最強スコア」ではなく「最強コスパ」という DeepSeek の戦略は、プレビュー版が7週連続 OpenRouter 1位だった事実と一致しています。

一方、Agent 連調をローカル PC や汎用 VPS で行う場合、ノート PC を閉じると接続が切れ、Harness 公開前の再現検証も cron バッチや SFTP/rsync ワークスペース同期と競合します。Windows/Linux では Xcode・Metal・Apple エコシステムの利点も得にくく、ローカル ds4 推論を評価する場合も 128GB 以上の Apple Silicon が前提です。常時オンラインのリモート Macなら、OpenClaw や Claude Code による Agent 受け入れ、cron によるオフピーク API 呼び出し、成果物の SFTP 同期を同一ノードで回せます。SFTPMAC リモート Mac レンタルは Apple Silicon ノードと低遅延ファイル転送を提供し、Harness 公開前の独自ベンチから本番 Agent パイプラインまで、途切れない検証環境を構築できます。

出典:DeepSeek 公式 API ドキュメント・changelog · 技術報告 · Hugging Face モデルカード · Artificial Analysis · 21世紀経済報 · V2EX コミュニティ。データは 2026年8月5日時点。