DeepSeek V4 完全版 GA リリース:MoE 架構、1M コンテキストとピーク・オフピーク課金の概念図

2026年 DeepSeek V4 完全版 GA 正式リリース:料金・架構・GPT-5.6 比較の意思決定ガイド

3か月の待機を経て、DeepSeek V4 完全版(GA 正式版)が 2026 年 7 月 20 日に正式リリースされました。4 月プレビュー版と比べ、Agent・数学推論・コード生成が重点強化され、初のピーク・オフピーク課金が導入されています。DeepSeek は「ほぼ無料」から規律ある商用運用へと移行したことを示しています。本稿は公式ドキュメントと技術報告に基づき、タイムライン、架構、ベンチマーク、GPT-5.6 / Claude Fable 5 との比較、ピーク・オフピーク料金、7 月 24 日までの API 移行を網羅的に解説します。

1. 選定の三大痛点:GA 変化、課金の複雑さ、移行の緊急性

  1. プレビュー版 ≠ 本番の最終形:4 月の架構はすでに強力ですが、GA では Agent オーケストレーション、数学、コードに重点チューニングが入っています。旧モデル名 deepseek-chat / deepseek-reasoner7 月 24 日 23:59(北京時間)に永久停止するため、移行を先延ばしにすると意図的な障害を招きます。
  2. ピーク・オフピーク課金が運用を複雑化:平日 09:00–12:00、14:00–18:00(北京時間)は料金が2倍。バッチ推論・コードレビュー・データアノテーションをオフピークに回さないと、請求が想定外に倍増する可能性があります。
  3. 「オープンソース最強」≠「閉源最強」:V4-Pro は SWE-bench Verified で 80.6% のオープンソース記録ですが、Claude Fable 5 は Verified(96.0%)と Pro(80.3%)で依然リード。選定は単一ランキングではなく「能力 ÷ 価格」で判断すべきです。

2. タイムライン:プレビューから完全版へ

日付 イベント
2026-04-24 V4 プレビュー版リリース・オープンソース化(MIT)、V4-Pro(1.6T)と V4-Flash(284B)を含む
2026-05 V4-Flash と V4-Pro の本番チューニング版リリース、API 正式利用可能
2026-06 V4-Pro 価格を恒久的に 75% 値下げ(出力 $0.87/M tokens)、史上最高のコスパ区間に確定
2026-06-29 DeepSeek が全 API ユーザーにメール:7 月中旬 GA 予定、初のピーク・オフピーク課金案を開示
2026-07-19 複数開発者が GA グレー内測資格を取得、メディアが「完全版は明日にも公開」と報道
2026-07-20 GA 正式版リリース(本稿公開日)
2026-07-24 旧インターフェース名 deepseek-chatdeepseek-reasoner が永久停止

一言まとめ:V4 プレビュー版はすでに強力でしたが、完全版は Agent 能力・数学推論・コード生成を重点強化し、正式な商用課金体系を整備しました。

3. 技術架構の深掘り:100 万 token コンテキストを支える理由

3.1 モデルファミリー仕様一覧

仕様 V4-Pro V4-Flash
総パラメータ数 1.6 兆(1.6T) 2840 億(284B)
トークンあたり活性化パラメータ 490 億(49B) 130 億(13B)
Transformer 層数 61 層 43 層
コンテキストウィンドウ 1,000,000 tokens 1,000,000 tokens
最大出力 384K tokens 384K tokens
精度 FP4(エキスパート重み)+ FP8(その他) FP4 + FP8 混合
事前学習データ量 33T+ tokens 32T+ tokens
オープンソースライセンス MIT MIT

3.2 ハイブリッドアテンション(CSA + HCA)

DeepSeek V4 は V2/V3 時代の MLA(多頭潜在アテンション)を廃止し、2 種類の新アテンション機構のハイブリッドを採用しています。

  • 圧縮スパースアテンション(CSA):KV 系列を Softmax ゲート付きプーリングで 4 倍圧縮し、FP4 精度の「ライトニングインデクサー」で top-k スパース選択(V4-Pro は top-1024、V4-Flash は top-512)。直近 128 token のスライディングウィンドウも保持。1M コンテキストでは V3.2 比 27% の推論 FLOPs で済みます。
  • 高密度圧縮アテンション(HCA):トークンを 128 倍圧縮してからグローバル密アテンションを行い、長距離依存を捕捉。CSA と相補。V4-Flash は最初の 2 層が HCA、その後 CSA/HCA が交互;V4-Pro も同様の構造です。

総合効果:1M token シナリオで KV Cache メモリは V3.2 の 10%(V4-Flash は 7%)に抑えられ、同等ハードウェアでより長いコンテキストを扱え、コストが大幅に下がります。

3.3 多様体制約ハイパーコネクション(mHC)と Muon オプティマイザ

mHC は従来の残差接続を拡張:4 チャネル残差ストリームを導入し、双確率行列制約(Birkhoff 多面体)を満たす混合行列で、61 層の深いネットワークでも信号が安定伝播します。

Muon オプティマイザ(標準 AdamW の代替)はニュートン–シュルツ直交化で勾配を処理し、より根拠のあるステップサイズで収束を速め、学習を安定化します。

3.4 三つの推論モードと公式サンプリングパラメータ

モード 特徴 適用シナリオ
Non-think 思考チェーンなし、超高速応答 簡単な Q&A、ルーティング振り分け
Think High 明示的推論(<redacted_thinking> タグ) 中程度の複雑タスク、コードデバッグ
Think Max 最大推論強度、384K+ コンテキストが必要 複雑な数学、長チェーン Agent

公式推奨サンプリングパラメータ(全モード共通):temperature=1.0, top_p=1.0

4. ベンチマーク:オープンソース王者の成績表

4.1 V4-Pro コア評価データ

ベンチマーク DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified 80.6%(オープンソース最高) 96.0% 個別未公表 ~69%
SWE-bench Pro 55.4% 80.3% 78.1% 69.2%
LiveCodeBench (Pass@1) 93.5% 88.1% 87.4% 83.2%
Codeforces Elo 3,206
Terminal-Bench 2.1 83.9% 88.0% 85.1% 82.7%

SWE-bench Verified は「実 GitHub リポジトリのバグ修正」を測定します。80.6% は現時点のオープンソースモデル最高で、Gemini 3.1 Pro と並びます。SWE-bench Pro はより厳格で、Claude Fable 5 の 80.3% が現状リードです。

4.2 コスパ横断比較(Artificial Analysis)

  • Claude Fable 5:Strategy & Ops 指数タスクあたり $3.48、スコア 50 点
  • DeepSeek V4-Pro:同種タスクあたり $0.03、スコア 38 点
  • DeepSeek V4-Flash:6 類の指数タスクすべて、1 回あたり $0.04 未満

Fable 5 のコストは V4-Pro の 116 倍ですが、スコアは約 12 点(31%)しか上回りません。多くの本番シナリオでは V4-Pro のコスパが突出しています。

5. GPT-5.6 / Claude Fable 5 との全面比較

次元 DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
オープンソース MIT、セルフホスト可 閉源 閉源
コンテキストウィンドウ 1M tokens 未公開 1M tokens
コード能力 極めて強い(Fable 5 に接近) 極めて強い 最強
API 出力単価(通常時) $0.87/M tokens ~$15/M $50/M
ピーク時出力単価 $1.74/M tokens
Agent 能力 強い、マルチ Agent オーケストレーション対応 強い 最強
データプライバシー プライベートデプロイ可 クラウド クラウド

シナリオ別選定の目安

  • 予算重視 / 高頻度呼び出し / プライベートデプロイ:V4-Pro または V4-Flash を第一候補に
  • 極限のコード能力、コスト不問:Claude Fable 5(SWE-bench Pro 最高スコア)
  • 複雑アルゴリズム + 数学推論:GPT-5.6 Sol / Ultra
  • 超大規模ログ・文書処理(低コスト):V4-Flash(キャッシュ命中入力 $0.0028/M)

6. ピーク・オフピーク課金の詳細:どう節約するか

GA 版で最も注目された変化は、DeepSeek が初めてピーク・オフピーク差別料金を導入したことです。電力の時間帯別料金に似た仕組みです。ピーク時間帯(北京時間):平日 09:00–12:00 と 14:00–18:00 で料金が2倍になります。

モデル 課金項目 通常(Off-Peak) ピーク(Peak)
V4-Pro 入力(キャッシュ命中) ¥0.025 / $0.0035 / 1M 2倍
V4-Pro 入力(キャッシュ未命中) ¥3.00 / $0.435 / 1M ¥6.00 / $0.87 / 1M
V4-Pro 出力 ¥6.00 / $0.87 / 1M ¥12.00 / $1.74 / 1M
V4-Flash 入力(キャッシュ命中) ¥0.02 / $0.0028 / 1M 2倍
V4-Flash 入力(キャッシュ未命中) ¥1.00 / $0.14 / 1M ¥2.00 / $0.28 / 1M
V4-Flash 出力 ¥2.00 / $0.28 / 1M ¥4.00 / $0.56 / 1M

四つの節約策

  1. 非リアルタイムタスクをオフピークへ:バッチ文書処理、データアノテーション、コードレビューは 18:00 以降または 09:00 前に回します。
  2. キャッシュ命中を活用:繰り返し System Prompt で Prompt Cache を構築。V4-Flash のキャッシュ命中コストは $0.0028/M とほぼ無料に近い水準です。
  3. Flash で分流:簡単な意図認識・ルーティング判断は V4-Flash、複雑推論は V4-Pro へエスカレーション。
  4. 請求通知メールに注目:DeepSeek は料金変更を 24 時間前にメール通知することを約束しています。

ピーク時でも V4-Pro 出力($1.74/M)は Claude Opus 4.8($15/M)より 8.6 倍安く、GPT-5.6 Sol(約 $15/M)と同程度の倍率差です。

7. 開発者必読:API 移行ガイド(7月24日締切)

重要警告:旧モデル名 deepseek-chatdeepseek-reasoner2026年7月24日 15:59 UTC(北京時間 7月24日 23:59)に永久アクセス停止となります。

旧モデル名 新モデル名 備考
deepseek-chat deepseek-v4-flash(非思考モード) 高速、軽量タスク向け
deepseek-reasoner deepseek-v4-flash(思考モード) または deepseek-v4-pro へアップグレードしてより強い推論を取得

7.1 五手順の移行実践

  1. 全リポジトリ検索:コード、CI、環境変数で deepseek-chatdeepseek-reasoner を検索します。
  2. シナリオ別マッピング:軽量対話 → deepseek-v4-flash;旧 reasoner → flash 思考モードまたは deepseek-v4-pro
  3. OpenAI SDK を更新model パラメータのみ変更;思考モードは extra_body を追加可能です。
  4. ピーク・オフピークスケジュール設定:cron でバッチをオフピークに回し、System Prompt を固定してキャッシュ命中を高めます。
  5. ステージング受け入れ:7 月 24 日前に staging で通し、旧モデル名の残存がないことを確認します。

7.2 Python コード例(OpenAI SDK)

# 旧写法(7月24日以降は無効)
client.chat.completions.create(
    model="deepseek-chat",
    messages=[...]
)

# 新写法
client.chat.completions.create(
    model="deepseek-v4-pro",          # または deepseek-v4-flash
    messages=[...],
    # 思考モードの制御:
    # extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

7.3 Anthropic SDK 互換の書き方

V4 は OpenAI ChatCompletions と Anthropic Messages の両形式に対応。base_url は変更不要で、model のみ更新します。

client = anthropic.Anthropic(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com"
)
message = client.messages.create(
    model="deepseek-v4-pro",
    max_tokens=4096,
    messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)

8. よくある質問

Q:完全版は期待に値しますか?
価値は Claude Fable 5 や GPT-5.6 を今すぐ上回ることではなく、閉源フラッグシップの 1/10〜1/100 のコストで、オープンソースモデル中最強の性能を提供できる点にあります。

Q:ピーク・オフピーク課金は後退ですか?
コスト設計は複雑化しますが、オフピーク料金は依然として極めて競争力があります。「価格破壊」から「ルールのある商用プラットフォーム」への成熟化のシグナルと捉えるべきです。

Q:まだ deepseek-chat を使っていますが?
7 月 24 日前に移行を完了してください。さもないとサービスが中断されます。

9. まとめ:GA は 2026 年オープンソース大規模モデルの最重要マイルストーンの一つ

DeepSeek V4 GA 正式版は、データを国外に出したくない企業、予算に制約のある個人開発者、1M token コンテキストを必要とする Agent エンジニア、極限のコスパを追求する AI プロダクトチームにとって、V4-Pro は現時点でほぼ死角のない選択肢です。

ローカルや VPS で V4 重みを動かして Agent 連調を行う場合、Windows/Linux のクロス環境では Apple エコシステムの Xcode、Metal、ユニファイドメモリの利点が得にくく、ノート PC を閉じると接続が切れ、7×24 の cron バッチ推論や SFTP/rsync ワークスペース同期も難しくなります。常時オンラインの Apple Silicon リモート Macは、ピーク・オフピークスケジュール、cron バッチ処理と ローカル推論評価を安定稼働させるのに適しています。SFTPMAC リモート Mac レンタルはネイティブ macOS ノードと低遅延ファイル転送を提供し、7 月 24 日の移行ウィンドウ内に API 切り替えと Agent パイプラインの受け入れを一度に完了できます。

出典:DeepSeek 公式ドキュメント · arXiv:2606.19348 · HuggingFace モデルページ · LLMReference · Artificial Analysis · MangoMind Blog