DeepSeek V4 GA: MoE-Architektur, 1M Kontext und Spitzen-/Nebenzeiten-Tarife

2026 DeepSeek V4 GA: Preise, Architektur & GPT-5.6-Vergleich — Entscheidungsguide

Nach drei Monaten Wartezeit ist DeepSeek V4 in der vollständigen GA-Version am 20. Juli 2026 live. Gegenüber der April-Preview bringt die Produktionsversion gezielte Upgrades bei Agent-Orchestrierung, mathematischem Reasoning und Code-Generierung — plus erstmals Spitzen-/Nebenzeiten-Tarife, ein Zeichen für disziplinierte Kommerzialisierung statt reiner Preisunterbietung. Dieser Leitfaden basiert auf offizieller Dokumentation und dem Technikbericht und deckt Zeitlinie, CSA+HCA-Architektur, Benchmarks, Vergleich mit GPT-5.6 und Claude Fable 5, Tarifmatrix und API-Migration bis 24. Juli ab — mit Blick auf DSGVO-konforme Betriebsstabilität.

1. Drei Entscheidungsschmerzpunkte: GA-Änderungen, Tarifkomplexität und Migrationsdruck

  1. Preview ≠ Produktionsendzustand: Die April-Architektur war bereits stark; GA optimiert Agent-Orchestrierung, Mathematik und Code gezielt. Gleichzeitig werden deepseek-chat und deepseek-reasoner am 24.07. um 23:59 (Peking-Zeit) dauerhaft abgeschaltet — verspätete Migration erzeugt vermeidbare Ausfälle.
  2. Spitzen-/Nebenzeiten erhöhen den Betriebsaufwand: Werktags 09:00–12:00 und 14:00–18:00 (Peking-Zeit) verdoppeln sich die Tarife. Batch-Inferenz, Code-Review und Datenannotation müssen in Nebenzeiten geplant werden — sonst explodiert die Rechnung.
  3. „Stärkstes Open Source“ ≠ „stärkstes Closed Source“: V4-Pro erreicht 80,6 % bei SWE-bench Verified (Open-Source-Rekord), doch Claude Fable 5 führt mit 96,0 % (Verified) und 80,3 % (Pro). Entscheidung nach „Fähigkeit ÷ Preis“ und DSGVO-Anforderungen, nicht nach einer einzelnen Rangliste.

2. Zeitlinie: Von der Preview zur GA-Version

Datum Ereignis
2026-04-24 V4-Preview live und Open Source (MIT): V4-Pro (1,6T) und V4-Flash (284B)
2026-05 Produktionsoptimierte V4-Flash- und V4-Pro-Versionen; API produktiv nutzbar
2026-06 V4-Pro dauerhaft 75 % günstiger (Output $0,87/M Tokens) — historisch beste Preis-Leistung
2026-06-29 E-Mail an alle API-Nutzer: GA Mitte Juli, erstmals Spitzen-/Nebenzeiten-Tarife angekündigt
2026-07-19 GA-Grauzonen-Zugang für ausgewählte Entwickler; Medien: „Vollversion morgen“
2026-07-20 GA offiziell live (Veröffentlichungsdatum dieses Artikels)
2026-07-24 Alte Modellnamen deepseek-chat und deepseek-reasoner endgültig abgeschaltet

Kurzfassung: Die Preview war bereits leistungsfähig; GA liefert Agent-Upgrades, besseres Mathe- und Code-Reasoning — plus ein formales, nachvollziehbares Tarifsystem für planbare Budgets.

3. Technische Architektur: Wie 1 Million Token Kontext tragfähig bleibt

3.1 Modellfamilie auf einen Blick

Spezifikation V4-Pro V4-Flash
Gesamtparameter 1,6 Billionen (1,6T) 284 Milliarden (284B)
Aktive Parameter pro Token 49 Milliarden (49B) 13 Milliarden (13B)
Transformer-Schichten 61 43
Kontextfenster 1.000.000 Tokens 1.000.000 Tokens
Maximale Ausgabe 384K Tokens 384K Tokens
Präzision FP4 (Experten) + FP8 (übrig) FP4 + FP8 gemischt
Pretraining-Daten 33T+ Tokens 32T+ Tokens
Open-Source-Lizenz MIT MIT

3.2 Hybride Aufmerksamkeit (CSA + HCA)

DeepSeek V4 verzichtet auf MLA aus V2/V3 und kombiniert zwei neue Mechanismen:

  • Compressed Sparse Attention (CSA): KV-Sequenzen werden per Softmax-Gating um Faktor 4 komprimiert; ein FP4-„Lightning Indexer“ wählt top-k spärlich (V4-Pro: top-1024, V4-Flash: top-512) bei gleichzeitigem 128-Token-Sliding-Window. Bei 1M Kontext nur 27 % der Inferenz-FLOPs gegenüber V3.2.
  • Heavy Compressed Attention (HCA): Komprimiert Tokens um Faktor 128 für globale dichte Aufmerksamkeit und ergänzt CSA. V4-Flash: erste 2 Schichten HCA, danach CSA/HCA alternierend; V4-Pro analog.

Gesamteffekt: KV-Cache-Speicher bei 1M Kontext nur 10 % von V3.2 (V4-Flash bis 7 %) — längere Kontexte auf gleicher Hardware, deutlich niedrigere Kosten.

3.3 Manifold-Constrained Hyper-Connections (mHC) und Muon-Optimierer

mHC erweitert klassische Residual-Verbindungen um 4-Kanal-Residualströme mit doubly-stochastic Mischmatrizen (Birkhoff-Polytop) — stabile Signalpropagation über 61 Schichten.

Muon (ersetzt AdamW) orthogonalisiert Gradienten via Newton-Schulz — schnellere Konvergenz, stabilere Trainingsläufe.

3.4 Drei Inferenzmodi und offizielle Sampling-Parameter

Modus Eigenschaft Einsatz
Non-think Keine Thought Chain, maximale Geschwindigkeit Einfache Q&A, Routing
Think High Explizites Reasoning (<redacted_thinking>) Mittlere Komplexität, Code-Debug
Think Max Maximale Reasoning-Tiefe, 384K+ Kontext nötig Komplexe Mathematik, lange Agent-Ketten

Offizielle Empfehlung (alle Modi): temperature=1.0, top_p=1.0

4. Benchmarks: Open-Source-Spitzenwerte im Überblick

4.1 V4-Pro Kerndaten

Benchmark DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified 80,6 % (Open-Source-Rekord) 96,0 % nicht separat veröffentlicht ~69 %
SWE-bench Pro 55,4 % 80,3 % 78,1 % 69,2 %
LiveCodeBench (Pass@1) 93,5 % 88,1 % 87,4 % 83,2 %
Codeforces Elo 3.206
Terminal-Bench 2.1 83,9 % 88,0 % 85,1 % 82,7 %

SWE-bench Verified misst echte GitHub-Bugfixes — 80,6 % ist der aktuelle Open-Source-Höchstwert, gleichauf mit Gemini 3.1 Pro. SWE-bench Pro ist strenger; Claude Fable 5 führt mit 80,3 %.

4.2 Preis-Leistung (Artificial Analysis)

  • Claude Fable 5: Strategy & Ops Index — $3,48 pro Lauf, Score 50
  • DeepSeek V4-Pro: gleiche Aufgabe $0,03, Score 38
  • DeepSeek V4-Flash: alle sechs Index-Aufgaben jeweils unter $0,04

Fable 5 kostet 116× mehr als V4-Pro bei nur ~12 Punkten Vorsprung (~31 %). Für die meisten Produktionsszenarien ist V4-Pro unschlagbar im Verhältnis Kosten zu Leistung.

5. Vollständiger Vergleich: GPT-5.6 und Claude Fable 5

Dimension DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
Open Source MIT, Self-Hosting möglich Geschlossen Geschlossen
Kontextfenster 1M Tokens nicht veröffentlicht 1M Tokens
Code-Fähigkeit Sehr stark (nahe Fable 5) Sehr stark Stärkste Klasse
API-Output (Nebenzeit) $0,87/M Tokens ~$15/M $50/M
API-Output (Spitzenzeit) $1,74/M Tokens
Agent-Fähigkeit Stark, Multi-Agent-Orchestrierung Stark Stärkste Klasse
Datenschutz / DSGVO Private Deployment-Option Nur Cloud Nur Cloud

Szenario-Empfehlungen:

  • Budget, hohe Frequenz, Self-Hosting / DSGVO: V4-Pro oder V4-Flash
  • Maximale Code-Qualität, Kosten egal: Claude Fable 5 (SWE-bench Pro Spitze)
  • Komplexe Algorithmen + Mathematik: GPT-5.6 Sol / Ultra
  • Massen-Log-/Dokumentverarbeitung günstig: V4-Flash (Cache-Hit ab $0,0028/M)

6. Spitzen-/Nebenzeiten-Tarife: Kosten planbar halten

Die wichtigste GA-Neuerung: zeitabhängige Preise analog zu Stromtarifen. Spitzenzeit (Peking-Zeit): Werktags 09:00–12:00 und 14:00–18:00 — doppelte Sätze.

Modell Posten Nebenzeit (Off-Peak) Spitzenzeit (Peak)
V4-Pro Input (Cache-Hit) ¥0,025 / $0,0035 / 1M verdoppelt
V4-Pro Input (Cache-Miss) ¥3,00 / $0,435 / 1M ¥6,00 / $0,87 / 1M
V4-Pro Output ¥6,00 / $0,87 / 1M ¥12,00 / $1,74 / 1M
V4-Flash Input (Cache-Hit) ¥0,02 / $0,0028 / 1M verdoppelt
V4-Flash Input (Cache-Miss) ¥1,00 / $0,14 / 1M ¥2,00 / $0,28 / 1M
V4-Flash Output ¥2,00 / $0,28 / 1M ¥4,00 / $0,56 / 1M

Vier Kostensenkungs-Strategien:

  1. Nicht-Echtzeit in Nebenzeiten: Batch-Verarbeitung, Annotation und Code-Review nach 18:00 oder vor 09:00 planen.
  2. Prompt Cache nutzen: Wiederholte System-Prompts cachen — V4-Flash Cache-Hit nur $0,0028/M.
  3. Flash als Router: Einfache Intent-Erkennung auf V4-Flash, komplexes Reasoning an V4-Pro.
  4. Rechnungs-E-Mails beachten: DeepSeek kündigt Tarifänderungen 24 Stunden vorher per E-Mail an.

Selbst in der Spitzenzeit ist V4-Pro-Output ($1,74/M) 8,6× günstiger als Claude Opus 4.8 ($15/M) und in ähnlicher Größenordnung zu GPT-5.6 Sol (~$15/M).

7. API-Migration für Entwickler (Frist 24. Juli)

Wichtig: deepseek-chat und deepseek-reasoner werden am 24.07.2026 um 15:59 UTC (24.07. 23:59 Peking-Zeit) dauerhaft abgeschaltet.

Alter Modellname Neuer Modellname Hinweis
deepseek-chat deepseek-v4-flash (Non-think) Schnell, für Leichtaufgaben
deepseek-reasoner deepseek-v4-flash (Think-Modus) oder Upgrade auf deepseek-v4-pro für stärkeres Reasoning

7.1 Fünf Schritte zur Migration

  1. Repository durchsuchen: Code, CI und Env-Vars nach deepseek-chat und deepseek-reasoner.
  2. Szenario-Mapping: Leichte Dialoge → deepseek-v4-flash; ehemaliger reasoner → Flash Think oder deepseek-v4-pro.
  3. OpenAI SDK: Nur model ändern; Think-Modus optional via extra_body.
  4. Spitzen-/Nebenzeiten-Scheduling: Cron für Batch-Jobs; feste System-Prompts für Cache-Hits.
  5. Staging-Abnahme: Vor dem 24.07. Kernpfade testen, keine alten Modellnamen.

7.2 Python-Beispiel (OpenAI SDK)

# Alt (nach 24.07. ungültig)
client.chat.completions.create(
    model="deepseek-chat",
    messages=[...]
)

# Neu
client.chat.completions.create(
    model="deepseek-v4-pro",          # oder deepseek-v4-flash
    messages=[...],
    # Think-Modus:
    # extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

7.3 Anthropic SDK (kompatibel)

V4 unterstützt OpenAI ChatCompletions und Anthropic Messages — base_url unverändert, nur model aktualisieren:

client = anthropic.Anthropic(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com"
)
message = client.messages.create(
    model="deepseek-v4-pro",
    max_tokens=4096,
    messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)

8. Häufige Fragen

F: Lohnt sich die GA-Version?
Der Wert liegt nicht darin, Claude Fable 5 oder GPT-5.6 sofort zu schlagen, sondern Open-Source-Spitzenleistung zu etwa 1/10 bis 1/100 der Closed-Source-Kosten zu liefern — mit Self-Hosting-Option für DSGVO-Szenarien.

F: Sind Spitzen-/Nebenzeiten ein Rückschritt?
Sie erhöhen die Planungskomplexität, doch Nebenzeit-Tarife bleiben extrem wettbewerbsfähig — ein Zeichen reifer, stabiler Plattform statt dauerhafter Subventionierung.

F: Noch auf deepseek-chat?
Migration bis 24. Juli abschließen, sonst Serviceunterbrechung.

9. Fazit: GA als Meilenstein für Open Source 2026

DeepSeek V4 GA ist für Unternehmen ohne Datenexport-Wunsch, budgetbewusste Teams, Agent-Ingenieure mit 1M-Kontext und alle, die Preis-Leistung priorisieren, die nahezu vollständigste Open-Source-Option.

Wer V4-Gewichte lokal oder auf einem VPS für Agent-Integration testet, stößt in Windows/Linux-Cross-Umgebungen schnell an Grenzen: fehlende Xcode-/Metal-Kohärenz, Laptop-Schlafmodus unterbricht 7×24-cron-Batch-Inferenz und SFTP/rsync-Workspace-Sync. Ein dauerhaft onlineer Apple-Silicon-Remote-Mac stabilisiert Spitzen-/Nebenzeiten-Scheduling, cron-Batch-Jobs und die Migrationsabnahme bis zum 24.07. — dokumentierbar und betrieblich zuverlässiger als ein zugeklapptes Gerät. Siehe auch lokale V4-Flash-Inferenz auf Mac. SFTPMAC Remote-Mac-Miete liefert native macOS-Knoten mit niedriger Latenz für API-Umstellung und Agent-Pipelines innerhalb des Migrationsfensters.

Quellen: DeepSeek offizielle Dokumentation · arXiv:2606.19348 · HuggingFace Modellseiten · LLMReference · Artificial Analysis · MangoMind Blog