2026 DeepSeek V4 GA: Preise, Architektur & GPT-5.6-Vergleich — Entscheidungsguide
Nach drei Monaten Wartezeit ist DeepSeek V4 in der vollständigen GA-Version am 20. Juli 2026 live. Gegenüber der April-Preview bringt die Produktionsversion gezielte Upgrades bei Agent-Orchestrierung, mathematischem Reasoning und Code-Generierung — plus erstmals Spitzen-/Nebenzeiten-Tarife, ein Zeichen für disziplinierte Kommerzialisierung statt reiner Preisunterbietung. Dieser Leitfaden basiert auf offizieller Dokumentation und dem Technikbericht und deckt Zeitlinie, CSA+HCA-Architektur, Benchmarks, Vergleich mit GPT-5.6 und Claude Fable 5, Tarifmatrix und API-Migration bis 24. Juli ab — mit Blick auf DSGVO-konforme Betriebsstabilität.
1. Drei Entscheidungsschmerzpunkte: GA-Änderungen, Tarifkomplexität und Migrationsdruck
- Preview ≠ Produktionsendzustand: Die April-Architektur war bereits stark; GA optimiert Agent-Orchestrierung, Mathematik und Code gezielt. Gleichzeitig werden
deepseek-chatunddeepseek-reasoneram 24.07. um 23:59 (Peking-Zeit) dauerhaft abgeschaltet — verspätete Migration erzeugt vermeidbare Ausfälle. - Spitzen-/Nebenzeiten erhöhen den Betriebsaufwand: Werktags 09:00–12:00 und 14:00–18:00 (Peking-Zeit) verdoppeln sich die Tarife. Batch-Inferenz, Code-Review und Datenannotation müssen in Nebenzeiten geplant werden — sonst explodiert die Rechnung.
- „Stärkstes Open Source“ ≠ „stärkstes Closed Source“: V4-Pro erreicht 80,6 % bei SWE-bench Verified (Open-Source-Rekord), doch Claude Fable 5 führt mit 96,0 % (Verified) und 80,3 % (Pro). Entscheidung nach „Fähigkeit ÷ Preis“ und DSGVO-Anforderungen, nicht nach einer einzelnen Rangliste.
2. Zeitlinie: Von der Preview zur GA-Version
| Datum | Ereignis |
|---|---|
| 2026-04-24 | V4-Preview live und Open Source (MIT): V4-Pro (1,6T) und V4-Flash (284B) |
| 2026-05 | Produktionsoptimierte V4-Flash- und V4-Pro-Versionen; API produktiv nutzbar |
| 2026-06 | V4-Pro dauerhaft 75 % günstiger (Output $0,87/M Tokens) — historisch beste Preis-Leistung |
| 2026-06-29 | E-Mail an alle API-Nutzer: GA Mitte Juli, erstmals Spitzen-/Nebenzeiten-Tarife angekündigt |
| 2026-07-19 | GA-Grauzonen-Zugang für ausgewählte Entwickler; Medien: „Vollversion morgen“ |
| 2026-07-20 | GA offiziell live (Veröffentlichungsdatum dieses Artikels) |
| 2026-07-24 | Alte Modellnamen deepseek-chat und deepseek-reasoner endgültig abgeschaltet |
Kurzfassung: Die Preview war bereits leistungsfähig; GA liefert Agent-Upgrades, besseres Mathe- und Code-Reasoning — plus ein formales, nachvollziehbares Tarifsystem für planbare Budgets.
3. Technische Architektur: Wie 1 Million Token Kontext tragfähig bleibt
3.1 Modellfamilie auf einen Blick
| Spezifikation | V4-Pro | V4-Flash |
|---|---|---|
| Gesamtparameter | 1,6 Billionen (1,6T) | 284 Milliarden (284B) |
| Aktive Parameter pro Token | 49 Milliarden (49B) | 13 Milliarden (13B) |
| Transformer-Schichten | 61 | 43 |
| Kontextfenster | 1.000.000 Tokens | 1.000.000 Tokens |
| Maximale Ausgabe | 384K Tokens | 384K Tokens |
| Präzision | FP4 (Experten) + FP8 (übrig) | FP4 + FP8 gemischt |
| Pretraining-Daten | 33T+ Tokens | 32T+ Tokens |
| Open-Source-Lizenz | MIT | MIT |
3.2 Hybride Aufmerksamkeit (CSA + HCA)
DeepSeek V4 verzichtet auf MLA aus V2/V3 und kombiniert zwei neue Mechanismen:
- Compressed Sparse Attention (CSA): KV-Sequenzen werden per Softmax-Gating um Faktor 4 komprimiert; ein FP4-„Lightning Indexer“ wählt top-k spärlich (V4-Pro: top-1024, V4-Flash: top-512) bei gleichzeitigem 128-Token-Sliding-Window. Bei 1M Kontext nur 27 % der Inferenz-FLOPs gegenüber V3.2.
- Heavy Compressed Attention (HCA): Komprimiert Tokens um Faktor 128 für globale dichte Aufmerksamkeit und ergänzt CSA. V4-Flash: erste 2 Schichten HCA, danach CSA/HCA alternierend; V4-Pro analog.
Gesamteffekt: KV-Cache-Speicher bei 1M Kontext nur 10 % von V3.2 (V4-Flash bis 7 %) — längere Kontexte auf gleicher Hardware, deutlich niedrigere Kosten.
3.3 Manifold-Constrained Hyper-Connections (mHC) und Muon-Optimierer
mHC erweitert klassische Residual-Verbindungen um 4-Kanal-Residualströme mit doubly-stochastic Mischmatrizen (Birkhoff-Polytop) — stabile Signalpropagation über 61 Schichten.
Muon (ersetzt AdamW) orthogonalisiert Gradienten via Newton-Schulz — schnellere Konvergenz, stabilere Trainingsläufe.
3.4 Drei Inferenzmodi und offizielle Sampling-Parameter
| Modus | Eigenschaft | Einsatz |
|---|---|---|
| Non-think | Keine Thought Chain, maximale Geschwindigkeit | Einfache Q&A, Routing |
| Think High | Explizites Reasoning (<redacted_thinking>) |
Mittlere Komplexität, Code-Debug |
| Think Max | Maximale Reasoning-Tiefe, 384K+ Kontext nötig | Komplexe Mathematik, lange Agent-Ketten |
Offizielle Empfehlung (alle Modi): temperature=1.0, top_p=1.0
4. Benchmarks: Open-Source-Spitzenwerte im Überblick
4.1 V4-Pro Kerndaten
| Benchmark | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % (Open-Source-Rekord) | 96,0 % | nicht separat veröffentlicht | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench (Pass@1) | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3.206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
SWE-bench Verified misst echte GitHub-Bugfixes — 80,6 % ist der aktuelle Open-Source-Höchstwert, gleichauf mit Gemini 3.1 Pro. SWE-bench Pro ist strenger; Claude Fable 5 führt mit 80,3 %.
4.2 Preis-Leistung (Artificial Analysis)
- Claude Fable 5: Strategy & Ops Index — $3,48 pro Lauf, Score 50
- DeepSeek V4-Pro: gleiche Aufgabe $0,03, Score 38
- DeepSeek V4-Flash: alle sechs Index-Aufgaben jeweils unter $0,04
Fable 5 kostet 116× mehr als V4-Pro bei nur ~12 Punkten Vorsprung (~31 %). Für die meisten Produktionsszenarien ist V4-Pro unschlagbar im Verhältnis Kosten zu Leistung.
5. Vollständiger Vergleich: GPT-5.6 und Claude Fable 5
| Dimension | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open Source | MIT, Self-Hosting möglich | Geschlossen | Geschlossen |
| Kontextfenster | 1M Tokens | nicht veröffentlicht | 1M Tokens |
| Code-Fähigkeit | Sehr stark (nahe Fable 5) | Sehr stark | Stärkste Klasse |
| API-Output (Nebenzeit) | $0,87/M Tokens | ~$15/M | $50/M |
| API-Output (Spitzenzeit) | $1,74/M Tokens | — | — |
| Agent-Fähigkeit | Stark, Multi-Agent-Orchestrierung | Stark | Stärkste Klasse |
| Datenschutz / DSGVO | Private Deployment-Option | Nur Cloud | Nur Cloud |
Szenario-Empfehlungen:
- Budget, hohe Frequenz, Self-Hosting / DSGVO: V4-Pro oder V4-Flash
- Maximale Code-Qualität, Kosten egal: Claude Fable 5 (SWE-bench Pro Spitze)
- Komplexe Algorithmen + Mathematik: GPT-5.6 Sol / Ultra
- Massen-Log-/Dokumentverarbeitung günstig: V4-Flash (Cache-Hit ab $0,0028/M)
6. Spitzen-/Nebenzeiten-Tarife: Kosten planbar halten
Die wichtigste GA-Neuerung: zeitabhängige Preise analog zu Stromtarifen. Spitzenzeit (Peking-Zeit): Werktags 09:00–12:00 und 14:00–18:00 — doppelte Sätze.
| Modell | Posten | Nebenzeit (Off-Peak) | Spitzenzeit (Peak) |
|---|---|---|---|
| V4-Pro | Input (Cache-Hit) | ¥0,025 / $0,0035 / 1M | verdoppelt |
| V4-Pro | Input (Cache-Miss) | ¥3,00 / $0,435 / 1M | ¥6,00 / $0,87 / 1M |
| V4-Pro | Output | ¥6,00 / $0,87 / 1M | ¥12,00 / $1,74 / 1M |
| V4-Flash | Input (Cache-Hit) | ¥0,02 / $0,0028 / 1M | verdoppelt |
| V4-Flash | Input (Cache-Miss) | ¥1,00 / $0,14 / 1M | ¥2,00 / $0,28 / 1M |
| V4-Flash | Output | ¥2,00 / $0,28 / 1M | ¥4,00 / $0,56 / 1M |
Vier Kostensenkungs-Strategien:
- Nicht-Echtzeit in Nebenzeiten: Batch-Verarbeitung, Annotation und Code-Review nach 18:00 oder vor 09:00 planen.
- Prompt Cache nutzen: Wiederholte System-Prompts cachen — V4-Flash Cache-Hit nur $0,0028/M.
- Flash als Router: Einfache Intent-Erkennung auf V4-Flash, komplexes Reasoning an V4-Pro.
- Rechnungs-E-Mails beachten: DeepSeek kündigt Tarifänderungen 24 Stunden vorher per E-Mail an.
Selbst in der Spitzenzeit ist V4-Pro-Output ($1,74/M) 8,6× günstiger als Claude Opus 4.8 ($15/M) und in ähnlicher Größenordnung zu GPT-5.6 Sol (~$15/M).
7. API-Migration für Entwickler (Frist 24. Juli)
Wichtig: deepseek-chat und deepseek-reasoner werden am 24.07.2026 um 15:59 UTC (24.07. 23:59 Peking-Zeit) dauerhaft abgeschaltet.
| Alter Modellname | Neuer Modellname | Hinweis |
|---|---|---|
deepseek-chat |
deepseek-v4-flash (Non-think) |
Schnell, für Leichtaufgaben |
deepseek-reasoner |
deepseek-v4-flash (Think-Modus) |
oder Upgrade auf deepseek-v4-pro für stärkeres Reasoning |
7.1 Fünf Schritte zur Migration
- Repository durchsuchen: Code, CI und Env-Vars nach
deepseek-chatunddeepseek-reasoner. - Szenario-Mapping: Leichte Dialoge →
deepseek-v4-flash; ehemaliger reasoner → Flash Think oderdeepseek-v4-pro. - OpenAI SDK: Nur
modeländern; Think-Modus optional viaextra_body. - Spitzen-/Nebenzeiten-Scheduling: Cron für Batch-Jobs; feste System-Prompts für Cache-Hits.
- Staging-Abnahme: Vor dem 24.07. Kernpfade testen, keine alten Modellnamen.
7.2 Python-Beispiel (OpenAI SDK)
# Alt (nach 24.07. ungültig)
client.chat.completions.create(
model="deepseek-chat",
messages=[...]
)
# Neu
client.chat.completions.create(
model="deepseek-v4-pro", # oder deepseek-v4-flash
messages=[...],
# Think-Modus:
# extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
7.3 Anthropic SDK (kompatibel)
V4 unterstützt OpenAI ChatCompletions und Anthropic Messages — base_url unverändert, nur model aktualisieren:
client = anthropic.Anthropic(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
message = client.messages.create(
model="deepseek-v4-pro",
max_tokens=4096,
messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)
8. Häufige Fragen
F: Lohnt sich die GA-Version?
Der Wert liegt nicht darin, Claude Fable 5 oder GPT-5.6 sofort zu schlagen, sondern Open-Source-Spitzenleistung zu etwa 1/10 bis 1/100 der Closed-Source-Kosten zu liefern — mit Self-Hosting-Option für DSGVO-Szenarien.
F: Sind Spitzen-/Nebenzeiten ein Rückschritt?
Sie erhöhen die Planungskomplexität, doch Nebenzeit-Tarife bleiben extrem wettbewerbsfähig — ein Zeichen reifer, stabiler Plattform statt dauerhafter Subventionierung.
F: Noch auf deepseek-chat?
Migration bis 24. Juli abschließen, sonst Serviceunterbrechung.
9. Fazit: GA als Meilenstein für Open Source 2026
DeepSeek V4 GA ist für Unternehmen ohne Datenexport-Wunsch, budgetbewusste Teams, Agent-Ingenieure mit 1M-Kontext und alle, die Preis-Leistung priorisieren, die nahezu vollständigste Open-Source-Option.
Wer V4-Gewichte lokal oder auf einem VPS für Agent-Integration testet, stößt in Windows/Linux-Cross-Umgebungen schnell an Grenzen: fehlende Xcode-/Metal-Kohärenz, Laptop-Schlafmodus unterbricht 7×24-cron-Batch-Inferenz und SFTP/rsync-Workspace-Sync. Ein dauerhaft onlineer Apple-Silicon-Remote-Mac stabilisiert Spitzen-/Nebenzeiten-Scheduling, cron-Batch-Jobs und die Migrationsabnahme bis zum 24.07. — dokumentierbar und betrieblich zuverlässiger als ein zugeklapptes Gerät. Siehe auch lokale V4-Flash-Inferenz auf Mac. SFTPMAC Remote-Mac-Miete liefert native macOS-Knoten mit niedriger Latenz für API-Umstellung und Agent-Pipelines innerhalb des Migrationsfensters.
Quellen: DeepSeek offizielle Dokumentation · arXiv:2606.19348 · HuggingFace Modellseiten · LLMReference · Artificial Analysis · MangoMind Blog