DeepSeek V4 GA : architecture MoE, contexte 1M tokens et tarification différenciée

2026 DeepSeek V4 GA : tarifs, architecture et comparaison GPT-5.6 — guide de décision

Trois mois d'attente ont conduit à ce moment : DeepSeek V4 en version GA complète est officiellement disponible le 20 juillet 2026. Par rapport à la preview d'avril, cette version de production affûte l'orchestration d'agents, le raisonnement mathématique et la génération de code — et inaugure une tarification heures pleines et creuses, signe d'une maturité commerciale mesurée. Ce guide s'appuie sur la documentation officielle et le rapport technique pour couvrir la chronologie, l'architecture CSA+HCA, les benchmarks, la comparaison avec GPT-5.6 et Claude Fable 5, les grilles tarifaires et la migration API avant le 24 juillet.

1. Trois enjeux de décision : évolutions GA, complexité tarifaire et urgence de migration

  1. Preview ≠ état de production final : L'architecture d'avril était déjà remarquable ; la GA optimise agents, mathématiques et code. Les anciens noms deepseek-chat et deepseek-reasoner seront définitivement retirés le 24 juillet à 23h59 (heure de Pékin) — reporter la migration, c'est accepter une panne évitable.
  2. La tarification différenciée complexifie l'exploitation : En semaine de 09h00 à 12h00 et de 14h00 à 18h00 (heure de Pékin), les tarifs doublent. Inférence batch, revue de code et annotation doivent être planifiés hors pointe.
  3. « Meilleur open source » ≠ « meilleur closed source » : V4-Pro atteint 80,6 % sur SWE-bench Verified (record open source), mais Claude Fable 5 mène avec 96,0 % (Verified) et 80,3 % (Pro). La décision se prend sur « capacité ÷ prix », pas sur un seul classement.

2. Chronologie : de la preview à la version complète

Date Événement
2026-04-24 Lancement de la preview V4 en open source (MIT) : V4-Pro (1,6T) et V4-Flash (284B)
2026-05 Versions V4-Flash et V4-Pro optimisées pour la production ; API disponible
2026-06 Baisse permanente de 75 % sur V4-Pro (sortie $0,87/M tokens) — rapport qualité-prix historique
2026-06-29 E-mail à tous les utilisateurs API : GA mi-juillet, première annonce de tarification heures pleines/creuses
2026-07-19 Accès bêta GA pour certains développeurs ; presse : « version complète dès demain »
2026-07-20 Mise en ligne officielle de la GA (date de publication de cet article)
2026-07-24 Retrait définitif de deepseek-chat et deepseek-reasoner

En résumé : La preview était déjà puissante ; la GA consolide les agents, le raisonnement mathématique et le code, avec un cadre tarifaire formel pour des budgets prévisibles.

3. Architecture technique : comment porter un million de tokens de contexte

3.1 Spécifications de la famille de modèles

Spécification V4-Pro V4-Flash
Paramètres totaux 1,6 billion (1,6T) 284 milliards (284B)
Paramètres actifs par token 49 milliards (49B) 13 milliards (13B)
Couches Transformer 61 43
Fenêtre de contexte 1 000 000 tokens 1 000 000 tokens
Sortie maximale 384K tokens 384K tokens
Précision FP4 (experts) + FP8 (reste) FP4 + FP8 mixte
Données de pré-entraînement 33T+ tokens 32T+ tokens
Licence open source MIT MIT

3.2 Attention hybride (CSA + HCA)

DeepSeek V4 abandonne le MLA des versions V2/V3 au profit de deux mécanismes complémentaires :

  • Compressed Sparse Attention (CSA) : Les séquences KV sont compressées ×4 par gating Softmax ; un indexeur FP4 « lightning » sélectionne en sparse top-k (V4-Pro : top-1024, V4-Flash : top-512) avec fenêtre glissante de 128 tokens. À 1M de contexte, seulement 27 % des FLOPs de V3.2.
  • Heavy Compressed Attention (HCA) : Compression ×128 pour une attention globale dense, complémentaire au CSA. V4-Flash : 2 premières couches en HCA, puis alternance CSA/HCA ; V4-Pro suit une logique similaire.

Effet global : mémoire KV Cache à 1M tokens réduite à 10 % de V3.2 (V4-Flash jusqu'à 7 %) — contextes plus longs sur le même matériel, coûts en baisse.

3.3 Hyper-connexions contraintes (mHC) et optimiseur Muon

mHC enrichit les connexions résiduelles avec 4 flux résiduels et des matrices de mélange doubly-stochastic (polytope de Birkhoff) — propagation stable sur 61 couches.

Muon (remplaçant AdamW) orthogonalise les gradients via Newton-Schulz — convergence accélérée, entraînement plus stable.

3.4 Trois modes d'inférence et paramètres d'échantillonnage officiels

Mode Caractéristique Usage
Non-think Pas de chaîne de pensée, réponse rapide Q&R simples, routage
Think High Raisonnement explicite (<redacted_thinking>) Tâches moyennes, débogage code
Think Max Raisonnement maximal, contexte 384K+ requis Mathématiques complexes, agents longue chaîne

Paramètres recommandés (tous modes) : temperature=1.0, top_p=1.0

4. Benchmarks : le palmarès open source

4.1 Données clés V4-Pro

Benchmark DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified 80,6 % (record open source) 96,0 % non publié séparément ~69 %
SWE-bench Pro 55,4 % 80,3 % 78,1 % 69,2 %
LiveCodeBench (Pass@1) 93,5 % 88,1 % 87,4 % 83,2 %
Codeforces Elo 3 206
Terminal-Bench 2.1 83,9 % 88,0 % 85,1 % 82,7 %

SWE-bench Verified mesure la correction de bugs sur de vrais dépôts GitHub — 80,6 % est le meilleur score open source actuel, à égalité avec Gemini 3.1 Pro. SWE-bench Pro est plus exigeant ; Claude Fable 5 mène avec 80,3 %.

4.2 Rapport qualité-prix (Artificial Analysis)

  • Claude Fable 5 : tâches Strategy & Ops Index — $3,48 par exécution, score 50
  • DeepSeek V4-Pro : même tâche $0,03, score 38
  • DeepSeek V4-Flash : les six catégories d'index, chacune sous $0,04

Fable 5 coûte 116 fois plus que V4-Pro pour seulement ~12 points d'écart (~31 %). Pour la plupart des usages en production, V4-Pro offre un rapport qualité-prix sans équivalent.

5. Comparaison complète : GPT-5.6 et Claude Fable 5

Dimension DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
Open source MIT, auto-hébergement possible Fermé Fermé
Fenêtre de contexte 1M tokens non communiquée 1M tokens
Capacité code Très élevée (proche de Fable 5) Très élevée Meilleure catégorie
Prix sortie API (heures creuses) $0,87/M tokens ~$15/M $50/M
Prix sortie API (heures pleines) $1,74/M tokens
Capacité agent Élevée, orchestration multi-agents Élevée Meilleure catégorie
Confidentialité des données Déploiement privé possible Cloud uniquement Cloud uniquement

Recommandations par scénario :

  • Budget serré, appels fréquents, déploiement privé : V4-Pro ou V4-Flash
  • Excellence code absolue, coût secondaire : Claude Fable 5 (sommet SWE-bench Pro)
  • Algorithmes complexes et mathématiques : GPT-5.6 Sol / Ultra
  • Traitement massif de logs/documents à faible coût : V4-Flash (cache hit dès $0,0028/M)

6. Tarification heures pleines/creuses : optimiser la facture

Changement majeur de la GA : tarification temporelle, sur le modèle de l'électricité. Heures pleines (heure de Pékin) : en semaine de 09h00 à 12h00 et de 14h00 à 18h00 — tarifs doublés.

Modèle Poste Heures creuses (Off-Peak) Heures pleines (Peak)
V4-Pro Entrée (cache hit) ¥0,025 / $0,0035 / 1M ×2
V4-Pro Entrée (cache miss) ¥3,00 / $0,435 / 1M ¥6,00 / $0,87 / 1M
V4-Pro Sortie ¥6,00 / $0,87 / 1M ¥12,00 / $1,74 / 1M
V4-Flash Entrée (cache hit) ¥0,02 / $0,0028 / 1M ×2
V4-Flash Entrée (cache miss) ¥1,00 / $0,14 / 1M ¥2,00 / $0,28 / 1M
V4-Flash Sortie ¥2,00 / $0,28 / 1M ¥4,00 / $0,56 / 1M

Quatre leviers d'économie :

  1. Reporter les tâches non temps réel : traitement batch, annotation et revue de code après 18h00 ou avant 09h00.
  2. Exploiter le cache : prompts système répétés — V4-Flash cache hit à $0,0028/M.
  3. Flash en routage : reconnaissance d'intention simple sur V4-Flash, raisonnement complexe vers V4-Pro.
  4. Surveiller les e-mails de facturation : DeepSeek annonce les changements tarifaires 24 heures à l'avance.

Même en heures pleines, la sortie V4-Pro ($1,74/M) reste 8,6 fois moins chère que Claude Opus 4.8 ($15/M), dans la même proportion que GPT-5.6 Sol (~$15/M).

7. Migration API pour développeurs (échéance 24 juillet)

Avertissement : deepseek-chat et deepseek-reasoner seront définitivement arrêtés le 24 juillet 2026 à 15h59 UTC (24 juillet 23h59 heure de Pékin).

Ancien nom Nouveau nom Remarque
deepseek-chat deepseek-v4-flash (mode non-réflexif) Rapide, tâches légères
deepseek-reasoner deepseek-v4-flash (mode réflexif) ou passage à deepseek-v4-pro pour un raisonnement supérieur

7.1 Cinq étapes de migration

  1. Recherche globale : code, CI et variables d'environnement pour deepseek-chat et deepseek-reasoner.
  2. Mapping par scénario : dialogues légers → deepseek-v4-flash ; ancien reasoner → Flash réflexif ou deepseek-v4-pro.
  3. OpenAI SDK : modifier uniquement model ; mode réflexif via extra_body si besoin.
  4. Planification heures pleines/creuses : cron pour les batch ; prompts système fixes pour le cache.
  5. Validation staging : avant le 24/07, parcours critiques sans anciens noms de modèle.

7.2 Exemple Python (OpenAI SDK)

# Ancien (invalide après le 24/07)
client.chat.completions.create(
    model="deepseek-chat",
    messages=[...]
)

# Nouveau
client.chat.completions.create(
    model="deepseek-v4-pro",          # ou deepseek-v4-flash
    messages=[...],
    # Mode réflexif :
    # extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

7.3 SDK Anthropic (compatible)

V4 prend en charge OpenAI ChatCompletions et Anthropic Messages — base_url inchangé, mettre à jour model :

client = anthropic.Anthropic(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com"
)
message = client.messages.create(
    model="deepseek-v4-pro",
    max_tokens=4096,
    messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)

8. Questions fréquentes

Q : La GA vaut-elle le détour ?
La valeur n'est pas de battre immédiatement Claude Fable 5 ou GPT-5.6, mais d'offrir la meilleure performance open source pour un coût de 1/10 à 1/100 des modèles fermés — avec option d'hébergement privé.

Q : La tarification différenciée est-elle un recul ?
Elle ajoute de la complexité, mais les tarifs hors pointe restent très compétitifs — signe d'une plateforme commerciale mature plutôt que d'une guerre des prix permanente.

Q : Encore sur deepseek-chat ?
Finaliser la migration avant le 24 juillet, sous peine d'interruption de service.

9. Conclusion : la GA comme jalon de l'open source en 2026

DeepSeek V4 GA s'adresse aux entreprises soucieuses de souveraineté des données, aux créateurs au budget maîtrisé, aux ingénieurs agents avec contexte 1M et aux équipes produit en quête de rapport qualité-prix — V4-Pro est aujourd'hui l'option open source la plus complète.

Pour intégrer V4 en local ou sur un VPS, les environnements Windows/Linux croisés manquent souvent de la cohérence Xcode/Metal/mémoire unifiée d'Apple Silicon ; un portable fermé interrompt les batch cron 7×24 et la synchronisation SFTP/rsync du workspace créatif. Un Mac distant Apple Silicon toujours actif stabilise la planification heures pleines/creuses, les pipelines agents et la validation de migration avant le 24 juillet — voir aussi l'inférence V4-Flash locale sur Mac. SFTPMAC location de Mac distant fournit des nœuds macOS natifs à faible latence pour finaliser la bascule API et les pipelines agents dans la fenêtre de migration.

Sources : Documentation officielle DeepSeek · arXiv:2606.19348 · pages modèles HuggingFace · LLMReference · Artificial Analysis · MangoMind Blog