Pourquoi DeepSeek relève-t-il ses tarifs API jusqu'à 1 100 % — juste après l'offensive chinoise des poids ouverts ?
En cinq jours, trois laboratoires chinois ont joué des partitions qui, lues trop vite, se contredisent. DeepSeek relève certains paliers d'API jusqu'à 1 100 %. Alibaba, la même semaine, ouvre les poids d'un phare à 2,4 billions de paramètres qu'il n'avait jamais publié. Zhipu livre GLM-5.3 et multiplie d'environ 6× ses scores de code — sur le même socle que le prédécesseur, sans réentraîner le fondement. Ensemble, ces trois gestes disent autre chose qu'une simple guerre du moins-disant : les laboratoires chinois cessent de se battre uniquement sur le prix pour se battre sur le pouvoir de tarifer.
1. Trois pièges de décision : titres, réflexe du moins cher, portable en veille
Un studio de motion design à Lyon, une équipe produit à Montréal, un collectif d'agents Cursor à Paris : tous ont lu le même chiffre, 1 100 %, et beaucoup ont conclu trop tôt. Le risque n'est pas d'ignorer la hausse. Il est de la mal dimensionner, puis de la faire payer par un poste qui s'endort au moment où Pékin devient bon marché.
- Traiter « 11× », « 1 100 % » et « 350 % » comme une seule et même hausse : les trois sont exacts, mais ils décrivent des lignes de facturation distinctes — entrée en cache hit, sortie, entrée en cache miss. Les confondre fausse la facture d'un ordre de grandeur.
- Supposer que l'API officielle DeepSeek reste toujours la moins chère : aux heures de pointe, le tarif catalogue de DeepSeek dépasse désormais plusieurs revendeurs (GMI Cloud, Novita et d'autres affichent aujourd'hui le V4 Pro sous le nouveau pic officiel). « Modèle chinois = modèle le moins cher » n'est plus un défaut sûr.
- Lancer des évaluations d'agents sensibles à la pointe sur un portable qui s'endort : l'annonce demande explicitement un ordonnancement plus souple. Un capot fermé pendant les heures creuses de Pékin, c'est acheter les heures chères par inadvertance — surtout lorsque le flux créatif (montage, itération Cursor, essais de poids ouverts) se prolonge la nuit.
2. Chronologie : ce qui s'est passé, et quand
| Date | Événement |
|---|---|
| 16 juillet 2026 | Moonshot AI ouvre les poids de Kimi K3 (2,8 T de paramètres), attirant l'attention des autorités de sécurité américaines |
| 2–3 août 2026 | Alibaba prévisualise, puis lance, Qwen3.8-Max en API hébergée |
| 10 août 2026 | Meta publie Muse Glimmer (30 B, Apache 2.0) et évoque des poids ouverts pour le phare Muse Spark 1.2 |
| 12 août 2026 | Alibaba publie les poids ouverts Qwen3.8-2.4T-A95B sur Hugging Face/ModelScope ; xAI livre Grok 4.6 |
| 13 août 2026 | DeepSeek-V4-Pro passe en GA et annonce une hausse effective le 17 août ; Google livre Gemini 3.7 Flash à tarif réduit |
| 14 août 2026 | Zhipu livre GLM-5.3, en réutilisant le socle 743 B de GLM-5.2 |
| 17 août 2026, 00 h 00 heure de Pékin | La nouvelle grille DeepSeek entre en vigueur |
Reculez d'un cran et le tableau s'enrichit : le 30 juillet, OpenAI a baissé le palier le moins cher (GPT-5.6 Luna, −80 %), puis les 6–7 août a fait de Luna le défaut gratuit, avec des conversations texte illimitées. Autrement dit, pendant que les laboratoires chinois relevaient leurs tarifs et ouvraient des poids-phares, les laboratoires américains coupaient les prix et passaient au gratuit côté grand public — au même moment. Ce n'est pas un hasard ; ce sont les deux faces d'une même bataille tarifaire. Lectures produit déjà publiées : lancement de Qwen3.8-Max, benchmarks officiels V4-Flash, et baisse de 80 % de GPT-5.6 Luna.
3. Les chiffres : ce qui a réellement changé
Hausse DeepSeek, palier par palier (effective le 17 août, 00 h 00 heure de Pékin ; heures de pointe : 9 h–12 h et 14 h–18 h, heure de Pékin)
| Poste (par million de tokens) | Ancien tarif | Nouveau, heures creuses | Nouveau, heures de pointe | Hausse en pointe |
|---|---|---|---|---|
| V4-Flash cache hit (entrée) | ¥0.02 | ¥0.05 | ¥0.10 | ~400 % |
| V4-Flash cache miss (entrée) | ¥1.0 | ¥1.5 | ¥3.0 | 200 % |
| V4-Flash sortie | ¥2.0 | ¥4.5 | ¥9.0 | 350 % |
| V4-Pro cache hit (entrée) | ¥0.025 | ¥0.15 | ¥0.30 | ~1 100 % |
| V4-Pro cache miss (entrée) | ¥3.0 | ¥4.5 | ¥9.0 | 200 % |
| V4-Pro sortie | ¥6.0 | ¥13.5 | ¥27.0 | 350 % |
Le « 1 100 % » que tout le monde a cité s'applique précisément au tarif d'entrée en cache hit aux heures de pointe — le palier qui commençait le plus près de zéro. La sortie, qui pèse davantage sur la plupart des factures réelles, a augmenté de 350 %. Une modélisation indépendante par des analystes tiers montre qu'une charge lourde réaliste (environ 84 millions de tokens par mois, surtout en heures creuses, moitié en cache hit) voit une hausse de facture plus proche de 1,8× — réelle, mais loin des titres les plus effrayants.
Qwen3.8-2.4T-A95B (poids ouverts de Qwen3.8-Max) : spécifications clés
| Spécification | Détail |
|---|---|
| Paramètres | 2,4 T au total, 95 B actifs par token (MoE, 512 experts, 10 routés + 1 partagé) |
| Fenêtre de contexte | 262 144 tokens natifs (point de contrôle ouvert), extensible à ~1,01 M ; la version Max hébergée vaut 1 M par défaut |
| Cadence de sortie | Aperçu le 2 août → API en ligne le 3 août → poids ouverts le 12 août |
| Tarif API (international) | 2 $ / M en entrée, 6 $ / M en sortie |
| Licence | Pas Apache 2.0 — une « Qwen3.8-Max License » sur mesure |
| Pourquoi c'est important | Première fois qu'Alibaba ouvre les poids d'un modèle de palier Max (phare) ; Qwen3.5/3.6/3.7 Max sont restés API uniquement |
GLM-5.3 face à GLM-5.2 : même modèle de base, post-entraînement seulement
| Benchmark | GLM-5.2 | GLM-5.3 | Écart |
|---|---|---|---|
| Terminal-Bench 3.0 | 4,6 % | 28,3 % | +23,7 pts |
| DeepSWE v1.1 | 46,2 % | 66,9 % | +20,7 pts |
| Agents' Last Exam (CLI) | 23,8 % | 28,5 % | +4,7 pts |
| CyberGym | 77,2 % | 84,5 % | +7,3 pts |
| AutomationBench | 26,2 % | 48,2 % | +22,0 pts |
Ce sont les chiffres rapportés par Zhipu — aucune relecture tierce indépendante n'a encore été publiée. GLM-5.3 reste derrière GPT-5.6 Sol (34,6 %) et Claude Fable 5 (33,7 %) sur Terminal-Bench 3.0 ; c'est un très bon résultat en poids ouverts, pas une victoire frontière nette.
4. Trois stratégies, trois paris
DeepSeek : du forfait plat à la tarification selon l'heure — un problème de capacité, pas un revirement de doctrine
La lecture la plus paresseuse consiste à dire : « le modèle chinois le moins cher a enfin cédé à la pression des marges. » Observez la structure et l'inverse se dessine : une entreprise qui, pour la première fois, rend visibles ses contraintes de calcul dans la grille. L'ancien tarif plat, toujours bas, fonctionnait comme un outil d'acquisition tant que la capacité GPU suivait la demande. Une fois l'usage devenu exponentiel et la capacité non, quelque chose devait devenir explicite — et « encourager un ordonnancement plus souple des charges », dans le communiqué officiel, est le langage d'entreprise pour « notre compute de pointe est désormais rare, veuillez déplacer vous-mêmes la charge ».
Un détail que la couverture internationale a largement manqué : aux heures de pointe, le tarif officiel de DeepSeek dépasse désormais plusieurs revendeurs tiers (GMI Cloud, Novita et d'autres affichent aujourd'hui le V4 Pro sous le nouveau pic DeepSeek). L'idée que « l'API officielle est toujours le chemin le moins cher pour faire tourner DeepSeek » — un pilier de sa réputation — est brisée pour la première fois.
Alibaba : les poids ouverts achètent la bienveillance de l'écosystème ; une licence sur mesure protège le plafond de revenus
L'ouverture de Qwen3.8-Max n'est pas un geste de générosité simple. Alibaba a fait deux choses à la fois : publier le point de contrôle complet à 2,4 T de paramètres en téléchargement libre, et y attacher une licence sur mesure — pas l'Apache 2.0 permissive des Qwen plus petits — qui exige de toute activité « Model-as-a-Service » ou « AI Work Assistant » gagnant plus de 50 millions de dollars sur une période de 12 mois de négocier une licence commerciale séparée, et qui impose aux produits à 100 millions d'utilisateurs actifs mensuels ou plus, ou 20 millions de dollars et plus de chiffre d'affaires mensuel, d'afficher clairement le nom du modèle.
La logique : offrir les poids pour gagner l'esprit des développeurs (surtout à l'international, où « modèle made in China » hésite encore chez certains acheteurs d'entreprise), tout en gardant un levier tarifaire sur la poignée de sociétés réellement capables de bâtir une inférence concurrente par-dessus. C'est un pari matériellement différent de celui de Muse Glimmer de Meta, qui part sous Apache 2.0 sans restriction — « poids ouverts » ne signifie pas la même chose d'une publication à l'autre.
Une rumeur à tuer nettement : des propos ont circulé selon lesquels la licence Alibaba interdirait les téléchargements depuis les États-Unis, l'UE, le Royaume-Uni et la Corée du Sud. C'est faux. Le texte publié ne contient aucune clause géographique ou territoriale d'aucune sorte — rappel utile, dans un cycle de sorties aussi rapide, que vérifier la source primaire (le fichier LICENSE, pas le fil d'annonce) prend quelques secondes et évite de répéter une affirmation déjà démentie.
GLM-5.3 : pas de nouveau socle, seulement un plus grand pari de post-entraînement — et c'est là l'histoire
Le fait le plus intéressant de GLM-5.3 n'est pas le score, c'est la méthode : même socle à 743 milliards de paramètres que GLM-5.2, aucun réentraînement, et un saut d'environ 6× sur Terminal-Bench 3.0 (4,6 % → 28,3 %) uniquement en intensifiant les environnements d'apprentissage par renforcement au post-entraînement. Cela confirme une tendance qui se construit depuis des mois dans toute l'industrie : à mesure que les lois d'échelle du préentraînement montrent des rendements décroissants, l'échelle du RL de post-entraînement devient un levier de performance indépendant, avec un plancher de coût bien plus bas que le réentraînement d'un nouveau modèle de fondation. La barrière d'entrée s'abaisse réellement — et c'est pourquoi des laboratoires de milieu de tableau, sans budget compute à l'échelle d'OpenAI, peuvent encore refermer l'écart sur les benchmarks agents et de code.
5. Face à face : DeepSeek reste-t-il le modèle frontière le moins cher ?
| Modèle | Entrée (par million de tokens) | Sortie (par million de tokens) | Poids ouverts ? |
|---|---|---|---|
| DeepSeek V4-Pro (pointe) | ¥9.0 (~1,26 $) | ¥27.0 (~3,78 $) | Non |
| DeepSeek V4-Pro (heures creuses) | ¥4.5 (~0,63 $) | ¥13.5 (~1,89 $) | Non |
| Qwen3.8-Max (API internationale) | 2,00 $ | 6,00 $ | Oui (licence sur mesure) |
| OpenAI GPT-5.6 Luna | 0,20 $ | 1,20 $ | Non |
| Claude Opus 5 (implicite, selon le ratio de comparaison d'Alibaba) | ~5,00 $ | ~25,00 $ | Non |
Conversion yuan–dollar à ~¥7.15 / 1 $, approximative. La réponse courte : non. Même après la hausse, le tarif heures creuses de DeepSeek V4-Pro reste bien sous Claude Opus 5, mais ce n'est plus l'option la moins chère sur la table — le tarif international de Qwen3.8-Max comme Luna d'OpenAI sous-cotent désormais le tarif heures creuses de DeepSeek. « Modèle chinois = modèle le moins cher » valait pour l'essentiel de 2025 et du début 2026 ; ce n'est plus une hypothèse sûre.
6. Ce qui reste contesté ou non vérifié
- Le titre « 1 100 % » est techniquement exact, mais trompeur sans contexte. Il ne s'applique qu'au tarif d'entrée en cache hit aux heures de pointe, le palier qui commençait le plus près de zéro. La sortie — le coût qui domine la plupart des factures réelles — a augmenté de 350 %. Différents médias ont cité différents paliers comme s'ils racontaient toute l'histoire.
- Les affirmations selon lesquelles Qwen3.8-Max tournerait sur les puces internes Zhenwu M890 d'Alibaba (rapportées par plusieurs titres financiers chinois comme preuve d'une pile d'inférence entièrement en silicium domestique) n'ont pas été confirmées de façon indépendante par la documentation technique d'Alibaba ni par des benchmarks tiers. Traitez cela comme un reportage adjacent au fournisseur, non vérifié, jusqu'à confirmation.
- La découverte rapportée par GLM-5.3 d'une « vulnérabilité grave » dans Cursor vient du reportage de VentureBeat et de la divulgation de Zhipu ; les détails techniques précis de la vulnérabilité n'ont pas été rendus publics, aussi la revendication doit-elle se lire comme une trouvaille de sécurité issue du fournisseur, non auditée de façon indépendante.
- Les reports selon lesquels le ministère chinois du Commerce préparerait des contrôles d'exportation de rétorsion sur les technologies IA et semi-conducteurs restent spéculatifs et sourcés à des articles non confirmés, non à une annonce officielle. Traitez-les comme un arrière-plan, non comme un fait établi.
7. Pourquoi cela compte : deux guerres des prix en parallèle
Replacez l'épisode dans le cadre plus large et un motif apparaît. Depuis environ un mois, les laboratoires chinois de premier plan enchaînent les sorties à un rythme que la presse financière intérieure a commencé à appeler « trois mises à jour de modèles par semaine » (一周三更) — DeepSeek, Alibaba et Zhipu, plus Kimi K3 de Moonshot (poids ouverts le 16 juillet, 2,8 T de paramètres) et MiniMax H3 avant eux. La couverture chinoise cadre largement cela comme des publications en poids ouverts qui « forcent une revalorisation mondiale de l'industrie de l'IA » — un cadrage plus assertif que la plupart des lectures anglophones des mêmes événements.
Pendant ce temps, les laboratoires américains jouent l'inverse côté grand public : OpenAI a coupé de 80 % son palier le moins cher (30 juillet) puis a rendu ce modèle gratuit et illimité pour tous une semaine plus tard (6–7 août) ; Google a livré un modèle orienté code à la moitié du prix de son prédécesseur vieux de trois semaines (13 août). Ainsi, tandis que les laboratoires chinois ouvrent des poids-phares et introduisent une tarification étagée, plus élevée, sur le haut de gamme contraint en compute, les laboratoires américains courent vers le gratuit et le bon marché à l'entrée consommateur. Les deux stratégies sont réelles ; elles optimisent simplement des étages différents de l'entonnoir.
Il y a aussi une couche géopolitique à nommer avec soin. L'ouverture de Kimi K3 par Moonshot en juillet a déjà attiré l'attention des autorités de sécurité américaines ; le choix d'Alibaba d'ouvrir, dans cette fenêtre précise, un phare à 2,4 T a été lu par certains analystes comme une manière de verrouiller l'esprit international et un récit de « parité technologique » avant un éventuel resserrement réglementaire. C'est une interprétation informée, non un fait confirmé — mais c'est une part du contexte difficile à voir si l'on ne lit que la presse technique anglophone, qui a largement couvert ces sorties comme des nouvelles produit isolées plutôt que comme un motif national coordonné.
8. Cinq étapes : recalculer la facture et rerouter
- Séparer les lignes du titre : 1 100 % concerne l'entrée V4-Pro en cache hit aux heures de pointe. La sortie est à 350 %. L'entrée en cache miss est à 200 %. Alignez la ligne officielle avant de changer le routage.
- Découper les 30 derniers jours selon l'heure de Pékin : la pointe est 9 h–12 h et 14 h–18 h. Votre part de pointe décide si vous voyez ~1,8× ou le multiple des titres.
- Estimer le taux de cache hit : une charge lourde, surtout en heures creuses, à moitié en hit, a été modélisée autour de 1,8×. La pointe plus un faible taux de hit, c'est là que les titres deviennent réels.
- Lire la licence Qwen avant de livrer : l'usage personnel et interne convient. Un MaaS / AI Work Assistant au-delà de 50 millions de dollars sur une fenêtre de 12 mois exige une licence commerciale séparée. 100 millions d'utilisateurs actifs mensuels ou plus, ou 20 millions de dollars et plus de chiffre d'affaires mensuel, doivent afficher le nom du modèle. Aucune interdiction géographique n'existe.
- Placer le travail reportable sur un Mac distant toujours allumé : les lots et les évaluations d'agents de nuit doivent manquer la pointe de Pékin. Un portable en veille ne tient pas cette fenêtre — surtout si le même nœud doit aussi porter Cursor, un essai de poids ouverts ou une chaîne créative native Apple Silicon.
9. Matrice de décision pour l'hôte d'évaluations en heures creuses
| Option | Convient à | Limite principale | Adéquation pointe / heures creuses |
|---|---|---|---|
| Portable personnel | Lire l'annonce, éditer les routes, courts tests de fumée | La veille interrompt la fenêtre creuse ; dérive de fuseau face à la pointe de Pékin | Brouillon seulement — pas de lot de nuit |
| VM Linux cloud générique | Lot API uniquement, régression sans interface | Pas de pile native macOS / Cursor / Xcode | Correct côté serveur en heures creuses, faible pour les évaluations d'outillage Apple |
| Mac Apple Silicon distant SFTPMAC | Évaluations d'agents calées sur Pékin, Cursor / OpenClaw, essais de poids ouverts | Prévoir le forfait et la bande passante | Toujours allumé + sync SFTP, conçu pour absorber les tarifs creux |
10. FAQ
DeepSeek reste-t-il moins cher que GPT-5.6 ou Claude après la hausse ?
Son tarif heures creuses reste moins cher que Claude Opus 5, mais ce n'est plus l'option unique la moins chère dans l'ensemble — le GPT-5.6 Luna d'OpenAI (0,20 $ / 1,20 $ par million de tokens) et le tarif international Qwen3.8-Max d'Alibaba (2 $ / 6 $) sous-cotent désormais les nouveaux tarifs heures creuses de DeepSeek sur au moins une dimension. DeepSeek reste relativement bon marché pour un modèle de classe frontière, simplement plus le moins cher tout court.
Puis-je utiliser gratuitement les poids ouverts Qwen3.8-Max d'Alibaba dans un produit commercial ?
Oui, pour la plupart des cas d'usage — les projets personnels et l'usage interne en entreprise ne sont pas affectés. La réserve ne s'applique que si vous exploitez une activité « Model-as-a-Service » ou « AI Work Assistant » ayant gagné plus de 50 millions de dollars sur une période de 12 mois consécutifs ; ce palier exige une licence commerciale séparée auprès d'Alibaba.
Qwen3.8-Max est-il interdit ou restreint pour les utilisateurs des États-Unis, de l'UE ou du Royaume-Uni ?
Non. Cette affirmation a circulé en ligne mais elle est fausse — la licence publiée ne contient aucune restriction géographique d'aucune sorte. Les restrictions sont liées au chiffre d'affaires (au montant que gagne votre service), et non au lieu où vous ou vos utilisateurs vous trouvez.
Qu'est-ce qui change vraiment entre GLM-5.3 et GLM-5.2 ?
Rien au niveau du modèle de base — les deux utilisent le même modèle de fondation à 743 milliards de paramètres. Les gains de performance (environ 6× sur Terminal-Bench 3.0) viennent entièrement de l'intensification de l'apprentissage par renforcement pendant le post-entraînement, sans réentraînement du modèle de base.
Meta va-t-elle vraiment ouvrir les poids de son modèle phare, et pas seulement le plus petit Muse Glimmer ?
Pas encore. Muse Glimmer est un modèle distillé de 30 milliards de paramètres, pas le vrai phare de Meta. Le PDG Mark Zuckerberg a indiqué que les poids ouverts du Muse Spark 1.2, plus vaste et encore fermé, arriveraient « bientôt », ce qui — si cela se produit — en ferait le premier modèle américain de classe phare publié ouvertement. Au moment de la rédaction, cette publication n'a pas eu lieu ; traitez-la comme une intention déclarée, non comme un fait confirmé.
Sources : annonce tarifaire officielle de DeepSeek, recoupée avec Wall Street CN, IT Home, AIGC.cn et les discussions communautaires V2EX ; dépôts officiels des modèles Qwen d'Alibaba (Hugging Face / ModelScope) et le reportage du South China Morning Post sur les termes de licence ; page technique officielle GLM-5.3 de Zhipu (Z.ai), plus la couverture VentureBeat et StableLearn ; blog officiel de Meta AI Research et la couverture VentureBeat de Muse Glimmer ; titres financiers chinois (Yicai/第一财经, Sohu Finance) sur le rythme et le cadrage du cycle chinois des poids ouverts. Les tarifs, termes de licence et chiffres de benchmark reflètent les informations publiquement disponibles à la date de publication. Vérifiez les derniers tarifs et termes de licence officiels avant toute republication, et notez que les détails signalés ci-dessus comme non vérifiés (revendications de puces domestiques, le report de vulnérabilité Cursor, et les rumeurs de contrôles d'exportation) n'ont pas été confirmés de façon indépendante.
11. Ce que vaut le reparamétrage — et où le portable échoue encore
La chronologie, les trois tableaux de données et les tarifs face à face suffisent à une décision : séparer le titre par ligne de facturation, puis recalculer contre votre part de pointe de Pékin et votre taux de cache hit. Les poids ouverts ne sont pas un far west tant que la licence n'a pas été lue.
Les limites sont tout aussi nettes. Les scores GLM-5.3 sont rapportés par le fournisseur. Zhenwu M890, la revendication de vulnérabilité Cursor et les rumeurs de contrôles d'exportation restent non vérifiés. Le change est une estimation à ~¥7.15 / 1 $. Une couverture n'est pas un substitut à votre propre découpe de trafic et à votre revue de licence.
Si l'étape suivante consiste en lots de nuit, en courses d'agents calées sur Pékin, ou à essayer les poids ouverts Qwen dans Cursor / OpenClaw — pour un flux de développement autant que pour un atelier créatif sous macOS —, un portable qui s'endort est la manière de rater les heures bon marché. Placez l'ordonnanceur sur un Mac Apple Silicon distant toujours allumé et synchronisez le dépôt d'évaluation par SFTP/rsync. La location de Mac distant SFTPMAC offre un macOS natif, une collaboration à faible latence et une disponibilité 24 h/24 — un meilleur lieu pour transformer ce basculement tarifaire en un changement de routage reproductible.