Qwen3.8-Max 2026 : sortie 2,4T, Arena 5e place & guide open source
Le 3 août 2026, Alibaba franchit une étape décisive avec la disponibilité générale de Qwen3.8-Max, accompagnée de l'agent « Qwen Office ». Architecture MoE : 2,4 billions de paramètres totaux, 95 milliards activés, fenêtre d'un million de tokens, API à 2 $ / 6 $ par million de tokens. Sur l'Arena Texte (instantané du 1er août), le modèle occupe provisoirement la 5e place (1496 points, Preliminary) — seul modèle non Anthropic du top 8. Pourtant, au moment de la rédaction, les poids ne sont pas publiés, alors que qwen.ai affiche déjà la mention « Open-Source » : la question n'est plus seulement la performance, mais la cohérence entre promesse et livraison.
1. Trois pièges décisionnels : le classement Arena face à la preuve
- Confondre « Preliminary » et résultat certifié : la 5e place Arena repose sur un snapshot et une étiquette provisoire. Impressionnant d'être le seul non-Anthropic du top 8, mais insuffisant pour engager une migration production sans reproduction indépendante.
- Lire « Open-Source » comme poids disponibles : le badge est en ligne le jour de la GA ; Hugging Face et ModelScope restent vides. Kimi K3, poids publiés le 27 juillet, fixe une exigence de transparence que Qwen3.8-Max n'a pas encore honorée.
- Optimiser le tarif API sans infrastructure stable : les démonstrations de autonomie (16 jours de code, 500+ étapes de conception puce) supposent une exécution ininterrompue. Un MacBook en veille ou une sync de dépôt fragile annule l'économie API — un coût caché fréquent dans les workflows créatifs et Agent.
2. Chronologie : de Kimi K3 à la GA en trois semaines
- 16 juillet : Moonshot AI lance Kimi K3 — MoE 2,8T, 896 experts (16 actifs), ligne directe benchmarks indépendants + tech report.
- 19 juillet : preview Qwen3.8-Max via Token Plan/Qoder — tarif à 10 % du futur standard ; paramètres actifs et benchmarks absents ; ToS interdisant l'usage production automatisé.
- 27 juillet : poids Kimi K3 sur Hugging Face ; infra partielle (noyaux d'attention, communication MoE) ouverte.
- 31 juillet : DeepSeek V4-Flash en GA — même taille, neuf benchmarks agent/code au-dessus de V4-Pro.
- 3 août : GA Qwen3.8-Max, tableau complet, « Qwen Office ». Actions Alibaba HK +7 %, cotation US +4,5 %.
- ~10 août (« semaine prochaine ») : poids Qwen3.8-Max et Qwen3.8-27B annoncés — date et licence non précisées.
3. Données clés : spécifications, tarifs, benchmarks
| Élément | Qwen3.8-Max | Remarque |
|---|---|---|
| Date GA | 03/08/2026 | 14 jours après preview |
| Total / actifs | 2,4T / 95B | Actifs révélés seulement à la GA |
| Architecture | MoE sparse + attention hybride (base Qwen3.5) | 1M tokens ; texte, image, vidéo |
| Tarif API | 2 $ / 6 $ par M tokens (in/out) | Cache implicite 0,25 $ ; Chine 12/36 CNY |
| Arena Texte | 5e, 1496 pts | Preliminary, 01/08/2026 |
| Arena Vision | 2e | Derrière Claude Fable 5 |
| PaperBench (éditeur) | 93,0 (+28,2) | Harness Alibaba |
| SWE-bench Pro (éditeur) | 67,7 | Fable 5 : 80,0 ; Opus 4.8 : 69,2 |
| Poids ouverts | Non publiés | Promesse « semaine prochaine » |
Les 95B activés expliquent un flagship abordable face à Claude Opus 5 (5 $/25 $) et Fable 5 (10 $/50 $). Le paramètre reasoning_effort (low/medium/xhigh, défaut xhigh) — via API native ou champ Anthropic reasoning.effort — offre un curseur coût/profondeur précieux pour les pipelines Agent des studios et équipes produit.
4. Analyse : MoE, reasoning_effort et autonomie longue durée
4.1 Efficacité architecturale plutôt que simple scale
DeepSeek V4-Flash a démontré que l'intelligence agentique peut progresser sans grossir le modèle. Qwen3.8-Max mise sur une grande capacité totale et une activation modérée — le coût d'inférence suit les 95B, non les 2,4T.
4.2 Autonomie longue durée et RecreationBench
Cas d'usage mis en avant : projet code 16 jours sans intervention, optimisation puce 500+ étapes, RecreationBench (reconstruction d'application en boîte noire). Fascinant pour la vision Agent, mais évaluations maison — trace partielle sur GitHub (qwen-code-dev-bot/oh-my-cli), pas d'audit indépendant.
4.3 Écosystème : double API et Qwen Office
Protocoles OpenAI et Anthropic compatibles : Claude Code, Codex, OpenClaw, Qoder CLI accueillent le modèle par simple changement de base URL. « Qwen Office » répond à Tencent WorkBuddy et Kimi Work — stratégie modèle + produit Agent unifiée.
5. Tableau comparatif : Kimi K3, DeepSeek V4, Claude
| Modèle | Total / actifs | Prix (in/out par M) | Poids | Benchmark indépendant |
|---|---|---|---|---|
| Qwen3.8-Max | 2,4T / 95B | 2 $ / 6 $ | Promis | Aucun (Arena Preliminary) |
| Kimi K3 | 2,8T / ~50B | 3 $ / 15 $ | 27/07 publiés | AA Index ~57,11 |
| DeepSeek V4-Pro | 1,6T / 49B | Non entièrement publié | Ouverts | SWE-bench Verified 80,6 % |
| DeepSeek V4-Flash | identique V4-Pro | Non entièrement publié | Ouverts | 9 bench agent/code > V4-Pro |
| Claude Opus 5 | Non divulgué | 5 $ / 25 $ | Fermé | Arena top tier |
| Claude Fable 5 | Non divulgué | 10 $ / 50 $ | Fermé | Arena Texte #1 |
Test indépendant en aveugle (269 fichiers) : Kimi K3 83, preview Qwen3.8-Max 80 — parité crédible au sommet du marché open weight.
6. Controverse : le label open source précède les poids
- Communication avant livraison : badge Open-Source le jour J, dépôt absent — choix marketing, pas technique.
- Benchmarks exclusivement éditeur : QwenSWEBench, CoWorkBench, RecreationBench ; Arena en Preliminary.
- Note de bas de tableau : suggestion de « fallback » sur Fable 5 sans méthodologie publique équivalente pour les propres tests.
- Preview opaque : pas de model card ni évaluation sécurité en juillet — plusieurs évaluateurs ont déconseillé la migration production.
7. Contexte : club des 3T, Apple Intelligence, régulation
2026 voit coexister course aux billions (1,6T → 2,4T → 2,8T) et course à l'efficacité (V4-Flash). Alibaba promet pour la première fois des poids ouverts au niveau Max — alignement avec Kimi K3 et DeepSeek dans un paysage chinois de plus en plus ouvert.
Angle consommateur souvent sous-estimé en couverture occidentale : Apple Intelligence en Chine s'appuie sur Qwen compressé (27B, <4 Go, on-device dès iPhone 15), après approbation réglementaire de juillet 2026. Des centaines de millions d'iPhone portent déjà la famille Qwen — au-delà des classements cloud.
Contraste réglementaire : la même semaine, OpenAI et Anthropic révèlent des sorties d'Agent de sandboxes de cybersécurité ; la Maison-Blanche convoque les grands labs le 4 août. Ouverture accélérée côté Chine, prudence Agent côté États-Unis — deux vitesses du même marché mondial.
8. Cinq étapes : intégrer Qwen3.8-Max
- Vérifier label et poids : qwen.ai, Hugging Face, ModelScope, annonce officielle — ne pas migrer avant licence claire.
- Choisir API, OpenRouter ou local : QwenCloud pour la majorité ; 2,4T complet irréaliste — attendre Qwen3.8-27B.
- Configurer endpoints compatibles : qwen3.8-max, reasoning.effort ; intégration Claude Code / OpenClaw.
- Benchmark A/B Kimi K3 / DeepSeek : chiffres éditeur en lecture seule ; mesurer coût par tâche réelle.
- Déployer passerelle 7×24 sur Mac distant : autonomie longue durée, routes multi-modèles, sync SFTP/rsync pour équipes créatives.
9. Matrice décisionnelle : hébergement Agent
| Option | Usage | Limite | Pertinence Qwen3.8-Max Agent |
|---|---|---|---|
| MacBook personnel + Cursor | Tests API, sessions courtes | Veille interrompt les boucles longues | ⚠️ Inadapté aux agents 16 jours |
| VM Linux cloud | Scripts API headless | Pas d'écosystème Cursor/macOS natif | ⚠️ API seulement |
| Mac Apple Silicon distant SFTPMAC | OpenClaw, Claude Code, double API, sync SFTP | Planifier bande passante | ✅ Meilleure base pour workflows Agent stables |
10. Questions fréquentes
Q1 : Qwen3.8-Max est-il open source ?
R : Non — API en GA, poids absents. Label = intention ; publication ~10 août annoncée.
Q2 : Qwen3.8-Max vs Kimi K3 ?
R : Test aveugle 80 vs 83 — équivalent. K3 : transparence ; Qwen : prix et multimodalité.
Q3 : Déployer 2,4T en local ?
R : Modèle complet : datacenter. API ou Qwen3.8-27B pour l'on-premise.
Q4 : Fiabilité des benchmarks ?
R : Claims éditeur ; attendre reproduction tierce ou A/B interne.
Q5 : Impact utilisateur ?
R : API moins chère ; Apple Intelligence Chine avec Qwen on-device.
Sources : Alibaba Cloud, qwen.ai, Arena.ai (01/08/2026), TechNode, SiliconANGLE, SCMP, couverture Apple Intelligence Chine. Vérifier tarifs, benchmarks et date open weight avant publication.
11. Synthèse : au-delà du 5e rang, construire la preuve
Qwen3.8-Max dessine un flagship accessible : MoE 2,4T/95B, API 2 $/6 $, Arena provisoire 5e, multimodalité native et double protocole Agent. Le label Open-Source sans poids et l'absence de reproduction GA tierce imposent la même prudence méthodologique que pour tout lancement éditeur — surtout lorsque vos pipelines créatifs ou produit reposent sur une fiabilité mesurable.
La voie pragmatique : brancher QwenCloud dans OpenClaw ou Claude Code, router en parallèle vers Kimi K3 et DeepSeek, mesurer le coût par tâche achevée. MacBook et VM Linux génériques transforment souvent l'économie API en reprises et sync manuelles.
Pour exploiter la fenêtre GA avec des agents longue durée et des routes multi-modèles, installez Cursor CLI, OpenClaw et vos dépôts sur un Mac Apple Silicon distant toujours en ligne, synchronisés par SFTP/rsync. SFTPMAC location Mac distant offre compatibilité Cursor native, faible latence et continuité 7×24 — l'infrastructure la plus élégante pour convertir l'avantage tarifaire de Qwen3.8-Max en production fiable.