Kimi K3 open weight : 2,8T paramètres, 1M de contexte et guide licence pour l'industrie créative
Le soir du 27 juillet 2026, Moonshot AI a mis en ligne les poids complets de Kimi K3, son rapport technique, et ouvert MoonEP, FlashKDA et AgentEnv — seulement 11 jours après le lancement API. Environ 1,56 To sur Hugging Face (format MXFP4), K3 devient le premier modèle de classe 3 billions entièrement distribué. Moonshot parle d'open weight, jamais d'open source. Pour les studios de production, agences créatives et équipes produit qui cherchent un copilote code fiable sans dépendre d'un seul fournisseur fermé, ce guide clarifie licence, architecture et choix API vs auto-hébergement.
1. Trois pièges que rencontrent studios et agences
- Confondre open weight et open source : La presse traduit souvent par « open source ». Moonshot utilise exclusivement open weight dans ses documents officiels. Poids et rapport technique sont publics ; données d'entraînement et pipeline complet, non. Pour un studio qui doit justifier ses choix technologiques auprès de clients grands comptes, cette nuance juridique compte autant que la qualité du code généré.
- Croire pouvoir héberger K3 en interne sans supercalculateur : 2,8T paramètres totaux, 104B actifs, 896 experts routés — impossible sur une station de montage ou un MacBook Pro. Moonshot exige au minimum 64 GPU. L'illusion du « téléchargement = souveraineté » se brise face à 1,56 To et à l'infra MoE.
- Négliger le cache API dans le devis client : Tarifs affichés : 3 $/M en entrée, 15 $/M en sortie. L'architecture Mooncake atteint 90 %+ de hits cache sur des charges de code typiques — coût effectif proche de 0,30 $/M en entrée. Sans proof of concept sur vos scripts de production, vous sous-estimez ou surestimez la marge d'un projet IA intégré à un pipeline créatif.
2. Chronologie : de l'API aux poids en 11 jours
- 16 juillet 2026 (veille du WAIC) : Lancement Kimi K3 sur kimi.com, Kimi Work, Kimi Code et l'API — accès en ligne uniquement. Article technique : « Kimi K3: Open Frontier Intelligence ».
- 17 juillet : Analyses sectorielles ; médias chinois le présentent comme le plus grand modèle publié par nombre de paramètres.
- 22–23 juillet : Tensions USA-Chine sur la « distillation ». Michael Kratsios (OSTP) accuse Moonshot de distillation industrielle d'Anthropic Fable ; Scott Bessent évoque sanctions et liste d'entités.
- 27 juillet, 23 h : Poids complets, rapport technique, ouverture de MoonEP et AgentEnv (FlashKDA déjà publié). Hugging Face : #1 trending en moins d'une demi-heure.
- 28 juillet : Réponse du ministère du Commerce chinois ; couverture médiatique des détails open weight. Trois jours plus tard, Alibaba dévoile Qwen3.8-Max-Preview (24T) — la course au « club des 3T » s'accélère.
3. Fiche technique Kimi K3
| Caractéristique | Valeur |
|---|---|
| Paramètres totaux | 2,8 billions (2,8T) |
| Paramètres actifs | ~104 milliards (104B) |
| Architecture | Mixture of Experts (MoE) |
| Experts | 896 experts routés, 16 actifs par token (+ experts partagés) |
| Attention | Kimi Delta Attention (KDA) + Gated MLA |
| Fenêtre de contexte | 1 million de tokens (1M) |
| Multimodal | Vision native (ViT-V2, 27 couches) |
| Format des poids | MXFP4 poids + MXFP8 activations (entraînement quantization-aware dès SFT) |
| Volume | ~1,56 To (Hugging Face, 96 shards safetensors) |
| Licence | Kimi K3 License personnalisée (open weight, pas open source) |
4. Innovations architecture : KDA, AttnRes, Per-Head Muon
K3 ne se contente pas d'empiler des paramètres — il repense attention, résiduels et optimiseur.
Kimi Delta Attention (KDA)
Contrairement à un oubli scalaire uniforme, KDA applique des portes canal par canal : chaque dimension mémorise ou oublie à son rythme. Formule DPLR chunkwise en temps linéaire, KV cache allégé sur longues séquences. Alternance KDA / couches MLA globales — socle du contexte 1M, utile pour ingérer bible de production, storyboards ou bases de assets entiers.
Attention Residuals (AttnRes)
Les connexions résiduelles classiques diluent l'information des premières couches. AttnRes agrège sélectivement les sorties antérieures selon l'entrée — overhead minimal (RMSNorm + pseudo-requête par couche), gain d'efficacité d'entraînement ~25 %.
Per-Head Muon
Optimiseur Muon appliqué individuellement à chaque tête d'attention — convergence adaptée par tête. Invisible côté API, mais explique la performance à 104B paramètres actifs.
896 experts, 16 actifs (~1,8 % de sparsité)
Équilibrage Quantile Balancing ; MoonEP borne théoriquement les experts redondants par nœud — pertinent pour l'inférence multi-GPU en production créative (rendu batch, agents parallèles).
5. Stack infra : MoonEP, FlashKDA, AgentEnv
| Technologie | Rôle | Capacité clé |
|---|---|---|
| MoonEP | Communication MoE fine à l'échelle supernœud | Réplication temporaire d'experts surchargés ; tokens équilibrés par nœud ; borne théorique des experts redondants |
| FlashKDA | Opérateur KDA CUTLASS (déjà open source) | Sur H20 : prefill 1,72–2,22× plus rapide que baseline flash-linear-attention ; remplacement direct chunk_kda |
| AgentEnv | Bac à sable agent avec KVCache.ai (microVM Firecracker) | RL agent à grande échelle ; chiffres Moonshot : checkpoint 133 ms, recovery 49 ms, surcommit mémoire 6,5× (non vérifié indépendamment) |
6. Benchmarks : où se situe K3 face aux modèles fermés
Source : réévaluations tierces (Vals AI, juillet 2026) :
| Modèle | SWE-bench Verified | Date |
|---|---|---|
| Claude Opus 5 | 97 % | 2026-07-24 |
| GPT-5.6 Sol | 96,2 % | 2026-07-09 |
| Claude Fable 5 | 95 % | 2026-06-09 |
| Kimi K3 | 93,4 % | 2026-07-16 |
| Qwen3.7-Max | 79,4 % | 2026-05-19 |
| DeepSeek-V4 | 76,2 % | 2026-04-23 |
Artificial Analysis Intelligence Index (max reasoning) : Fable 5 = 60, GPT-5.6 Sol = 59, Kimi K3 ≈ 57 (3e mondial, 1er open weight), GLM-5.2 = 51.
Coût par tâche : ~0,95 $ — moins cher que Fable 5 (~2,40 $) mais plus que GLM-5.2 (~0,47 $). Pour un studio qui arbitre qualité de code vs marge projet, K3 est le plafond open weight, pas l'option économique. Arena.ai Frontend Code Arena : 1er rang (juillet 2026) — signal fort pour équipes front et outils internes.
7. Open weight, pas open source : le seuil MaaS à 20 M$
Moonshot n'utilise jamais « open source » dans ses supports. La Kimi K3 License remplace le « Modified MIT » par un document sur mesure avec deux seuils commerciaux absents de K2 :
- Seuil revenus MaaS : Si vous exploitez un service model-as-a-service et dépassez 20 M$ de revenus cumulés sur 12 mois, accord commercial séparé avec Moonshot requis.
- Seuil d'affichage : Au-delà de 100 M MAU ou 20 M$ de revenus mensuels, mention « Kimi K3 » obligatoire dans l'interface produit.
Pour agences, studios indépendants et PME créatives, ces seuils restent théoriques. En revanche, toute startup visant à concurrencer Moonshot sur l'hébergement de modèles doit traiter le premier seuil comme ligne rouge juridique.
8. Tarifs API et exigence 64 GPU pour l'auto-hébergement
API officielle : compatible SDK OpenAI (https://api.moonshot.ai/v1, modèle kimi-k3).
| Type de token | Prix par million |
|---|---|
| Entrée (cache hit) | 0,30 $ |
| Entrée (cache miss) | 3,00 $ |
| Sortie (dont raisonnement) | 15,00 $ |
Auto-hébergement : minimum 64 GPU en supernœud. Alternative réaliste : API ou OpenRouter (~7 fournisseurs, tarifs alignés). Voir guide benchmark K3 et tutoriel OpenRouter.
9. WAIC 2026 et toile de fond géopolitique
La publication open weight coïncide avec le WAIC et l'escalade du débat sur la distillation USA-Chine. Moonshot rend publics poids, rapport et trois briques infra — geste de transparence technique face aux accusations politiques. Pour l'industrie créative française et européenne, cela invite à séparer qualité du modèle et risque fournisseur — voir guide distillation.
10. Cinq étapes pour intégrer Kimi K3 dans votre pipeline créatif
- Lire la Kimi K3 License : Vérifier seuils MaaS 20 M$ et MAU 100 M. Le mot « open source » dans la presse n'a pas valeur contractuelle.
- Choisir le canal d'accès : API (officielle ou OpenRouter) pour ~99 % des équipes ; auto-hébergement réservé aux structures avec budget supernœud ; téléchargement des poids pour R&D, pas pour un Mac de montage.
- Configurer le point de terminaison OpenAI : Base URL
https://api.moonshot.ai/v1, modèlekimi-k3— réutiliser SDK OpenAI ou config OpenClaw. - Valider sur vos propres prompts : Taux d'adoption, erreurs, latence P95 sur scripts de prod, shaders, ou agents internes. SWE-bench 93,4 % est un signal marché, pas votre SLA.
- Déployer un gateway Mac distant 7×24 : Pipeline OpenClaw sur nœud macOS toujours actif ;
openclaw channels status --probeen recette ; workspace synchronisé via SFTP/rsync.
11. Matrice de décision : API vs OpenRouter vs auto-hébergement
| Dimension | API officielle | OpenRouter | Auto-hébergement |
|---|---|---|---|
| Coût de démarrage | Faible (changer la base URL) | Faible (une clé, plusieurs modèles) | Très élevé (64 GPU + 1,56 To) |
| Avantage cache | Mooncake 90 %+ hits | Selon fournisseur amont | Cache KV à concevoir |
| Souveraineté des données | Données chez Moonshot | Saut réseau supplémentaire | Local si le hardware suit |
| Profil idéal | Intégration rapide K3 en produit | Routage multi-modèles, fallback | Labos de recherche avec supernœud |
12. Questions fréquentes
Kimi K3 est-il open source ? Non — open weight : poids et infra partielle publics, pipeline d'entraînement non. Hors définition OSI.
Usage commercial gratuit ? Oui dans la plupart des cas. Seuils : MaaS >20 M$ / an ou MAU >100 M / revenus mensuels >20 M$.
Combien de GPU ? Minimum 64 en supernœud. Chemin réaliste : API ou OpenRouter.
Différence avec l'article du 17 juillet ? API le 16.07. ; poids complets + MoonEP/AgentEnv le 27.07. — cet article couvre licence, infra et seuil d'auto-hébergement.
Lien avec la controverse distillation ? Parallèle à la libération des poids — voir guide distillation.
13. Synthèse : plafond open weight, Mac distant pour agents créatifs 7×24
Le 27 juillet transforme la promesse d'un modèle 3T en 1,56 To téléchargeables — avec KDA, AttnRes et MoonEP comme preuves d'ingénierie. Pour la majorité des studios : API ou OpenRouter, évaluation interne, pas de self-hosting sur poste de travail.
L'API seule ne résout pas les coupures de gateway, la veille du Mac de régie ou les échecs de probe OpenClaw. Pour brancher K3 dans OpenClaw/Hermes en assistance code continue, placez gateway et workspace sur un Mac distant Apple Silicon toujours actif, protégé par launchd et synchronisé en SFTP/rsync. SFTPMAC Mac distant est le pont opérationnel — plus fiable qu'un Mac personnel comme passerelle API pour une équipe créative qui traite l'agent comme une infrastructure, pas un gadget.