Kimi K3 est-il open source ? À l'intérieur du modèle 2,8 billions de Moonshot AI
Le soir du 27 juillet 2026, Moonshot AI a mis en ligne les poids complets, le rapport technique et trois briques d'infrastructure de Kimi K3 — un MoE de 2,8 billions de paramètres, ~104 milliards actifs, fenêtre de contexte 1 million de tokens et vision native. Le téléchargement (~1,56 To sur Hugging Face) a atteint la première place du trending en moins de trente minutes.
La réponse courte à la question centrale : non, pas au sens OSI. Moonshot parle systématiquement d'open weight, jamais d'open source. Cet article structure pour les décideurs techniques : la chronologie des 11 jours entre lancement API et release complète ; l'architecture (KDA, AttnRes, Per-Head Muon, Stable LatentMoE) ; l'infra MoonEP/FlashKDA/AgentEnv ; les benchmarks indépendants (SWE-bench 93,4 %, Artificial Analysis ~57) ; les seuils de licence ; les tarifs API. Contexte : revue approfondie Kimi K3, controverse de distillation.
01 Open weight ou open source : ce que Moonshot livre réellement
Selon l'Open Source Initiative, un modèle véritablement open source exige données d'entraînement, code d'entraînement et pipeline reproductible — pas seulement des poids finis. Kimi K3 publie poids, rapport technique et outils infra, mais pas les données ni le code complet d'entraînement. Dans tous ses documents, Moonshot emploie exclusivement open weight.
Trois tensions structurent la lecture pour les équipes produit :
- Écart sémantique. La traduction médiatique « open source » masque une réalité juridique différente — open weight autorise fine-tuning et déploiement, pas reproduction from scratch.
- Licence durcie. Fin du « Modified MIT » de la famille K2 ; document custom avec deux seuils commerciaux inédits.
- Fenêtre de vérification. Entre le 16 juillet (API seule) et le 27 juillet (poids), seules les déclarations officielles comptaient ; la communauté peut désormais auditer l'architecture.
| Dimension | Open weight (Kimi K3) | Open source (standard OSI) |
|---|---|---|
| Poids du modèle | Oui (~1,56 To) | Oui |
| Rapport technique | Oui | Oui |
| Données d'entraînement | Non | Oui |
| Code d'entraînement complet | Non | Oui |
| Usage commercial | Oui, avec seuils | Selon licence |
| Terminologie Moonshot | « Open weight » | Non utilisée |
Télécharger et déployer K3 est désormais possible ; le reproduire entièrement depuis zéro ne l'est pas. C'est la distinction opérationnelle que les équipes juridiques doivent intégrer.
02 Onze jours du lancement API à la release complète
Du premier appel API au dépôt intégral des poids : 11 jours — un délai remarquablement court pour un modèle de cette échelle, et un signal fort envers l'écosystème développeur.
- 16 juillet (veille WAIC 2026) : Kimi K3 sur kimi.com, Kimi Work, Kimi Code et API — inférence en ligne uniquement. Article : « Kimi K3: Open Frontier Intelligence ».
- 17 juillet : Analyses sectorielles ; Xinhua qualifie K3 du plus grand modèle open weight mondial.
- 22–23 juillet : Escalade du différend US-Chine — Michael Kratsios accuse Moonshot de « distillation industrielle » sur Fable ; Scott Bessent évoque sanctions et Entity List.
- 27 juillet (~23h) : Poids complets, rapport technique, MoonEP et AgentEnv (FlashKDA déjà open).
- 28 juillet : Réponse du ministère du Commerce chinois ; couverture médiatique du détail technique.
| Spec | Valeur |
|---|---|
| Paramètres totaux | 2,8 billions (2,8T) |
| Paramètres actifs | ~104 milliards |
| Configuration MoE | 896 experts routés, 16 activés/token (+ experts partagés) |
| Attention | KDA + Gated MLA (hybride) |
| Fenêtre de contexte | 1 000 000 tokens |
| Multimodal | Vision native (ViT-V2, 27 couches) |
| Format des poids | MXFP4 poids + MXFP8 activations (QAT dès SFT) |
| Taille du download | ~1,56 To (Hugging Face) |
Chiffres citables : 2,8T total / 104B actifs ; sparsité MoE 1,8 % ; premier release intégral de classe 3T ; trending Hugging Face #1 en 30 minutes.
03 Architecture : KDA, AttnRes, Per-Head Muon et Stable LatentMoE
Plutôt qu'une simple montée en paramètres, Moonshot a reconstruit trois composants fondamentaux : l'attention, les connexions résiduelles et l'optimiseur.
Kimi Delta Attention (KDA)
Le Gated DeltaNet classique applique un oubli scalaire uniforme. KDA introduit un gating canal par canal : chaque dimension conserve ou oublie à son propre rythme. Formulation chunkwise DPLR — complexité linéaire, efficacité matérielle. Alternance KDA / Gated MLA : clé du contexte 1M à faible empreinte KV cache.
Attention Residuals (AttnRes)
Les résidus standard diluent l'information des premières couches en profondeur. AttnRes remplace l'accumulation uniforme par une agrégation sélective et dépendante de l'entrée. Coût marginal : un RMSNorm et un pseudo-query par couche. Gain annoncé : ~25 % d'efficacité d'entraînement pour moins de 2 % de surcoût.
Per-Head Muon
Extension de l'optimiseur Muon à chaque tête d'attention — convergence plus adaptative. Technique purement training-time, invisible côté API, mais contributive à la performance par paramètre actif.
| Composant | Rôle | Indicateur |
|---|---|---|
| Routing | 896 experts, 16 activés/token | Sparsité 1,8 % |
| Quantile Balancing | Équilibrage sans hyperparamètres heuristiques | Training stable |
| Per-Head Muon | Optimisation par tête | Scalabilité |
| Shared Experts | Stabilité de base | Robustesse MoE |
| Gated MLA | Attention globale sélective | Hybride long contexte |
04 MoonEP, FlashKDA, AgentEnv : l'infra au même titre que les poids
La release ne se limite pas à une fiche modèle. Moonshot a ouvert la stack qui a rendu l'entraînement de K3 possible — un élément déterminant de l'accueil développeur.
| Technologie | Rôle | Métrique clé |
|---|---|---|
| MoonEP | Communication haute performance pour MoE finement granulaire | Duplication temporaire d'experts surchargés ; borne théorique sur experts redondants par rank |
| FlashKDA | Kernel KDA basé CUTLASS (déjà open) | Prefill H20 : 1,72×–2,22× vs flash-linear-attention ; drop-in via chunk_kda |
| AgentEnv | Sandbox microVM Firecracker (co-développé avec KVCache.ai) | Checkpoint 133 ms, reprise 49 ms, surcommit mémoire jusqu'à 6,5× (chiffres Moonshot, non reproduits indépendamment) |
FlashKDA s'intègre comme backend dans flash-linear-attention sans modification de code. AgentEnv vise l'entraînement RL agentique massif avec snapshot et fork rapides.
05 Benchmarks, seuils de licence et arbitrage coût-capacité
Priorité aux évaluations tierces indépendantes.
| Modèle | Score | Release |
|---|---|---|
| Claude Opus 5 | 97,0 % | 2026-07-24 |
| GPT-5.6 Sol | 96,2 % | 2026-07-09 |
| Claude Fable 5 | 95,0 % | 2026-06-09 |
| Kimi K3 | 93,4 % | 2026-07-16 |
| Qwen3.7-Max | 79,4 % | 2026-05-19 |
| DeepSeek-V4 | 76,2 % | 2026-04-23 |
Artificial Analysis Intelligence Index (max reasoning) : Claude Fable 5 — 60 ; GPT-5.6 Sol — 59 ; Kimi K3 — ~57 (#3 mondial, #1 open weight) ; GLM-5.2 — 51 ; DeepSeek V4 Pro — 44. Coût par tâche : K3 ~0,95 $ vs Fable 5 ~2,40 $ (−60 %) vs GLM-5.2 ~0,47 $. En synthèse : plafond de capacité open weight, pas le choix valeur. Arena.ai Frontend Code Arena : K3 en tête.
| Seuil | Condition | Conséquence |
|---|---|---|
| Revenus MaaS | > 20 M$ sur 12 mois glissants (affiliés inclus) | Accord commercial séparé avec Moonshot |
| Attribution / échelle | > 100 M MAU ou > 20 M$ revenus mensuels | Affichage prominent « Kimi K3 » dans l'interface |
Pour startups et PME : sans impact pratique. Pour concurrents MaaS à l'échelle Moonshot : clause à auditer en priorité.
06 API, auto-hébergement, contexte géopolitique, guide en six étapes et FAQ
| Type de token | Prix |
|---|---|
| Entrée (cache hit) | 0,30 $ |
| Entrée (cache miss) | 3,00 $ |
| Sortie (reasoning inclus) | 15,00 $ |
Architecture Mooncake disaggregated : taux de cache hit >90 % sur workloads code — coût effectif proche de 0,30 $. Auto-hébergement : 64+ accélérateurs recommandés ; matériel grand public exclu. OpenRouter : sept hébergeurs, tarifs alignés.
Contexte US-Chine : release pendant WAIC 2026, au cœur du différend distillation (Kratsios/Bessent vs ministère chinois, 28 juillet). Poids + infra comme démonstration d'indépendance technique. Trois jours après : Qwen3.8-Max-Preview d'Alibaba (2,4T) — course au « club 3T ».
Six étapes vers la production Kimi K3 :
- Auditer la licence : lire le document custom ; croiser seuils MaaS et MAU avec le modèle économique.
- Créer une clé API : platform.kimi.ai, créditer le compte.
- Configurer le client OpenAI-compatible :
base_url="https://api.moonshot.ai/v1", modèlekimi-k3. - Optimiser le cache : préfixes répétés pour Mooncake ; viser >90 % de cache hit.
- Benchmarker contre la stack : SWE-bench 93,4 % vs coût GLM-5.2 0,47 $/tâche.
- Choisir l'hébergement : API/OpenRouter pour la majorité ; auto-hébergement réservé aux clusters 64+ GPU ; gateways agent sur infra dédiée.
Q : Kimi K3 est-il open source ?
R : Non. Open weight — poids et rapport oui, données et code complet non. Moonshot n'emploie jamais open source.
Q : Usage commercial libre ?
R : Oui dans la plupart des cas. Exceptions : MaaS >20 M$/12 mois ou >100 M MAU / >20 M$ revenus mensuels.
Q : Combien de GPU pour auto-héberger ?
R : 64+ accélérateurs selon Moonshot. En pratique : API ou OpenRouter.
Q : Performance SWE-bench ?
R : 93,4 % (Vals AI, juillet 2026) — premier open weight, derrière Opus 5 et GPT-5.6 Sol.
Q : Différence avec Kimi K2 ?
R : ~3× paramètres vs K2.5 ; AttnRes + Per-Head Muon ; contexte 1M ; licence avec seuil MaaS absent chez K2.
L'accès API accélère l'intégration, mais la production agentique exige des environnements stables 24/7 — jitter sur VPS partagés, absence de persistance launchd, limites RAM long contexte : des coûts hors tarif token. Pour agents Kimi Code et serveurs MCP : JEXCLOUD Mac bare-metal multi-région — mémoire unifiée Apple Silicon dédiée, pas de sursouscription, gateways launchd persistantes, provisioning 120 secondes. Détails sur la page tarifs JEXCLOUD.