AI Agent LLM open weight 2026.07.28

Kimi K3 est-il open source ? À l'intérieur du modèle 2,8 billions de Moonshot AI

Le soir du 27 juillet 2026, Moonshot AI a mis en ligne les poids complets, le rapport technique et trois briques d'infrastructure de Kimi K3 — un MoE de 2,8 billions de paramètres, ~104 milliards actifs, fenêtre de contexte 1 million de tokens et vision native. Le téléchargement (~1,56 To sur Hugging Face) a atteint la première place du trending en moins de trente minutes.

La réponse courte à la question centrale : non, pas au sens OSI. Moonshot parle systématiquement d'open weight, jamais d'open source. Cet article structure pour les décideurs techniques : la chronologie des 11 jours entre lancement API et release complète ; l'architecture (KDA, AttnRes, Per-Head Muon, Stable LatentMoE) ; l'infra MoonEP/FlashKDA/AgentEnv ; les benchmarks indépendants (SWE-bench 93,4 %, Artificial Analysis ~57) ; les seuils de licence ; les tarifs API. Contexte : revue approfondie Kimi K3, controverse de distillation.

01 Open weight ou open source : ce que Moonshot livre réellement

Selon l'Open Source Initiative, un modèle véritablement open source exige données d'entraînement, code d'entraînement et pipeline reproductible — pas seulement des poids finis. Kimi K3 publie poids, rapport technique et outils infra, mais pas les données ni le code complet d'entraînement. Dans tous ses documents, Moonshot emploie exclusivement open weight.

Trois tensions structurent la lecture pour les équipes produit :

  • Écart sémantique. La traduction médiatique « open source » masque une réalité juridique différente — open weight autorise fine-tuning et déploiement, pas reproduction from scratch.
  • Licence durcie. Fin du « Modified MIT » de la famille K2 ; document custom avec deux seuils commerciaux inédits.
  • Fenêtre de vérification. Entre le 16 juillet (API seule) et le 27 juillet (poids), seules les déclarations officielles comptaient ; la communauté peut désormais auditer l'architecture.
Open weight vs open source — matrice comparative
Dimension Open weight (Kimi K3) Open source (standard OSI)
Poids du modèleOui (~1,56 To)Oui
Rapport techniqueOuiOui
Données d'entraînementNonOui
Code d'entraînement completNonOui
Usage commercialOui, avec seuilsSelon licence
Terminologie Moonshot« Open weight »Non utilisée

Télécharger et déployer K3 est désormais possible ; le reproduire entièrement depuis zéro ne l'est pas. C'est la distinction opérationnelle que les équipes juridiques doivent intégrer.

02 Onze jours du lancement API à la release complète

Du premier appel API au dépôt intégral des poids : 11 jours — un délai remarquablement court pour un modèle de cette échelle, et un signal fort envers l'écosystème développeur.

  • 16 juillet (veille WAIC 2026) : Kimi K3 sur kimi.com, Kimi Work, Kimi Code et API — inférence en ligne uniquement. Article : « Kimi K3: Open Frontier Intelligence ».
  • 17 juillet : Analyses sectorielles ; Xinhua qualifie K3 du plus grand modèle open weight mondial.
  • 22–23 juillet : Escalade du différend US-Chine — Michael Kratsios accuse Moonshot de « distillation industrielle » sur Fable ; Scott Bessent évoque sanctions et Entity List.
  • 27 juillet (~23h) : Poids complets, rapport technique, MoonEP et AgentEnv (FlashKDA déjà open).
  • 28 juillet : Réponse du ministère du Commerce chinois ; couverture médiatique du détail technique.
Kimi K3 — spécifications clés (27 juillet 2026)
Spec Valeur
Paramètres totaux2,8 billions (2,8T)
Paramètres actifs~104 milliards
Configuration MoE896 experts routés, 16 activés/token (+ experts partagés)
AttentionKDA + Gated MLA (hybride)
Fenêtre de contexte1 000 000 tokens
MultimodalVision native (ViT-V2, 27 couches)
Format des poidsMXFP4 poids + MXFP8 activations (QAT dès SFT)
Taille du download~1,56 To (Hugging Face)

Chiffres citables : 2,8T total / 104B actifs ; sparsité MoE 1,8 % ; premier release intégral de classe 3T ; trending Hugging Face #1 en 30 minutes.

03 Architecture : KDA, AttnRes, Per-Head Muon et Stable LatentMoE

Plutôt qu'une simple montée en paramètres, Moonshot a reconstruit trois composants fondamentaux : l'attention, les connexions résiduelles et l'optimiseur.

Kimi Delta Attention (KDA)

Le Gated DeltaNet classique applique un oubli scalaire uniforme. KDA introduit un gating canal par canal : chaque dimension conserve ou oublie à son propre rythme. Formulation chunkwise DPLR — complexité linéaire, efficacité matérielle. Alternance KDA / Gated MLA : clé du contexte 1M à faible empreinte KV cache.

Attention Residuals (AttnRes)

Les résidus standard diluent l'information des premières couches en profondeur. AttnRes remplace l'accumulation uniforme par une agrégation sélective et dépendante de l'entrée. Coût marginal : un RMSNorm et un pseudo-query par couche. Gain annoncé : ~25 % d'efficacité d'entraînement pour moins de 2 % de surcoût.

Per-Head Muon

Extension de l'optimiseur Muon à chaque tête d'attention — convergence plus adaptative. Technique purement training-time, invisible côté API, mais contributive à la performance par paramètre actif.

Stable LatentMoE — composants
Composant Rôle Indicateur
Routing896 experts, 16 activés/tokenSparsité 1,8 %
Quantile BalancingÉquilibrage sans hyperparamètres heuristiquesTraining stable
Per-Head MuonOptimisation par têteScalabilité
Shared ExpertsStabilité de baseRobustesse MoE
Gated MLAAttention globale sélectiveHybride long contexte

04 MoonEP, FlashKDA, AgentEnv : l'infra au même titre que les poids

La release ne se limite pas à une fiche modèle. Moonshot a ouvert la stack qui a rendu l'entraînement de K3 possible — un élément déterminant de l'accueil développeur.

Trois technologies infra open — comparaison
Technologie Rôle Métrique clé
MoonEPCommunication haute performance pour MoE finement granulaireDuplication temporaire d'experts surchargés ; borne théorique sur experts redondants par rank
FlashKDAKernel KDA basé CUTLASS (déjà open)Prefill H20 : 1,72×–2,22× vs flash-linear-attention ; drop-in via chunk_kda
AgentEnvSandbox microVM Firecracker (co-développé avec KVCache.ai)Checkpoint 133 ms, reprise 49 ms, surcommit mémoire jusqu'à 6,5× (chiffres Moonshot, non reproduits indépendamment)

FlashKDA s'intègre comme backend dans flash-linear-attention sans modification de code. AgentEnv vise l'entraînement RL agentique massif avec snapshot et fork rapides.

05 Benchmarks, seuils de licence et arbitrage coût-capacité

Priorité aux évaluations tierces indépendantes.

SWE-bench Verified — Vals AI (juillet 2026, indépendant)
Modèle Score Release
Claude Opus 597,0 %2026-07-24
GPT-5.6 Sol96,2 %2026-07-09
Claude Fable 595,0 %2026-06-09
Kimi K393,4 %2026-07-16
Qwen3.7-Max79,4 %2026-05-19
DeepSeek-V476,2 %2026-04-23

Artificial Analysis Intelligence Index (max reasoning) : Claude Fable 5 — 60 ; GPT-5.6 Sol — 59 ; Kimi K3 — ~57 (#3 mondial, #1 open weight) ; GLM-5.2 — 51 ; DeepSeek V4 Pro — 44. Coût par tâche : K3 ~0,95 $ vs Fable 5 ~2,40 $ (−60 %) vs GLM-5.2 ~0,47 $. En synthèse : plafond de capacité open weight, pas le choix valeur. Arena.ai Frontend Code Arena : K3 en tête.

Licence custom — deux seuils commerciaux (plus de Modified MIT)
Seuil Condition Conséquence
Revenus MaaS> 20 M$ sur 12 mois glissants (affiliés inclus)Accord commercial séparé avec Moonshot
Attribution / échelle> 100 M MAU ou > 20 M$ revenus mensuelsAffichage prominent « Kimi K3 » dans l'interface

Pour startups et PME : sans impact pratique. Pour concurrents MaaS à l'échelle Moonshot : clause à auditer en priorité.

06 API, auto-hébergement, contexte géopolitique, guide en six étapes et FAQ

Tarifs API Kimi K3 (par million de tokens)
Type de token Prix
Entrée (cache hit)0,30 $
Entrée (cache miss)3,00 $
Sortie (reasoning inclus)15,00 $

Architecture Mooncake disaggregated : taux de cache hit >90 % sur workloads code — coût effectif proche de 0,30 $. Auto-hébergement : 64+ accélérateurs recommandés ; matériel grand public exclu. OpenRouter : sept hébergeurs, tarifs alignés.

Contexte US-Chine : release pendant WAIC 2026, au cœur du différend distillation (Kratsios/Bessent vs ministère chinois, 28 juillet). Poids + infra comme démonstration d'indépendance technique. Trois jours après : Qwen3.8-Max-Preview d'Alibaba (2,4T) — course au « club 3T ».

Six étapes vers la production Kimi K3 :

  1. Auditer la licence : lire le document custom ; croiser seuils MaaS et MAU avec le modèle économique.
  2. Créer une clé API : platform.kimi.ai, créditer le compte.
  3. Configurer le client OpenAI-compatible : base_url="https://api.moonshot.ai/v1", modèle kimi-k3.
  4. Optimiser le cache : préfixes répétés pour Mooncake ; viser >90 % de cache hit.
  5. Benchmarker contre la stack : SWE-bench 93,4 % vs coût GLM-5.2 0,47 $/tâche.
  6. Choisir l'hébergement : API/OpenRouter pour la majorité ; auto-hébergement réservé aux clusters 64+ GPU ; gateways agent sur infra dédiée.

Q : Kimi K3 est-il open source ?
R : Non. Open weight — poids et rapport oui, données et code complet non. Moonshot n'emploie jamais open source.

Q : Usage commercial libre ?
R : Oui dans la plupart des cas. Exceptions : MaaS >20 M$/12 mois ou >100 M MAU / >20 M$ revenus mensuels.

Q : Combien de GPU pour auto-héberger ?
R : 64+ accélérateurs selon Moonshot. En pratique : API ou OpenRouter.

Q : Performance SWE-bench ?
R : 93,4 % (Vals AI, juillet 2026) — premier open weight, derrière Opus 5 et GPT-5.6 Sol.

Q : Différence avec Kimi K2 ?
R : ~3× paramètres vs K2.5 ; AttnRes + Per-Head Muon ; contexte 1M ; licence avec seuil MaaS absent chez K2.

L'accès API accélère l'intégration, mais la production agentique exige des environnements stables 24/7 — jitter sur VPS partagés, absence de persistance launchd, limites RAM long contexte : des coûts hors tarif token. Pour agents Kimi Code et serveurs MCP : JEXCLOUD Mac bare-metal multi-région — mémoire unifiée Apple Silicon dédiée, pas de sursouscription, gateways launchd persistantes, provisioning 120 secondes. Détails sur la page tarifs JEXCLOUD.