Ist Kimi K3 Open Source? Moonshot AIs 2,8-Billionen-Parameter-Modell im Detail
Am Abend des 27. Juli 2026 veröffentlichte Moonshot AI die vollständigen Gewichte, den Technical Report und drei Infrastruktur-Stacks für Kimi K3 — ein 2,8-Billionen-Parameter-MoE mit ~104B aktiven Parametern, 1M-Token-Kontext und nativer Vision. Der Download (~1,56 TB auf Hugging Face) erreichte innerhalb von 30 Minuten Platz 1 der Trending-Liste.
Kurzantwort auf die Kernfrage: Nein, nicht im OSI-Sinn. Moonshot nennt es konsequent open weight, nie open source. Dieser datengetriebene Artikel liefert: ① die 11-Tage-Timeline von API-Launch bis Vollrelease; ② Architektur (KDA, AttnRes, Per-Head Muon, Stable LatentMoE); ③ Infra-Releases MoonEP/FlashKDA/AgentEnv; ④ unabhängige Benchmarks (SWE-bench 93,4 %, Artificial Analysis ~57); ⑤ Lizenz-Gates ($20M MaaS, 100M MAU); ⑥ API-Preise und Self-Host-Schwellen. Kontext: Kimi K3 Benchmark-Review, Destillations-Kontroverse.
01 Open Weight vs. Open Source: Was Moonshot wirklich liefert
Nach OSI-Definition erfordert echtes Open Source öffentliche Trainingsdaten, Trainingscode und reproduzierbare Pipeline — nicht nur fertige Gewichte. Kimi K3 liefert Gewichte, Technical Report und Infra-Tools (MoonEP, FlashKDA, AgentEnv), aber keine Trainingsdaten und keinen vollständigen Training-Code. Moonshot verwendet in allen offiziellen Materialien ausschließlich open weight.
- Engpass 1 — Begriffsverwirrung: Medien übersetzen open weight oft als „Open Source“. Für Compliance-Teams ist die Unterscheidung entscheidend.
- Engpass 2 — Lizenzverschärfung vs. K2: Nicht mehr „Modified MIT“, sondern Custom License mit zwei kommerziellen Schwellen.
- Engpass 3 — Verifikationsfenster: Zwischen API-Launch (16.07.) und Gewichtsdrop (27.07.) liefen nur offizielle Claims — jetzt ist unabhängige Architekturprüfung möglich.
| Dimension | Open Weight (Kimi K3) | Open Source (OSI-Standard) |
|---|---|---|
| Modellgewichte | Ja (~1,56 TB) | Ja |
| Technical Report | Ja | Ja |
| Trainingsdaten | Nein | Ja |
| Vollständiger Training-Code | Nein | Ja |
| Kommerzielle Nutzung | Ja, mit Gates | Lizenzabhängig |
| Moonshot-Terminologie | „Open weight“ | Wird nicht verwendet |
Downloadbare Gewichte ermöglichen Fine-Tuning und Self-Hosting — aber niemand außerhalb Moonshot kann K3 von Grund auf reproduzieren. Das ist der operative Unterschied.
02 11-Tage-Timeline: Von API-Launch bis Vollrelease
Vom API-only-Start bis zum vollständigen Gewichtsrelease vergingen exakt 11 Tage — ungewöhnlich kurz für ein 2,8T-Modell und ein Signal an die Entwickler-Community.
- 16.07.2026 (WAIC-Vorabend): Kimi K3 auf kimi.com, Kimi Work, Kimi Code und API — nur Online-Inferenz, Gewichte noch geschlossen. Blog-Titel: „Kimi K3: Open Frontier Intelligence“.
- 17.07.2026: Branchenanalysen zur Architektur; Xinhua berichtet über den größten Open-Weight-Rekord weltweit.
- 22.–23.07.2026: US-China-Destillationsstreit eskaliert — Michael Kratsios (Weißes Haus) wirft Moonshot „industrielle Destillation“ von Anthropic Fable vor; Scott Bessent droht mit Sanktionen und Entity List.
- 27.07.2026 (~23:00): Vollständige Gewichte, Technical Report, MoonEP und AgentEnv veröffentlicht (FlashKDA war bereits früher open).
- 28.07.2026: Chinesisches Handelsministerium antwortet mit Vorwurf der „AI-Hegemonie“; Medien berichten Release-Details.
| Spec | Wert |
|---|---|
| Gesamtparameter | 2,8 Billionen (2,8T) |
| Aktive Parameter | ~104 Milliarden |
| MoE-Konfiguration | 896 Routing-Experten, 16 aktiv/Token (+ Shared Experts) |
| Attention | KDA + Gated MLA (Hybrid) |
| Kontextfenster | 1.000.000 Token |
| Multimodal | Native Vision (ViT-V2, 27 Layer) |
| Gewichtsformat | MXFP4 Weights + MXFP8 Activations (QAT ab SFT) |
| Download-Größe | ~1,56 TB (Hugging Face) |
Zitierbare Hard Facts: 2,8T Gesamt / 104B aktiv; MoE-Sparsity 1,8 % (16/896); erster vollständig geöffneter 3T-Klassen-Release; Hugging-Face-Trending #1 in 30 Minuten.
03 Architektur: KDA, AttnRes, Per-Head Muon und Stable LatentMoE
K3 rekonstruiert drei Standardkomponenten des Deep Learning — Attention, Residual Connections, Optimizer — statt nur Parameter zu skalieren.
Kimi Delta Attention (KDA)
Gated DeltaNet nutzt skalarisches Vergessen; KDA ersetzt das durch kanalweises Gating — jede Feature-Dimension erhält eigene Decay-Rate. Chunkwise DPLR-Formulierung: linear in der Sequenzlänge, hardware-effizient. KDA wechselt mit Gated-MLA-Vollattention — Grund für 1M Kontext bei minimalem KV-Cache.
Attention Residuals (AttnRes)
Statt uniformer Residual-Akkumulation: selektive, input-abhängige Aggregation aller vorherigen Layer. Overhead: ein RMSNorm + Pseudo-Query pro Layer. Moonshot meldet ~25 % höhere Trainingseffizienz bei unter 2 % Mehrkosten.
Per-Head Muon
Muon-Optimizer head-spezifisch erweitert — jeder Attention-Head erhält adaptive Konvergenz. Reine Training-Phase-Technik, für API-Nutzer unsichtbar, aber entscheidend für Leistung pro aktivem Parameter.
| Komponente | Funktion | Kennzahl |
|---|---|---|
| Routing | 896 Experten, 16 aktiv/Token | Sparsity 1,8 % |
| Quantile Balancing | Expertenlast ohne heuristische Hyperparameter | Stabiles Training |
| Per-Head Muon | Head-spezifische Optimierung | Skalierbares Training |
| Shared Experts | Baseline-Stabilität | MoE-Robustheit |
| Gated MLA | Selektive Vollattention | Langkontext-Hybrid |
04 MoonEP, FlashKDA, AgentEnv: Infra neben Gewichten
Moonshot veröffentlichte nicht nur Gewichte, sondern die Infrastruktur, die K3-Training und -Serving ermöglicht — ein zentraler Grund für positive Community-Reaktion.
| Technologie | Rolle | Kernmetrik |
|---|---|---|
| MoonEP | High-Performance-Kommunikation für feingranulares MoE | Temporäre Duplikation überlasteter Experten; mathematischer Obertheoretischer Grenzwert für redundante Experten pro Rank |
| FlashKDA | CUTLASS-basierter KDA-Kernel (bereits früher open) | Prefill auf H20: 1,72×–2,22× schneller vs. flash-linear-attention; Drop-in via chunk_kda |
| AgentEnv | Firecracker-microVM-Sandbox (mit KVCache.ai) | Checkpoint 133 ms, Resume 49 ms, Memory-Overcommit bis 6,5× (Moonshot-Angabe, noch nicht unabhängig verifiziert) |
FlashKDA integriert sich als Backend in flash-linear-attention — bestehende Projekte profitieren ohne Codeänderung. AgentEnv zielt auf massiv paralleles agentisches RL-Training mit schnellem Snapshot/Fork.
05 Benchmarks, Lizenz-Gates und Kostenrechnung
Priorität: unabhängige Drittquellen. Herstellerangaben separat markiert.
| Modell | Score | Release |
|---|---|---|
| Claude Opus 5 | 97,0 % | 2026-07-24 |
| GPT-5.6 Sol | 96,2 % | 2026-07-09 |
| Claude Fable 5 | 95,0 % | 2026-06-09 |
| Kimi K3 | 93,4 % | 2026-07-16 |
| Qwen3.7-Max | 79,4 % | 2026-05-19 |
| DeepSeek-V4 | 76,2 % | 2026-04-23 |
Artificial Analysis Intelligence Index (max reasoning): Claude Fable 5 — 60; GPT-5.6 Sol — 59; Kimi K3 — ~57 (global #3, open weight #1); GLM-5.2 — 51; DeepSeek V4 Pro — 44. Kosten pro Task: K3 ~$0,95 vs. Fable 5 ~$2,40 (−60 %) vs. GLM-5.2 ~$0,47. Fazit: Leistungsdecke im Open-Weight-Segment, nicht der Value-Pick. Arena.ai Frontend Code Arena: K3 aktuell #1.
| Gate | Schwelle | Konsequenz |
|---|---|---|
| MaaS-Umsatz | > $20 Mio. in 12 Monaten (Affiliates inkl.) | Separate Commercial Agreement mit Moonshot erforderlich |
| Attribution / Scale | > 100 Mio. MAU oder > $20 Mio. Monatsumsatz | „Kimi K3“ prominent in der Produkt-UI anzeigen |
Für Startups und KMU praktisch irrelevant. Relevant für MaaS-Wettbewerber mit Moonshot-API und Hyperscaler-Produkte.
06 API, Self-Host, US-China-Kontext, Sechs-Schritte-Guide und FAQ
| Token-Typ | Preis |
|---|---|
| Input (Cache-Hit) | $0,30 |
| Input (Cache-Miss) | $3,00 |
| Output (inkl. Reasoning) | $15,00 |
Mooncake-Disaggregated-Serving: Cache-Hit-Rate bei Coding-Workloads oft >90 % — effektive Input-Kosten näher $0,30 als $3,00. Self-Host: offiziell 64+ Beschleunigerkarten auf Supernode-Niveau; Consumer-Hardware ausgeschlossen. OpenRouter: sieben Provider, meist Listenpreis.
US-China-Hintergrund: Release während WAIC 2026 und mitten im Destillationsstreit (Kratsios/Bessent vs. chinesisches Handelsministerium, 28.07.). Vollständige Gewichte + Infra als Signal technischer Unabhängigkeit. Drei Tage später: Alibaba Qwen3.8-Max-Preview (2,4T) — Wettbewerb im „3T-Club“.
Sechs Schritte zur Kimi-K3-Produktion:
- Lizenz prüfen: Custom License lesen; MaaS-Gate und MAU-Schwelle gegen Geschäftsmodell abgleichen.
- API-Key erstellen: platform.kimi.ai, Guthaben laden.
- OpenAI-kompatiblen Client konfigurieren:
base_url="https://api.moonshot.ai/v1", Modellkimi-k3. - Cache-Strategie optimieren: Wiederholte Prompt-Prefixe für Mooncake-Cache-Hits; Ziel >90 % Hit-Rate.
- Benchmark gegen Stack: SWE-bench-Nähe (93,4 %) vs. GLM-5.2-Kosten ($0,47/Task) abwägen.
- Hosting wählen: API/OpenRouter für die meisten Teams; Self-Host nur ab 64-GPU-Cluster; Agent-Gateways auf dedizierter Infrastruktur betreiben.
F: Ist Kimi K3 Open Source?
A: Nein. Open weight — Gewichte und Report ja, Trainingsdaten und vollständiger Code nein. Moonshot sagt selbst nie open source.
F: Kommerziell nutzbar?
A: Ja, für die meisten Fälle. Ausnahmen: MaaS >$20M/12M oder >100M MAU / >$20M Monatsumsatz.
F: Wie viele GPUs für Self-Host?
A: Mindestens 64 Beschleunigerkarten laut Moonshot. Praktisch: API oder OpenRouter.
F: Wie stark auf SWE-bench?
A: 93,4 % (Vals AI, Juli 2026) — stärkstes Open-Weight-Modell, hinter Opus 5 und GPT-5.6 Sol.
F: Unterschied zu Kimi K2?
A: ~3× Parameter vs. K2.5; AttnRes + Per-Head Muon neu; 1M Kontext; Lizenz mit MaaS-Gate (K2 hatte das nicht).
API-Zugang ist schnell, aber Agent-Produktion braucht stabile 24/7-Umgebungen — Shared-VPS-Jitter, fehlende launchd-Persistenz und Langkontext-RAM-Limits kosten unabhängig vom Token-Preis. Für Kimi-Code-Agents und MCP-Gateways: JEXCLOUD Bare-Metal Mac multi-region — dediziertes Apple-Silicon-Unified-Memory, kein Overselling, launchd-persistente Gateways, 120-Sekunden-Provisioning. Details auf der JEXCLOUD-Preisseite.