AI Agent Open-Weight-LLM 2026.07.28

Ist Kimi K3 Open Source? Moonshot AIs 2,8-Billionen-Parameter-Modell im Detail

Am Abend des 27. Juli 2026 veröffentlichte Moonshot AI die vollständigen Gewichte, den Technical Report und drei Infrastruktur-Stacks für Kimi K3 — ein 2,8-Billionen-Parameter-MoE mit ~104B aktiven Parametern, 1M-Token-Kontext und nativer Vision. Der Download (~1,56 TB auf Hugging Face) erreichte innerhalb von 30 Minuten Platz 1 der Trending-Liste.

Kurzantwort auf die Kernfrage: Nein, nicht im OSI-Sinn. Moonshot nennt es konsequent open weight, nie open source. Dieser datengetriebene Artikel liefert: ① die 11-Tage-Timeline von API-Launch bis Vollrelease; ② Architektur (KDA, AttnRes, Per-Head Muon, Stable LatentMoE); ③ Infra-Releases MoonEP/FlashKDA/AgentEnv; ④ unabhängige Benchmarks (SWE-bench 93,4 %, Artificial Analysis ~57); ⑤ Lizenz-Gates ($20M MaaS, 100M MAU); ⑥ API-Preise und Self-Host-Schwellen. Kontext: Kimi K3 Benchmark-Review, Destillations-Kontroverse.

01 Open Weight vs. Open Source: Was Moonshot wirklich liefert

Nach OSI-Definition erfordert echtes Open Source öffentliche Trainingsdaten, Trainingscode und reproduzierbare Pipeline — nicht nur fertige Gewichte. Kimi K3 liefert Gewichte, Technical Report und Infra-Tools (MoonEP, FlashKDA, AgentEnv), aber keine Trainingsdaten und keinen vollständigen Training-Code. Moonshot verwendet in allen offiziellen Materialien ausschließlich open weight.

  • Engpass 1 — Begriffsverwirrung: Medien übersetzen open weight oft als „Open Source“. Für Compliance-Teams ist die Unterscheidung entscheidend.
  • Engpass 2 — Lizenzverschärfung vs. K2: Nicht mehr „Modified MIT“, sondern Custom License mit zwei kommerziellen Schwellen.
  • Engpass 3 — Verifikationsfenster: Zwischen API-Launch (16.07.) und Gewichtsdrop (27.07.) liefen nur offizielle Claims — jetzt ist unabhängige Architekturprüfung möglich.
Open Weight vs. Open Source — Vergleichsmatrix
Dimension Open Weight (Kimi K3) Open Source (OSI-Standard)
ModellgewichteJa (~1,56 TB)Ja
Technical ReportJaJa
TrainingsdatenNeinJa
Vollständiger Training-CodeNeinJa
Kommerzielle NutzungJa, mit GatesLizenzabhängig
Moonshot-Terminologie„Open weight“Wird nicht verwendet

Downloadbare Gewichte ermöglichen Fine-Tuning und Self-Hosting — aber niemand außerhalb Moonshot kann K3 von Grund auf reproduzieren. Das ist der operative Unterschied.

02 11-Tage-Timeline: Von API-Launch bis Vollrelease

Vom API-only-Start bis zum vollständigen Gewichtsrelease vergingen exakt 11 Tage — ungewöhnlich kurz für ein 2,8T-Modell und ein Signal an die Entwickler-Community.

  • 16.07.2026 (WAIC-Vorabend): Kimi K3 auf kimi.com, Kimi Work, Kimi Code und API — nur Online-Inferenz, Gewichte noch geschlossen. Blog-Titel: „Kimi K3: Open Frontier Intelligence“.
  • 17.07.2026: Branchenanalysen zur Architektur; Xinhua berichtet über den größten Open-Weight-Rekord weltweit.
  • 22.–23.07.2026: US-China-Destillationsstreit eskaliert — Michael Kratsios (Weißes Haus) wirft Moonshot „industrielle Destillation“ von Anthropic Fable vor; Scott Bessent droht mit Sanktionen und Entity List.
  • 27.07.2026 (~23:00): Vollständige Gewichte, Technical Report, MoonEP und AgentEnv veröffentlicht (FlashKDA war bereits früher open).
  • 28.07.2026: Chinesisches Handelsministerium antwortet mit Vorwurf der „AI-Hegemonie“; Medien berichten Release-Details.
Kimi K3 — Kernparameter (Stand 27.07.2026)
Spec Wert
Gesamtparameter2,8 Billionen (2,8T)
Aktive Parameter~104 Milliarden
MoE-Konfiguration896 Routing-Experten, 16 aktiv/Token (+ Shared Experts)
AttentionKDA + Gated MLA (Hybrid)
Kontextfenster1.000.000 Token
MultimodalNative Vision (ViT-V2, 27 Layer)
GewichtsformatMXFP4 Weights + MXFP8 Activations (QAT ab SFT)
Download-Größe~1,56 TB (Hugging Face)

Zitierbare Hard Facts: 2,8T Gesamt / 104B aktiv; MoE-Sparsity 1,8 % (16/896); erster vollständig geöffneter 3T-Klassen-Release; Hugging-Face-Trending #1 in 30 Minuten.

03 Architektur: KDA, AttnRes, Per-Head Muon und Stable LatentMoE

K3 rekonstruiert drei Standardkomponenten des Deep Learning — Attention, Residual Connections, Optimizer — statt nur Parameter zu skalieren.

Kimi Delta Attention (KDA)

Gated DeltaNet nutzt skalarisches Vergessen; KDA ersetzt das durch kanalweises Gating — jede Feature-Dimension erhält eigene Decay-Rate. Chunkwise DPLR-Formulierung: linear in der Sequenzlänge, hardware-effizient. KDA wechselt mit Gated-MLA-Vollattention — Grund für 1M Kontext bei minimalem KV-Cache.

Attention Residuals (AttnRes)

Statt uniformer Residual-Akkumulation: selektive, input-abhängige Aggregation aller vorherigen Layer. Overhead: ein RMSNorm + Pseudo-Query pro Layer. Moonshot meldet ~25 % höhere Trainingseffizienz bei unter 2 % Mehrkosten.

Per-Head Muon

Muon-Optimizer head-spezifisch erweitert — jeder Attention-Head erhält adaptive Konvergenz. Reine Training-Phase-Technik, für API-Nutzer unsichtbar, aber entscheidend für Leistung pro aktivem Parameter.

Stable LatentMoE — Komponentenübersicht
Komponente Funktion Kennzahl
Routing896 Experten, 16 aktiv/TokenSparsity 1,8 %
Quantile BalancingExpertenlast ohne heuristische HyperparameterStabiles Training
Per-Head MuonHead-spezifische OptimierungSkalierbares Training
Shared ExpertsBaseline-StabilitätMoE-Robustheit
Gated MLASelektive VollattentionLangkontext-Hybrid

04 MoonEP, FlashKDA, AgentEnv: Infra neben Gewichten

Moonshot veröffentlichte nicht nur Gewichte, sondern die Infrastruktur, die K3-Training und -Serving ermöglicht — ein zentraler Grund für positive Community-Reaktion.

Drei open Infra-Technologien im Vergleich
Technologie Rolle Kernmetrik
MoonEPHigh-Performance-Kommunikation für feingranulares MoETemporäre Duplikation überlasteter Experten; mathematischer Obertheoretischer Grenzwert für redundante Experten pro Rank
FlashKDACUTLASS-basierter KDA-Kernel (bereits früher open)Prefill auf H20: 1,72×–2,22× schneller vs. flash-linear-attention; Drop-in via chunk_kda
AgentEnvFirecracker-microVM-Sandbox (mit KVCache.ai)Checkpoint 133 ms, Resume 49 ms, Memory-Overcommit bis 6,5× (Moonshot-Angabe, noch nicht unabhängig verifiziert)

FlashKDA integriert sich als Backend in flash-linear-attention — bestehende Projekte profitieren ohne Codeänderung. AgentEnv zielt auf massiv paralleles agentisches RL-Training mit schnellem Snapshot/Fork.

05 Benchmarks, Lizenz-Gates und Kostenrechnung

Priorität: unabhängige Drittquellen. Herstellerangaben separat markiert.

SWE-bench Verified — Vals AI (Juli 2026, unabhängig)
Modell Score Release
Claude Opus 597,0 %2026-07-24
GPT-5.6 Sol96,2 %2026-07-09
Claude Fable 595,0 %2026-06-09
Kimi K393,4 %2026-07-16
Qwen3.7-Max79,4 %2026-05-19
DeepSeek-V476,2 %2026-04-23

Artificial Analysis Intelligence Index (max reasoning): Claude Fable 5 — 60; GPT-5.6 Sol — 59; Kimi K3 — ~57 (global #3, open weight #1); GLM-5.2 — 51; DeepSeek V4 Pro — 44. Kosten pro Task: K3 ~$0,95 vs. Fable 5 ~$2,40 (−60 %) vs. GLM-5.2 ~$0,47. Fazit: Leistungsdecke im Open-Weight-Segment, nicht der Value-Pick. Arena.ai Frontend Code Arena: K3 aktuell #1.

Lizenz — zwei kommerzielle Schwellen (Custom License, nicht Modified MIT)
Gate Schwelle Konsequenz
MaaS-Umsatz> $20 Mio. in 12 Monaten (Affiliates inkl.)Separate Commercial Agreement mit Moonshot erforderlich
Attribution / Scale> 100 Mio. MAU oder > $20 Mio. Monatsumsatz„Kimi K3“ prominent in der Produkt-UI anzeigen

Für Startups und KMU praktisch irrelevant. Relevant für MaaS-Wettbewerber mit Moonshot-API und Hyperscaler-Produkte.

06 API, Self-Host, US-China-Kontext, Sechs-Schritte-Guide und FAQ

Kimi K3 API-Preise (pro Million Token)
Token-Typ Preis
Input (Cache-Hit)$0,30
Input (Cache-Miss)$3,00
Output (inkl. Reasoning)$15,00

Mooncake-Disaggregated-Serving: Cache-Hit-Rate bei Coding-Workloads oft >90 % — effektive Input-Kosten näher $0,30 als $3,00. Self-Host: offiziell 64+ Beschleunigerkarten auf Supernode-Niveau; Consumer-Hardware ausgeschlossen. OpenRouter: sieben Provider, meist Listenpreis.

US-China-Hintergrund: Release während WAIC 2026 und mitten im Destillationsstreit (Kratsios/Bessent vs. chinesisches Handelsministerium, 28.07.). Vollständige Gewichte + Infra als Signal technischer Unabhängigkeit. Drei Tage später: Alibaba Qwen3.8-Max-Preview (2,4T) — Wettbewerb im „3T-Club“.

Sechs Schritte zur Kimi-K3-Produktion:

  1. Lizenz prüfen: Custom License lesen; MaaS-Gate und MAU-Schwelle gegen Geschäftsmodell abgleichen.
  2. API-Key erstellen: platform.kimi.ai, Guthaben laden.
  3. OpenAI-kompatiblen Client konfigurieren: base_url="https://api.moonshot.ai/v1", Modell kimi-k3.
  4. Cache-Strategie optimieren: Wiederholte Prompt-Prefixe für Mooncake-Cache-Hits; Ziel >90 % Hit-Rate.
  5. Benchmark gegen Stack: SWE-bench-Nähe (93,4 %) vs. GLM-5.2-Kosten ($0,47/Task) abwägen.
  6. Hosting wählen: API/OpenRouter für die meisten Teams; Self-Host nur ab 64-GPU-Cluster; Agent-Gateways auf dedizierter Infrastruktur betreiben.

F: Ist Kimi K3 Open Source?
A: Nein. Open weight — Gewichte und Report ja, Trainingsdaten und vollständiger Code nein. Moonshot sagt selbst nie open source.

F: Kommerziell nutzbar?
A: Ja, für die meisten Fälle. Ausnahmen: MaaS >$20M/12M oder >100M MAU / >$20M Monatsumsatz.

F: Wie viele GPUs für Self-Host?
A: Mindestens 64 Beschleunigerkarten laut Moonshot. Praktisch: API oder OpenRouter.

F: Wie stark auf SWE-bench?
A: 93,4 % (Vals AI, Juli 2026) — stärkstes Open-Weight-Modell, hinter Opus 5 und GPT-5.6 Sol.

F: Unterschied zu Kimi K2?
A: ~3× Parameter vs. K2.5; AttnRes + Per-Head Muon neu; 1M Kontext; Lizenz mit MaaS-Gate (K2 hatte das nicht).

API-Zugang ist schnell, aber Agent-Produktion braucht stabile 24/7-Umgebungen — Shared-VPS-Jitter, fehlende launchd-Persistenz und Langkontext-RAM-Limits kosten unabhängig vom Token-Preis. Für Kimi-Code-Agents und MCP-Gateways: JEXCLOUD Bare-Metal Mac multi-region — dediziertes Apple-Silicon-Unified-Memory, kein Overselling, launchd-persistente Gateways, 120-Sekunden-Provisioning. Details auf der JEXCLOUD-Preisseite.