AI Agent xAI 2026.07.30

Grok 4.6 Release: Musk kündigt 7. August an, 1,5T Parameter

Am 28. Juli antwortete Musk auf X an Vercel-CEO Guillermo Rauch: xAI plant Grok 4.6 mit 1,5 Trillionen (1,5T) Parametern um den 7. August, gefolgt von Grok 4.7 mit 2,1T Parametern in wenigen Wochen. Das ist nur einen Monat nach Grok 4.5 — xAI will diesen Sommer drei Frontier-Modelle in Serie liefern. Offizielle Benchmarks und Preise fehlen; die folgenden Daten stammen aus Musks öffentlichen Äußerungen und Branchenberichten.

Für Modellauswahl und AI-Entwickler deckt dieser Artikel drei Punkte ab: ① Zeitplan von 4.5 bis 4.6/4.7 und „Musk time“-Risiko; ② SFT/RL-Nachtraining und Konkurrenzdruck durch Kimi K3; ③ Quervergleich, Kontroversen-Hintergrund, Sechs-Schritte-Vorbereitung und FAQ. Stand 2026-07-30, unbestätigte Angaben sind markiert.

01 Von Grok 4.5 bis 4.6/4.7: Release-Tempo und Pain Points

Hält Musk seinen Zeitplan ein, liefert xAI in etwa zwei Monaten drei Frontier-Modelle. Schlüsseltermine:

  • 8. Juli 2026: xAI veröffentlicht Grok 4.5 — Coding/Agent-Fokus, Cursor-Co-Training, 500K-Token-Kontext, $2/$6 pro Million Input/Output-Tokens.
  • 16.–26. Juli 2026: Moonshot AIs Kimi K3 wechselt von Hosted Preview zu vollständigem Open-Weight-Release (2,8T, 1M Token).
  • 28. Juli 2026: Musk veröffentlicht Grok 4.6/4.7-Roadmap in Antwort an Rauch — Hauptquelle dieses Artikels.
  • ~7. August 2026 (Ziel): Grok 4.6, 1,5T, Fokus auf SFT/RL-Upgrade.
  • Ende August–Anfang September 2026 (geschätzt): Grok 4.7, 2,1T, über 4.6 insgesamt besser, leicht langsamer beim Serving.

Kernprobleme für Entwickler und Unternehmen:

  • Einzelne Informationsquelle: Bestätigt ist bisher nur ein X-Post von Musk; xAI-Blog und Produktseite sind nicht synchronisiert.
  • Benchmark- und Preislücke: Anders als bei Grok 4.5 gibt es für 4.6 keine unabhängige Evaluation oder Modellkarte.
  • Extrem kurzes Auswahlfenster: Flaggschiff-Modelle veralten in Wochen — Token-Effizienz schlägt Leaderboard-Rang.
  • Sicherheits- und Compliance-Risiko: xAI verklagte im Juli einen Nutzer wegen CSAM-Generierung; Common Sense Media stufte Grok im Januar als eines der schlechtesten KI-Produkte für Kinderschutz ein.

Musks Zeitpläne sind historisch flexibel — die Branche nennt das „Musk time“. Verzögerungen von Tagen bis zwei Wochen sind üblich. Vor dem Release xAI-Offizialkanäle als Maßstab nutzen.

02 Grok-Serie: Kernparameter im Überblick

Grok-Modellparameter (Stand 2026-07-30)
Modell Release/Ziel Parameter Fokus Status
Grok 4.3 Beta17. Apr. 2026Nicht veröffentlichtBaselineVeröffentlicht
Grok 4.58. Juli 2026Nicht veröffentlicht (Single SKU, kein MoE)Coding/Agent, Cursor-Co-TrainingVeröffentlicht
Grok 4.6~7. Aug. 20261,5TSFT/RL-UpgradeOffiziell angekündigt, nicht veröffentlicht
Grok 4.7~Ende Aug.–Anf. Sep.2,1TÜber 4.6 besser, höhere Token-EffizienzOffiziell angekündigt, nicht veröffentlicht

Parameter, Preise und Benchmarks basieren auf Vendor-/Musk-Angaben. Für Grok 4.6/4.7 gibt es keine unabhängige Drittprüfung — „offiziell angekündigt“ beim Release verifizieren.

03 Deep Dive: Upgrade-Fokus ist Lernen, nicht nur Skalierung

Was SFT und RL lösen

Supervised Fine-Tuning (SFT) korrigiert Ausgabeverhalten mit kuratierten Beispielen. Reinforcement Learning (RL) lehrt korrekte Aktionssequenzen in mehrstufigen Agent-Aufgaben per Reward-Signal. Musk betont für Grok 4.6 „significantly improved SFT & RL“ statt roher Skalierung — Fortsetzung der Grok-4.5-Strategie: Terminal-Bench 2.1 83,3 %, SWE-Bench Pro 64,7 %, mit ~19.000 Output-Tokens pro SWE-Bench-Pro-Task vs. ~67.000 bei Claude Opus 4.8.

Skalierung plus Nachtraining parallel

1,5T bei Grok 4.6 ist ein realer Sprung über 4.5, doch Musk beschreibt Grok 4.7 (2,1T) als „in jeder Hinsicht besser, außer leicht langsamer beim Serving“ — xAI trennt „stärker“ und „schneller“ in zwei SKUs statt eines Allround-Modells.

Konkurrenzdruck durch Kimi K3

Grok 4.6-Zieldatum liegt fast genau 10 Tage nach Kimi K3s Open-Weight-Shock. Kimi K3 erreichte 1.679 Punkte im Frontend Code Arena — erstes Open-Weight-Modell über allen Closed Models — und Rang 3 im Artificial Analysis Intelligence Index. Musk kommentierte Kimi-K3-Benchmarks mit „impressive“. xAIs beschleunigtes 4.6/4.7-Tempo korreliert mit intensivierter Konkurrenz von OpenAI, Anthropic und chinesischen Labs.

04 Quervergleich: Grok vs. Kimi K3 und Peers

Grok und gleichzeitige Flaggschiff-Modelle
Modell Anbieter Parameter Kontext Preis (Input/Output pro 1M Token) Quelle
Grok 4.5xAINicht veröffentlicht500K Token$2 / $6xAI offiziell
Grok 4.6 (angekündigt)xAI1,5TNicht veröffentlichtNicht veröffentlichtMusk X-Post (unverifiziert)
Kimi K3Moonshot AI2,8T (MoE, ~16/896 Experten aktiv)1M Token$0,30 (Cache-Hit)/$3 Input, $15 OutputMoonshot offiziell
Claude Fable 5.1 (Gerücht)AnthropicNicht veröffentlichtNicht veröffentlichtGerücht: Fable-5-Preise ($10/$50)36kr, WinCentral — Anthropic unbestätigt
GPT-5.6 SolOpenAINicht veröffentlichtNicht veröffentlichtNicht veröffentlichtOpenAI offiziell

Grok 4.6 und Claude Fable 5.1 sind Vorab- bzw. Gerücht-Angaben — keine verifizierte Head-to-Head-Benchmark. Nutzen für Timing und grobe Positionierung.

05 Kontroversen, Sechs-Schritte-Vorbereitung und harte Daten

Vor dem Release zu beachten:

  • Zeitplan unverifiziert: Einzige Quelle ist Musks X-Post.
  • Benchmarks und Preise leer: „1,5T“ und „SFT/RL-Upgrade“ sind derzeit Vendor-Behauptungen.
  • xAI-Sicherheitskontroversen: Juli-Klage wegen CSAM-Generierung; Common Sense Media Januar-Bewertung als eines der schlechtesten KI-Chatbots für Kinderschutz.
  • Kollision mit „Pacing the Frontier“: Am 28. Juli unterzeichneten über 1.200 Mitarbeiter von OpenAI, Anthropic u. a. einen Brief für verlangsamte Frontier-AI — xAI fehlt auf der Liste.

Sechs Schritte zur Grok-4.6-Vorbereitung:

  1. xAI-Offizialkanäle abonnieren: xAI auf X und x.ai — nicht nur Sekundärquellen.
  2. Grok-4.5-Benchmarks wiederholen: Unser Grok-4.5-Test als 4.6-Baseline.
  3. xAI-API-Account einrichten: API-Key im Console, Grok 4.5 für Latenz und Konnektivität testen.
  4. OpenAI-kompatiblen Client konfigurieren: Grok 4.5 in Cursor oder eigenem Agent, Token-Baseline dokumentieren.
  5. Kimi-K3-Vergleichsbenchmark: Kimi-K3-Open-Weight-Artikel, gleiche Agent-Workflows testen.
  6. Dual-SKU-Routing planen: Grok 4.6 (schnell) und 4.7 (stärker) vor Release vorkonfigurieren.
grok_api_baseline.py
from openai import OpenAI

client = OpenAI(
    api_key="your_xai_api_key",
    base_url="https://api.x.ai/v1"
)

response = client.chat.completions.create(
    model="grok-4.5",
    messages=[{"role": "user", "content": "Analyze this agent workflow..."}]
)

Quotable Hard Data (xAI offiziell, Musk X, Moonshot offiziell, 2026-07-30):

  • Grok 4.6 Parameter: 1,5T (offiziell angekündigt, Drittprüfung ausstehend)
  • Grok 4.7 Parameter: 2,1T, Ende Aug.–Anf. Sep. (offiziell angekündigt)
  • Grok 4.5 Preise: Input $2/M Token, Output $6/M Token, 500K-Token-Kontext
  • Grok 4.5 SWE-Bench Pro: 64,7 %; Terminal-Bench 2.1: 83,3 %
  • Token-Effizienz: Grok 4.5 ~19.000 Output-Token/Task vs. Opus 4.8 ~67.000
  • Kimi K3: 2,8T Parameter, 1M Token, Frontend Code Arena 1.679 Punkte
  • Release-Tempo: ~1 Monat von 4.5 bis 4.6, drei Frontier-Modelle in ~2 Monaten

06 FAQ, August-Release-Welle und Produktions-Fazit

Wann genau kommt Grok 4.6?
Musk sagte „um den 7. August 2026“ auf X — xAI hat kein offizielles Datum bestätigt. Verschiebung möglich.

Was unterscheidet Grok 4.6 und 4.7?
Grok 4.6: 1,5T, SFT/RL-Nachtraining. Grok 4.7: 2,1T, wenige Wochen später, laut Musk über 4.6 besser außer leicht langsamer beim Serving, mit höherer Token-Effizienz.

Schlägt Grok 4.6 Kimi K3 oder Claude Fable 5.1?
Zu früh. Keine veröffentlichten Grok-4.6-Benchmarks; Kimi K3 hat verifizierte Scores; Fable 5.1 ist von Anthropic nicht bestätigt.

Was kostet Grok 4.6?
Unbekannt. Grok 4.5 bei $2/$6 als Referenz — offizielle Preise beim Release prüfen.

Wo kann ich Grok 4.6 nutzen?
Vermutlich wie Grok 4.5: Grok Build, xAI API, Console zuerst, dann Drittplattformen — für 4.6 noch nicht bestätigt.

Hält Musks Zeitplan, landen Grok 4.6/4.7 im selben Monat wie das gerüchte Claude Fable 5.1 — direkt nach Kimi K3s Open-Weight-Shock. August 2026 könnte einer der release-intensivsten Monate im LLM-Sektor werden.

API-Zugang zu Grok ist schnell, doch Produktionsteams zahlen drei versteckte Kosten: Multi-Model-Routing auf geteilten VPS ohne genug RAM, Agent-Pipelines ohne stabilen 24/7-Runner, ständige Integration-Umbauten bei schnellem Modellwechsel. Für Grok-Agenten, Full-Repo-Analyse und MCP-Server in Produktion sind JEXCLOUD Multi-Region Bare-Metal-Mac-Knoten stabiler: dediziertes Apple-Silicon-Unified-Memory, kein Oversubscription-Jitter, launchd-verwaltete Agent-Gateways, 120-Sekunden-Bereitstellung. Knoten und Preise auf der JEXCLOUD-Preisseite.