Kimi K3 Open-Weight: 2,8T Parameter, 1M Kontext & Lizenz-Entscheidungsleitfaden
Am Abend des 27. Juli 2026 veröffentlichte Moonshot AI die vollständigen Kimi K3-Gewichte samt Tech Report und öffnete gleichzeitig MoonEP, FlashKDA und AgentEnv — nur 11 Tage nach dem API-Launch. Mit rund 1,56 TB auf Hugging Face (MXFP4-Format, 96 Safetensors-Shards) ist K3 das erste vollständig veröffentlichte Modell im 3-Billionen-Parameter-Bereich. Moonshot spricht durchgängig von open weight, nie von open source. Dieser Leitfaden ordnet Lizenzgrenzen, Architektur, DSGVO-relevante Betriebsentscheidungen und die realistische Wahl zwischen API und Self-Hosting für EU-Teams ein.
1. Drei Entscheidungsfallen für Compliance- und Architekturteams
- „Open Weight" fälschlich als „Open Source" behandelt: Viele Medien übersetzen mit „Open Source". Moonshot verwendet in offiziellen Materialien ausschließlich open weight. Gewichte und Tech Report sind öffentlich; Trainingsdaten und vollständiger Trainingscode fehlen. EU-Rechtsabteilungen, die OSI-Kriterien anlegen, riskieren eine Fehleinschätzung des Lizenzumfangs — relevant für DSGVO-Dokumentation und Vendor-Due-Diligence.
- Self-Hosting-Hardware unterschätzt: 2,8T Gesamtparameter, 104B aktive Parameter pro Token, 896 Routing-Experten (16 aktiv) — K3 läuft nicht auf Consumer-Hardware. Moonshot empfiehlt mindestens 64 GPUs in einem Supernode. Wer „Gewichte herunterladen = produktionsreif" plant, scheitert an Infrastruktur, nicht am Modell.
- API-Cache in der Kostenplanung ignoriert: Listenpreis Input $3/M, Output $15/M. Mooncakes disaggregierte Inferenz erreicht bei typischen Coding-Workloads 90 %+ Cache-Hit-Rate — effektive Input-Kosten nähern sich $0,30/M. Ohne PoC mit realen Prompts über- oder unterschätzen Teams die Rechnung erheblich.
2. Zeitstrahl: Vom API-Launch zur vollständigen Gewichtsveröffentlichung in 11 Tagen
- 16. Juli 2026 (WAIC-Vorabend): Kimi K3 startet auf kimi.com, Kimi Work, Kimi Code und der Kimi API — nur Online-Zugriff, Gewichte noch nicht öffentlich. Tech-Blog-Titel: „Kimi K3: Open Frontier Intelligence".
- 17. Juli: Branchenanalysen zur Architektur; staatliche chinesische Medien bezeichnen K3 als größtes veröffentlichtes Modell nach Parametern.
- 22.–23. Juli: US-chinesischer „Distillation"-Streit eskaliert. OSTP-Berater Michael Kratsios wirft Moonshot „industrielle Destillation" von Anthropic Fable vor; Finanzminister Scott Bessent erwägt Sanktionen und Entity-List-Einträge.
- 27. Juli, 23:00 Uhr: Vollständige K3-Gewichte, Tech Report und Open-Source-Freigabe von MoonEP und AgentEnv (FlashKDA war bereits früher veröffentlicht). Hugging Face: innerhalb einer halben Stunde Trending #1.
- 28. Juli: Chinesisches Handelsministerium antwortet öffentlich; Medien berichten Open-Weight-Details. Drei Tage später folgt Alibaba mit Qwen3.8-Max-Preview (24T Parameter) — Wettbewerb im „3T-Club".
3. Kimi K3 Kerndaten — präzise, zitierfähige Spezifikationen
| Merkmal | Wert |
|---|---|
| Gesamtparameter | 2,8 Billionen (2,8T) |
| Aktive Parameter | ~104 Milliarden (104B) |
| Architektur | Mixture of Experts (MoE) |
| Experten | 896 Routing-Experten, 16 pro Token aktiv (+ Shared Experts) |
| Aufmerksamkeit | Kimi Delta Attention (KDA) + Gated MLA |
| Kontextfenster | 1 Million Token (1M) |
| Multimodal | Native Vision (ViT-V2, 27 Layer) |
| Gewichtsformat | MXFP4 Gewichte + MXFP8 Aktivierungen (quantization-aware ab SFT) |
| Download-Volumen | ~1,56 TB (Hugging Face, 96 Safetensors-Shards) |
| Lizenz | Custom Kimi K3 License (open weight, nicht open source) |
4. Architektur: KDA, Attention Residuals, Per-Head Muon & Stable LatentMoE
K3 ersetzt drei klassische Deep-Learning-Komponenten — nicht nur Parameter skaliert.
Kimi Delta Attention (KDA)
Statt eines skalaren Vergessensgates pro Speicherzelle nutzt KDA kanalweise Gates: Jede Feature-Dimension hat eine eigene Abklingrate. Chunkwise DPLR-Formel liefert lineare Zeitkomplexität und reduziert KV-Cache-Overhead bei langen Sequenzen. KDA wechselt mit wenigen globalen Gated-MLA-Layern ab — Grundlage für 1M Kontext.
Attention Residuals (AttnRes)
Klassische Residual-Verbindungen summieren gleichmäßig über alle Layer. AttnRes aggregiert selektiv und input-abhängig frühere Layer-Ausgaben — pro Layer nur ein RMSNorm und ein Pseudo-Query-Vektor. Trainingseffizienz +~25 % bei <2 % Overhead; Pseudo-Query startet bei Null (entspricht anfangs uniformem Mittel).
Per-Head Muon
Der Muon-Optimierer wird auf jeden Attention-Head separat angewendet — adaptive Konvergenz pro Head. Reine Trainingstechnik, für API-Nutzer unsichtbar, aber entscheidend für die Leistung bei relativ wenigen aktiven Parametern.
896 Experten, 16 aktiv (~1,8 % Sparsity)
Quantile Balancing gleicht die Last; MoonEP beweist theoretische Obergrenzen redundanter Experten pro Knoten — relevant für stabile Multi-Node-Inferenz in Produktion.
5. Infra-Stack: MoonEP, FlashKDA, AgentEnv
| Technologie | Rolle | Kernfähigkeit |
|---|---|---|
| MoonEP | Feingranulare MoE-Kommunikation bei Supernode-Skalierung | Temporäre Replikation überlasteter Experten; gleichmäßige Token-Verteilung pro Knoten; bewiesene Obergrenze redundanter Experten |
| FlashKDA | CUTLASS-basierter KDA-Operator (bereits früher open source) | Auf H20: Prefill 1,72–2,22× schneller als flash-linear-attention-Baseline; Drop-in als chunk_kda-Backend |
| AgentEnv | Agent-Sandbox mit KVCache.ai (Firecracker microVM) | Paralleles Agent-RL-Training; Moonshot-Angaben: Checkpoint 133 ms, Recovery 49 ms, Memory-Overcommit bis 6,5× (noch ohne unabhängige Drittverifikation) |
6. Benchmarks: SWE-bench 93,4 %, Artificial Analysis ~57 (#3 weltweit)
Datenbasis: unabhängige Drittanbieter (Vals AI, Stand Juli 2026):
| Modell | SWE-bench Verified | Datum |
|---|---|---|
| Claude Opus 5 | 97 % | 2026-07-24 |
| GPT-5.6 Sol | 96,2 % | 2026-07-09 |
| Claude Fable 5 | 95 % | 2026-06-09 |
| Kimi K3 | 93,4 % | 2026-07-16 |
| Qwen3.7-Max | 79,4 % | 2026-05-19 |
| DeepSeek-V4 | 76,2 % | 2026-04-23 |
Artificial Analysis Intelligence Index (max reasoning): Claude Fable 5 = 60, GPT-5.6 Sol = 59, Kimi K3 ≈ 57 (weltweit #3, #1 unter Open-Weight-Modellen), GLM-5.2 = 51, DeepSeek V4 Pro = 44.
Kosten: ~$0,95/Task vs. Claude Fable 5 (~$2,40) — ca. 60 % günstiger, aber teurer als GLM-5.2 (~$0,47). K3 ist Leistungsdecke im Open-Weight-Segment, nicht Preis-Leistungs-Sieger. Arena.ai Frontend Code Arena: Rang 1 (Stand Juli 2026).
7. Lizenz: Open-Weight, nicht Open Source — $20M-MaaS-Schwelle
Moonshot verwendet in offiziellen Dokumenten niemals „open source". Die Kimi K3 License ersetzt das frühere „Modified MIT" durch eine vollständig eigene Datei mit zwei kommerziellen Schwellen, die es bei K2 nicht gab:
- Model-as-a-Service-Umsatzschwelle: Betreibt der Lizenznehmer einen MaaS-Dienst und überschreitet der kumulierte Umsatz in 12 Monaten 20 Mio. USD, ist eine separate kommerzielle Vereinbarung mit Moonshot erforderlich.
- Skalierungs-Anzeigepflicht: Bei über 100 Mio. MAU oder Monatsumsatz über 20 Mio. USD muss „Kimi K3" prominent in der Produktoberfläche erscheinen.
Für KMU und die meisten EU-Startups greifen diese Schwellen praktisch nicht. Wer jedoch einen konkurrierenden Modell-Hosting-Dienst auf K3-Gewichten plant, muss die erste Schwelle in der Due-Diligence priorisieren — unabhängig von DSGVO-Auftragsverarbeitungsverträgen mit Moonshot.
8. API-Preise und 64-GPU-Self-Hosting-Anforderung
Offizielle API: OpenAI-SDK-kompatibel (https://api.moonshot.ai/v1, Modell kimi-k3).
| Token-Typ | Preis pro Million |
|---|---|
| Input (Cache Hit) | $0,30 |
| Input (Cache Miss) | $3,00 |
| Output (inkl. Reasoning) | $15,00 |
Self-Hosting: Mindestens 64 GPUs (Supernode). Realistische Alternativen: offizielle API oder OpenRouter (~7 Anbieter, Preise meist identisch). Vertiefung: Kimi K3 Benchmark-Leitfaden und OpenRouter Juli-Rankings.
9. WAIC 2026 und geopolitischer Hintergrund
Der Open-Weight-Release fällt in die World Artificial Intelligence Conference 2026 und überlappt mit dem US-chinesischen Distillation-Streit. Moonshots Veröffentlichung von Gewichten, Tech Report und drei Infra-Projekten dient auch der technischen Nachvollziehbarkeit unabhängig von politischen Vorwürfen. Für EU-Unternehmen bedeutet das: Lieferantenrisiko separat von Modellqualität bewerten — siehe auch Destillations-Entscheidungsleitfaden.
10. Fünf Schritte: Kimi K3 evaluieren und produktiv anbinden
- Kimi K3 License lesen: Prüfen, ob MaaS-Umsatz >20 Mio. USD oder MAU >100 Mio. zutrifft. Medien-„Open Source" ist keine Rechtsgrundlage.
- Zugangsweg wählen: API (offiziell oder OpenRouter) für ~99 % der Teams; Self-Hosting nur mit 64-GPU-Budget; Gewicht-Download für Forschung/Fine-Tuning, nicht für Laptops.
- OpenAI-kompatiblen Endpunkt setzen: Base URL
https://api.moonshot.ai/v1, Modell-IDkimi-k3— OpenAI SDK oder OpenClaw-Konfiguration wiederverwenden. - Eigenes Eval-Set fahren: Adoption Rate, Fehlerrate, P95-Latenz auf realen Coding-/Agent-Prompts. SWE-bench 93,4 % ist Marktsignal, kein SLA-Nachweis.
- 7×24 Remote-Mac-Gateway deployen: OpenClaw-Pipeline auf dauerhaft online macOS-Knoten;
openclaw channels status --probeals Abnahme; Workspace per SFTP/rsync synchronisieren.
11. Entscheidungsmatrix: API vs. OpenRouter vs. Self-Hosting
| Dimension | Offizielle API | OpenRouter | Self-Hosting |
|---|---|---|---|
| Startkosten | Niedrig (Base URL ändern) | Niedrig (ein Key, viele Modelle) | Sehr hoch (64 GPUs + 1,56 TB Storage) |
| Cache-Vorteil | Mooncake 90 %+ Hit-Rate | Abhängig vom Upstream | Eigenes KV-Cache-Design nötig |
| Datenhoheit / DSGVO | Daten in Moonshot-Cloud; AVV prüfen | Zusätzlicher Transit-Hop | Vollständig lokal (wenn Hardware reicht) |
| Stabilität | SLA des Anbieters | Multi-Provider-Fallback möglich | Eigenes Ops-Team, launchd/systemd |
| Geeignet für | Schnelle K3-Integration in Produkte | Multi-Modell-Routing, Fallback | Forschungsinstitute mit Supernode-Budget |
12. Häufige Fragen
Ist Kimi K3 Open Source? Nein — Open Weight: Gewichte und Teile der Infra sind öffentlich, Trainingspipeline nicht. Entspricht nicht der OSI-Definition.
Kostenlose kommerzielle Nutzung? In den meisten Fällen ja. Schwellen: MaaS >20 Mio. USD Jahresumsatz oder MAU >100 Mio. / Monatsumsatz >20 Mio. USD.
Wie viele GPUs für Self-Hosting? Offiziell mindestens 64 GPUs. Realistisch: API oder OpenRouter.
Unterschied zum Artikel vom 17.07.? Am 16.07. API-Launch; am 27.07. vollständige Gewichte + MoonEP/AgentEnv. Dieser Artikel fokussiert Lizenz, Infra und Self-Hosting-Schwelle.
Bezug zur Destillations-Debatte? Parallel zur Gewichtsfreigabe eskalierte der Streit — siehe Destillations-Leitfaden für Lieferantenrisiko.
13. Fazit: Open-Weight-Leistungsdecke, Remote Mac für stabile 7×24-Agenten
Der Release vom 27. Juli macht aus dem Versprechen eines 3T-Modells 1,56 TB downloadbare Realität — mit KDA, AttnRes und MoonEP als nachvollziehbare Engineering-Details. Für die meisten Teams gilt: API oder OpenRouter, eigenes Eval-Set, kein Laptop-Self-Hosting.
API-Zugang allein löst nicht Gateway-Ausfälle, Schlafmodus des Entwickler-Macs oder fehlgeschlagene OpenClaw-Probes. Wer K3 in OpenClaw/Hermes-Pipelines 7×24 betreiben will, braucht einen dokumentierten, launchd-geschützten Apple-Silicon-Remote-Mac mit SFTP/rsync-Workspace-Sync. SFTPMAC Remote Mac liefert genau diesen Brückenknoten — stabiler als „Heim-PC als API-Gateway" und DSGVO-dokumentierbarer als improvisierte Infrastruktur.