Kimi K3 open-weight: 2,8T параметров, 1M контекст — лимиты железа, лицензия и матрица решений
Вечером 27 июля 2026 Moonshot AI выложила полные веса Kimi K3, tech report и открыла MoonEP, FlashKDA, AgentEnv — ровно через 11 дней после API-релиза. ~1,56 ТБ на Hugging Face (MXFP4, 96 safetensors-шардов) — первый полностью опубликованный модель класса 3T. Moonshot называет это open weight, не open source. Ниже — жёсткая разборка архитектуры, потолков inference, лицензионных порогов и того, почему 99 % команд не должны даже планировать self-host без 64+ GPU.
1. Три технические ловушки при выборе пути развёртывания
- Open-weight принимают за open source: СМИ пишут «открытая модель», Moonshot в официальных материалах — только open weight. Веса и tech report есть; training data и полный training stack — нет. Для compliance и due diligence это принципиально разные категории.
- Иллюзия self-host на consumer-железе: 2,8T total params, 104B active/token, 896 routing experts (16 active) — MoE такого масштаба физически не влезает в одну машину. Moonshot: минимум 64 GPU supernode. Скачать 1,56 ТБ ≠ запустить inference.
- Игнор API cache при расчёте TCO: List price: input $3/M, output $15/M. Mooncake disaggregated inference даёт 90 %+ cache hit на типичных coding-нагрузках — effective input ближе к $0.30/M. Без PoC на своих промптах вы либо переплачиваете в планах, либо недооцениваете реальный burn rate.
2. Таймлайн: от API до полных весов за 11 дней
- 16 июля 2026 (накануне WAIC): Kimi K3 на kimi.com, Kimi Work, Kimi Code и Kimi API — только online, веса закрыты. Tech blog: «Kimi K3: Open Frontier Intelligence».
- 17 июля: Разбор архитектуры; китайские госмедиа — «крупнейшая по параметрам опубликованная модель».
- 22–23 июля: Эскалация «дистилляции» USA–Китай. Michael Kratsios (OSTP) обвиняет Moonshot в industrial-scale distillation Anthropic Fable; Scott Bessent — санкции и entity list.
- 27 июля, 23:00: Полные веса K3, tech report, open-source MoonEP и AgentEnv (FlashKDA уже был открыт ранее). Hugging Face trending #1 за ~30 минут.
- 28 июля: Ответ Минкоммерции КНР; медиа — детали open-weight. Через 3 дня Alibaba — Qwen3.8-Max-Preview (24T), прямой ответ в гонке «3T club».
3. Спеки Kimi K3 — цифры для цитирования
| Параметр | Значение |
|---|---|
| Всего параметров | 2,8 триллиона (2.8T) |
| Активных на токен | ~104 миллиарда (104B) |
| Архитектура | Mixture of Experts (MoE) |
| Эксперты | 896 routing experts, 16 active/token (+ shared experts) |
| Attention | Kimi Delta Attention (KDA) + Gated MLA |
| Контекст | 1 миллион токенов (1M) |
| Мультимодальность | Native vision (ViT-V2, 27 layers) |
| Формат весов | MXFP4 weights + MXFP8 activations (quantization-aware с SFT) |
| Объём скачивания | ~1.56 TB (Hugging Face, 96 safetensors shards) |
| Лицензия | Custom Kimi K3 License (open weight, не open source) |
4. Архитектура: KDA, AttnRes, Per-Head Muon — что реально влияет на latency
K3 переписывает три классических компонента DL-стека, а не просто масштабирует FLOPs.
Kimi Delta Attention (KDA)
Вместо скалярного forget gate — поканальные gates: каждая feature dimension со своим decay rate. Chunkwise DPLR даёт O(n) по длине последовательности и режет KV cache footprint на длинном контексте. KDA чередуется с редкими global Gated MLA layers — это механизм 1M context, не маркетинг.
Attention Residuals (AttnRes)
Классический residual суммирует слои равномерно — глубокие слои размывают ранний сигнал. AttnRes селективно агрегирует выходы предыдущих слоёв по входу. Overhead: один RMSNorm + pseudo-query vector на слой. Training efficiency +~25 % при <2 % compute overhead; pseudo-query инициализируется нулём (на старте ≈ uniform average).
Per-Head Muon
Muon optimizer применяется per attention head — независимая сходимость каждой головы. Чисто training-time trick; через API не видно, но объясняет, почему 104B active бьют closed-source frontier.
896 experts, 16 active — sparsity ~1.8 %
Quantile Balancing против expert collapse. MoonEP доказывает upper bound redundant experts per node — критично для multi-node inference без tail latency spikes. Без MoonEP MoE 896-way на 64 GPU — узкое место в all-to-all, не в matmul.
5. Infra-стек: MoonEP, FlashKDA, AgentEnv — пределы производительности
| Компонент | Назначение | Ключевая метрика |
|---|---|---|
| MoonEP | Fine-grained MoE comms на supernode scale | Временная репликация overloaded experts; равномерные tokens/node; доказанный upper bound redundant experts |
| FlashKDA | CUTLASS-based KDA kernel (open source ранее) | На H20: prefill 1.72–2.22× быстрее flash-linear-attention baseline; drop-in chunk_kda backend |
| AgentEnv | Agent sandbox с KVCache.ai (Firecracker microVM) | Parallel agent RL; заявлено Moonshot: checkpoint 133 ms, recovery 49 ms, memory overcommit до 6.5× — без независимой верификации |
Вывод для ops: без FlashKDA + MoonEP self-host K3 на generic vLLM fork — это недооценка engineering surface. Веса без этих kernel'ов не дают заявленный throughput.
6. Бенчмарки: SWE-bench 93,4 %, Artificial Analysis ~57 (#3 global)
Независимые перепроверки (Vals AI, июль 2026):
| Модель | SWE-bench Verified | Дата |
|---|---|---|
| Claude Opus 5 | 97 % | 2026-07-24 |
| GPT-5.6 Sol | 96.2 % | 2026-07-09 |
| Claude Fable 5 | 95 % | 2026-06-09 |
| Kimi K3 | 93.4 % | 2026-07-16 |
| Qwen3.7-Max | 79.4 % | 2026-05-19 |
| DeepSeek-V4 | 76.2 % | 2026-04-23 |
Artificial Analysis Intelligence Index (max reasoning): Fable 5 = 60, GPT-5.6 Sol = 59, Kimi K3 ≈ 57 (#3 global, #1 open-weight), GLM-5.2 = 51, DeepSeek V4 Pro = 44.
Cost per task: ~$0.95 vs Fable 5 (~$2.40) — на 60 % дешевле top closed, но дороже GLM-5.2 (~$0.47). K3 — performance ceiling open-weight, не price/performance winner. Arena.ai Frontend Code Arena: #1 (июль 2026).
7. Лицензия: open-weight, не open source — порог MaaS $20M
Moonshot никогда не пишет «open source» в официальных документах. Kimi K3 License заменяет «Modified MIT» кастомным текстом с двумя commercial gates, которых не было у K2:
- MaaS revenue gate: Model-as-a-Service с cumulative revenue >$20M за 12 месяцев → отдельное commercial agreement с Moonshot.
- Scale attribution gate: >100M MAU или monthly revenue >$20M → обязательное отображение «Kimi K3» в UI.
Для большинства dev-команд и стартапов gates не срабатывают. Если ваш бизнес — конкурирующий model hosting на K3 weights — первый gate — hard stop для legal.
8. API pricing и hard limit 64 GPU для self-host
Official API: OpenAI SDK compatible (https://api.moonshot.ai/v1, model kimi-k3).
| Token type | Price per million |
|---|---|
| Input (cache hit) | $0.30 |
| Input (cache miss) | $3.00 |
| Output (incl. reasoning) | $15.00 |
Self-host: официальный minimum — 64 GPU supernode. 1.56 TB storage + MoE comms — это не hobby project. Реалистично: API или OpenRouter (~7 провайдеров, pricing ≈ official). Детали: K3 benchmark guide, OpenRouter июльский рейтинг.
9. WAIC 2026 и геополитический фон
Open-weight drop совпал с WAIC и эскалацией distillation-скандала USA–Китай. Публикация весов + tech report + трёх infra-проектов — попытка доказать engineering path независимо от политических обвинений. Для выбора vendor'а: quality модели и geopolitical risk — ортогональные оси. См. гайд по distillation scandal.
10. Пять шагов: подключить Kimi K3 без иллюзий self-host
- Прочитать Kimi K3 License: Проверить MaaS >$20M / MAU >100M gates. «Open source» в заголовках СМИ — не legal opinion.
- Выбрать access path: API (official/OpenRouter) для ~99 % команд; self-host только с 64+ GPU budget; weight download — для research/fine-tune, не для MacBook.
- Настроить OpenAI-compatible endpoint: Base URL
https://api.moonshot.ai/v1, model IDkimi-k3— reuse OpenAI SDK или OpenClaw config. - Прогнать свой eval: Adoption rate, error rate, P95 latency на реальных coding/agent промптах. SWE-bench 93.4 % — market signal, не ваш SLA proof.
- Deploy 7×24 remote Mac gateway: OpenClaw pipeline на always-on macOS node;
openclaw channels status --probeкак acceptance test; workspace sync через SFTP/rsync.
11. Матрица решений: API vs OpenRouter vs self-host
| Измерение | Official API | OpenRouter | Self-host weights |
|---|---|---|---|
| Startup cost | Низкий (сменить base URL) | Низкий (один key, много моделей) | Экстремальный (64 GPU + 1.56 TB) |
| Cache advantage | Mooncake 90 %+ hit rate | Зависит от upstream | Свой KV cache stack |
| Data sovereignty | Данные в Moonshot cloud | +1 network hop | Локально (если железо тянет) |
| Throughput ceiling | Moonshot SLA + Mooncake | Provider-dependent | Требует MoonEP/FlashKDA tuning |
| Кому подходит | Быстрая интеграция K3 в продукт | Multi-model routing, fallback | Research labs с supernode budget |
12. FAQ
Kimi K3 — open source? Нет. Open weight: веса и часть infra публичны, training pipeline — нет. OSI definition не выполняется.
Бесплатная коммерческая эксплуатация? В большинстве случаев да. Gates: MaaS >$20M/12mo или MAU >100M / monthly >$20M.
Сколько GPU для self-host? Official minimum 64 GPU. Реалистично: API или OpenRouter.
Отличие от статьи 17.07.? 16.07. — API launch; 27.07. — полные веса + MoonEP/AgentEnv. Эта статья — лицензия, infra, self-host threshold.
Связь с distillation scandal? Параллельно с weight release — гайд по рискам vendor'а.
13. Итог: open-weight ceiling, remote Mac как мост для 7×24 agent pipeline
27 июля превратил обещание 3T-модели в 1.56 TB downloadable reality — KDA, AttnRes, MoonEP как verifiable engineering, не slide deck. Для 99 % команд: API или OpenRouter, свой eval, zero laptop self-host fantasies.
API не решает gateway downtime, sleep на dev Mac, failed OpenClaw probe. Для K3 в OpenClaw/Hermes 7×24 coding agent нужен always-on Apple Silicon remote Mac с launchd daemon и SFTP/rsync workspace sync. SFTPMAC remote Mac — operational bridge между Kimi K3 API/OpenRouter routing и production agent infra; надёжнее «домашний ПК как API gateway».