Публикация open-weight модели Kimi K3 на Hugging Face

Kimi K3 open-weight: 2,8T параметров, 1M контекст — лимиты железа, лицензия и матрица решений

Вечером 27 июля 2026 Moonshot AI выложила полные веса Kimi K3, tech report и открыла MoonEP, FlashKDA, AgentEnv — ровно через 11 дней после API-релиза. ~1,56 ТБ на Hugging Face (MXFP4, 96 safetensors-шардов) — первый полностью опубликованный модель класса 3T. Moonshot называет это open weight, не open source. Ниже — жёсткая разборка архитектуры, потолков inference, лицензионных порогов и того, почему 99 % команд не должны даже планировать self-host без 64+ GPU.

1. Три технические ловушки при выборе пути развёртывания

  1. Open-weight принимают за open source: СМИ пишут «открытая модель», Moonshot в официальных материалах — только open weight. Веса и tech report есть; training data и полный training stack — нет. Для compliance и due diligence это принципиально разные категории.
  2. Иллюзия self-host на consumer-железе: 2,8T total params, 104B active/token, 896 routing experts (16 active) — MoE такого масштаба физически не влезает в одну машину. Moonshot: минимум 64 GPU supernode. Скачать 1,56 ТБ ≠ запустить inference.
  3. Игнор API cache при расчёте TCO: List price: input $3/M, output $15/M. Mooncake disaggregated inference даёт 90 %+ cache hit на типичных coding-нагрузках — effective input ближе к $0.30/M. Без PoC на своих промптах вы либо переплачиваете в планах, либо недооцениваете реальный burn rate.

2. Таймлайн: от API до полных весов за 11 дней

  • 16 июля 2026 (накануне WAIC): Kimi K3 на kimi.com, Kimi Work, Kimi Code и Kimi API — только online, веса закрыты. Tech blog: «Kimi K3: Open Frontier Intelligence».
  • 17 июля: Разбор архитектуры; китайские госмедиа — «крупнейшая по параметрам опубликованная модель».
  • 22–23 июля: Эскалация «дистилляции» USA–Китай. Michael Kratsios (OSTP) обвиняет Moonshot в industrial-scale distillation Anthropic Fable; Scott Bessent — санкции и entity list.
  • 27 июля, 23:00: Полные веса K3, tech report, open-source MoonEP и AgentEnv (FlashKDA уже был открыт ранее). Hugging Face trending #1 за ~30 минут.
  • 28 июля: Ответ Минкоммерции КНР; медиа — детали open-weight. Через 3 дня Alibaba — Qwen3.8-Max-Preview (24T), прямой ответ в гонке «3T club».

3. Спеки Kimi K3 — цифры для цитирования

ПараметрЗначение
Всего параметров2,8 триллиона (2.8T)
Активных на токен~104 миллиарда (104B)
АрхитектураMixture of Experts (MoE)
Эксперты896 routing experts, 16 active/token (+ shared experts)
AttentionKimi Delta Attention (KDA) + Gated MLA
Контекст1 миллион токенов (1M)
МультимодальностьNative vision (ViT-V2, 27 layers)
Формат весовMXFP4 weights + MXFP8 activations (quantization-aware с SFT)
Объём скачивания~1.56 TB (Hugging Face, 96 safetensors shards)
ЛицензияCustom Kimi K3 License (open weight, не open source)

4. Архитектура: KDA, AttnRes, Per-Head Muon — что реально влияет на latency

K3 переписывает три классических компонента DL-стека, а не просто масштабирует FLOPs.

Kimi Delta Attention (KDA)

Вместо скалярного forget gate — поканальные gates: каждая feature dimension со своим decay rate. Chunkwise DPLR даёт O(n) по длине последовательности и режет KV cache footprint на длинном контексте. KDA чередуется с редкими global Gated MLA layers — это механизм 1M context, не маркетинг.

Attention Residuals (AttnRes)

Классический residual суммирует слои равномерно — глубокие слои размывают ранний сигнал. AttnRes селективно агрегирует выходы предыдущих слоёв по входу. Overhead: один RMSNorm + pseudo-query vector на слой. Training efficiency +~25 % при <2 % compute overhead; pseudo-query инициализируется нулём (на старте ≈ uniform average).

Per-Head Muon

Muon optimizer применяется per attention head — независимая сходимость каждой головы. Чисто training-time trick; через API не видно, но объясняет, почему 104B active бьют closed-source frontier.

896 experts, 16 active — sparsity ~1.8 %

Quantile Balancing против expert collapse. MoonEP доказывает upper bound redundant experts per node — критично для multi-node inference без tail latency spikes. Без MoonEP MoE 896-way на 64 GPU — узкое место в all-to-all, не в matmul.

5. Infra-стек: MoonEP, FlashKDA, AgentEnv — пределы производительности

КомпонентНазначениеКлючевая метрика
MoonEP Fine-grained MoE comms на supernode scale Временная репликация overloaded experts; равномерные tokens/node; доказанный upper bound redundant experts
FlashKDA CUTLASS-based KDA kernel (open source ранее) На H20: prefill 1.72–2.22× быстрее flash-linear-attention baseline; drop-in chunk_kda backend
AgentEnv Agent sandbox с KVCache.ai (Firecracker microVM) Parallel agent RL; заявлено Moonshot: checkpoint 133 ms, recovery 49 ms, memory overcommit до 6.5× — без независимой верификации

Вывод для ops: без FlashKDA + MoonEP self-host K3 на generic vLLM fork — это недооценка engineering surface. Веса без этих kernel'ов не дают заявленный throughput.

6. Бенчмарки: SWE-bench 93,4 %, Artificial Analysis ~57 (#3 global)

Независимые перепроверки (Vals AI, июль 2026):

МодельSWE-bench VerifiedДата
Claude Opus 597 %2026-07-24
GPT-5.6 Sol96.2 %2026-07-09
Claude Fable 595 %2026-06-09
Kimi K393.4 %2026-07-16
Qwen3.7-Max79.4 %2026-05-19
DeepSeek-V476.2 %2026-04-23

Artificial Analysis Intelligence Index (max reasoning): Fable 5 = 60, GPT-5.6 Sol = 59, Kimi K3 ≈ 57 (#3 global, #1 open-weight), GLM-5.2 = 51, DeepSeek V4 Pro = 44.

Cost per task: ~$0.95 vs Fable 5 (~$2.40) — на 60 % дешевле top closed, но дороже GLM-5.2 (~$0.47). K3 — performance ceiling open-weight, не price/performance winner. Arena.ai Frontend Code Arena: #1 (июль 2026).

7. Лицензия: open-weight, не open source — порог MaaS $20M

Moonshot никогда не пишет «open source» в официальных документах. Kimi K3 License заменяет «Modified MIT» кастомным текстом с двумя commercial gates, которых не было у K2:

  1. MaaS revenue gate: Model-as-a-Service с cumulative revenue >$20M за 12 месяцев → отдельное commercial agreement с Moonshot.
  2. Scale attribution gate: >100M MAU или monthly revenue >$20M → обязательное отображение «Kimi K3» в UI.

Для большинства dev-команд и стартапов gates не срабатывают. Если ваш бизнес — конкурирующий model hosting на K3 weights — первый gate — hard stop для legal.

8. API pricing и hard limit 64 GPU для self-host

Official API: OpenAI SDK compatible (https://api.moonshot.ai/v1, model kimi-k3).

Token typePrice per million
Input (cache hit)$0.30
Input (cache miss)$3.00
Output (incl. reasoning)$15.00

Self-host: официальный minimum — 64 GPU supernode. 1.56 TB storage + MoE comms — это не hobby project. Реалистично: API или OpenRouter (~7 провайдеров, pricing ≈ official). Детали: K3 benchmark guide, OpenRouter июльский рейтинг.

9. WAIC 2026 и геополитический фон

Open-weight drop совпал с WAIC и эскалацией distillation-скандала USA–Китай. Публикация весов + tech report + трёх infra-проектов — попытка доказать engineering path независимо от политических обвинений. Для выбора vendor'а: quality модели и geopolitical risk — ортогональные оси. См. гайд по distillation scandal.

10. Пять шагов: подключить Kimi K3 без иллюзий self-host

  1. Прочитать Kimi K3 License: Проверить MaaS >$20M / MAU >100M gates. «Open source» в заголовках СМИ — не legal opinion.
  2. Выбрать access path: API (official/OpenRouter) для ~99 % команд; self-host только с 64+ GPU budget; weight download — для research/fine-tune, не для MacBook.
  3. Настроить OpenAI-compatible endpoint: Base URL https://api.moonshot.ai/v1, model ID kimi-k3 — reuse OpenAI SDK или OpenClaw config.
  4. Прогнать свой eval: Adoption rate, error rate, P95 latency на реальных coding/agent промптах. SWE-bench 93.4 % — market signal, не ваш SLA proof.
  5. Deploy 7×24 remote Mac gateway: OpenClaw pipeline на always-on macOS node; openclaw channels status --probe как acceptance test; workspace sync через SFTP/rsync.

11. Матрица решений: API vs OpenRouter vs self-host

ИзмерениеOfficial APIOpenRouterSelf-host weights
Startup cost Низкий (сменить base URL) Низкий (один key, много моделей) Экстремальный (64 GPU + 1.56 TB)
Cache advantage Mooncake 90 %+ hit rate Зависит от upstream Свой KV cache stack
Data sovereignty Данные в Moonshot cloud +1 network hop Локально (если железо тянет)
Throughput ceiling Moonshot SLA + Mooncake Provider-dependent Требует MoonEP/FlashKDA tuning
Кому подходит Быстрая интеграция K3 в продукт Multi-model routing, fallback Research labs с supernode budget

12. FAQ

Kimi K3 — open source? Нет. Open weight: веса и часть infra публичны, training pipeline — нет. OSI definition не выполняется.

Бесплатная коммерческая эксплуатация? В большинстве случаев да. Gates: MaaS >$20M/12mo или MAU >100M / monthly >$20M.

Сколько GPU для self-host? Official minimum 64 GPU. Реалистично: API или OpenRouter.

Отличие от статьи 17.07.? 16.07. — API launch; 27.07. — полные веса + MoonEP/AgentEnv. Эта статья — лицензия, infra, self-host threshold.

Связь с distillation scandal? Параллельно с weight release — гайд по рискам vendor'а.

13. Итог: open-weight ceiling, remote Mac как мост для 7×24 agent pipeline

27 июля превратил обещание 3T-модели в 1.56 TB downloadable reality — KDA, AttnRes, MoonEP как verifiable engineering, не slide deck. Для 99 % команд: API или OpenRouter, свой eval, zero laptop self-host fantasies.

API не решает gateway downtime, sleep на dev Mac, failed OpenClaw probe. Для K3 в OpenClaw/Hermes 7×24 coding agent нужен always-on Apple Silicon remote Mac с launchd daemon и SFTP/rsync workspace sync. SFTPMAC remote Mac — operational bridge между Kimi K3 API/OpenRouter routing и production agent infra; надёжнее «домашний ПК как API gateway».