DeepSeek V4 GA: MoE-архитектура, 1M контекст и пиковое ценообразование

2026 DeepSeek V4 GA: цены, архитектура CSA+HCA и сравнение с GPT-5.6 — руководство

После трёх месяцев ожидания DeepSeek V4 в полной GA-версии вышел 20 июля 2026. Относительно апрельской preview production-сборка усилила оркестрацию агентов, математический reasoning и генерацию кода — и впервые ввела пиковое/непиковое ценообразование, сигнал зрелой коммерциализации вместо бесконечного демпинга. Этот разбор опирается на официальную документацию и tech report: таймлайн, архитектура CSA+HCA, бенчмарки, сравнение с GPT-5.6 и Claude Fable 5, полные таблицы тарифов и миграция API до 24 июля — с акцентом на throughput, KV-cache footprint и self-host на Apple Silicon.

1. Три болевые точки выбора: изменения GA, сложность биллинга и срочность миграции

  1. Preview ≠ production end-state: Архитектура апреля уже была сильной; GA точечно дотюнивает агентов, математику и код. Старые имена deepseek-chat и deepseek-reasoner будут навсегда отключены 24.07. в 23:59 (пекинское время) — откладывание миграции = гарантированный инцидент.
  2. Пиковые тарифы усложняют ops: Будни 09:00–12:00 и 14:00–18:00 (Пекин) — тариф ×2. Batch-inference, code review и разметку данных нужно выносить в непиковые окна, иначе счёт удвоится.
  3. «Сильнейший open source» ≠ «сильнейший closed source»: V4-Pro набирает 80,6 % на SWE-bench Verified (рекорд open source), но Claude Fable 5 ведёт с 96,0 % (Verified) и 80,3 % (Pro). Выбирайте по метрике «способность ÷ цена», а не по одному лидерборду.

2. Таймлайн: от preview к полной версии

Дата Событие
2026-04-24 Preview V4 в open source (MIT): V4-Pro (1,6T) и V4-Flash (284B)
2026-05 Production-tuned V4-Flash и V4-Pro; API в продакшене
2026-06 Постоянное снижение цены V4-Pro на 75 % (output $0,87/M tokens) — лучший price/performance в истории линейки
2026-06-29 Email всем API-пользователям: GA в середине июля, первое раскрытие пикового ценообразования
2026-07-19 GA greyscale для части разработчиков; СМИ: «полная версия завтра»
2026-07-20 Официальный релиз GA (дата публикации статьи)
2026-07-24 Окончательное отключение deepseek-chat и deepseek-reasoner

Итог одной строкой: preview уже был мощным; GA добавляет апгрейд агентов, математики и кода плюс формальную коммерческую тарифную сетку.

3. Архитектура: как удержать 1M token context без взрыва KV-cache

3.1 Спеки семейства моделей

Параметр V4-Pro V4-Flash
Всего параметров 1,6 трлн (1,6T) 284 млрд (284B)
Active params на token 49 млрд (49B) 13 млрд (13B)
Слои Transformer 61 43
Контекстное окно 1 000 000 tokens 1 000 000 tokens
Макс. вывод 384K tokens 384K tokens
Точность FP4 (expert weights) + FP8 (остальное) FP4 + FP8 mixed
Pretrain data 33T+ tokens 32T+ tokens
Лицензия MIT MIT

3.2 Гибридное внимание CSA + HCA

DeepSeek V4 отказывается от MLA (V2/V3) в пользу двух новых механизмов:

  • Compressed Sparse Attention (CSA): KV-последовательность сжимается Softmax-gated pooling в 4 раза; FP4 «lightning indexer» делает top-k sparse selection (V4-Pro: top-1024, V4-Flash: top-512) при sliding window 128 tokens. На 1M контекста — всего 27 % inference FLOPs относительно V3.2.
  • Heavy Compressed Attention (HCA): сжатие tokens в 128 раз для глобального dense attention, дополняет CSA. V4-Flash: первые 2 слоя HCA, далее чередование CSA/HCA; V4-Pro — аналогичная схема.

Суммарный эффект: память KV Cache на 1M контекста — 10 % от V3.2 (V4-Flash до 7 %). Это напрямую влияет на batch size при self-host на unified memory Apple Silicon и на стоимость API-inference.

3.3 Manifold-Constrained Hyper-Connections (mHC) и оптимизатор Muon

mHC апгрейдит residual connections: 4-канальный residual stream с doubly-stochastic mixing matrices (Birkhoff polytope) — стабильная propagation сигнала через 61 слой без gradient blow-up.

Muon (замена AdamW) ортогонализует градиенты через Newton-Schulz — быстрее сходимость, стабильнее training runs на FP4/FP8 mixed precision.

3.4 Три режима inference и официальные sampling-параметры

Режим Характеристика Сценарий
Non-think Без chain-of-thought, минимальная latency Простые Q&A, routing
Think High Явный reasoning (<redacted_thinking>) Средняя сложность, отладка кода
Think Max Максимальная глубина reasoning, нужен контекст 384K+ Сложная математика, длинные agent chains

Официальная рекомендация (все режимы): temperature=1.0, top_p=1.0

4. Бенчмарки: scorecard open source лидера

4.1 Ключевые метрики V4-Pro

Бенчмарк DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified 80,6 % (рекорд open source) 96,0 % не опубликовано отдельно ~69 %
SWE-bench Pro 55,4 % 80,3 % 78,1 % 69,2 %
LiveCodeBench (Pass@1) 93,5 % 88,1 % 87,4 % 83,2 %
Codeforces Elo 3 206
Terminal-Bench 2.1 83,9 % 88,0 % 85,1 % 82,7 %

SWE-bench Verified измеряет фиксы багов в реальных GitHub-репозиториях — 80,6 % — текущий максимум open source, наравне с Gemini 3.1 Pro. SWE-bench Pro строже; Claude Fable 5 лидирует с 80,3 %.

4.2 Price/performance (Artificial Analysis)

  • Claude Fable 5: Strategy & Ops Index — $3,48 за прогон, score 50
  • DeepSeek V4-Pro: та же задача $0,03, score 38
  • DeepSeek V4-Flash: все шесть index-задач — каждая ниже $0,04

Fable 5 дороже V4-Pro в 116 раз при отрыве ~12 пунктов (~31 %). Для большинства production-сценариев V4-Pro — лучший price/performance в классе.

5. Полное сравнение: GPT-5.6 и Claude Fable 5

Измерение DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
Open source MIT, self-host Closed Closed
Контекст 1M tokens не раскрыт 1M tokens
Code capability Очень сильная (близко к Fable 5) Очень сильная Максимум класса
API output (непик) $0,87/M tokens ~$15/M $50/M
API output (пик) $1,74/M tokens
Agent capability Сильная, multi-agent orchestration Сильная Максимум класса
Data privacy Private deployment Только cloud Только cloud

Рекомендации по сценарию:

  • Бюджет / высокая частота / self-host: V4-Pro или V4-Flash
  • Максимум code quality, цена не критична: Claude Fable 5 (вершина SWE-bench Pro)
  • Сложные алгоритмы + математика: GPT-5.6 Sol / Ultra
  • Массовая обработка логов/документов дёшево: V4-Flash (cache hit input от $0,0028/M)

6. Пиковые/непиковые тарифы: как не переплатить

Главное изменение GA: временная дифференциация цен, аналог тарифов на электроэнергию. Пик (пекинское время): будни 09:00–12:00 и 14:00–18:00 — тариф ×2.

Модель Статья Непик (Off-Peak) Пик (Peak)
V4-Pro Input (cache hit) ¥0,025 / $0,0035 / 1M ×2
V4-Pro Input (cache miss) ¥3,00 / $0,435 / 1M ¥6,00 / $0,87 / 1M
V4-Pro Output ¥6,00 / $0,87 / 1M ¥12,00 / $1,74 / 1M
V4-Flash Input (cache hit) ¥0,02 / $0,0028 / 1M ×2
V4-Flash Input (cache miss) ¥1,00 / $0,14 / 1M ¥2,00 / $0,28 / 1M
V4-Flash Output ¥2,00 / $0,28 / 1M ¥4,00 / $0,56 / 1M

Четыре тактики экономии:

  1. Нерелтайм в непик: batch-документы, разметка, code review после 18:00 или до 09:00.
  2. Prompt Cache: повторяющиеся system prompts — V4-Flash cache hit $0,0028/M.
  3. Flash как router: простой intent на V4-Flash, сложный reasoning — на V4-Pro.
  4. Email-уведомления о биллинге: DeepSeek обещает предупреждение за 24 часа до изменения тарифов.

Даже в пик V4-Pro output ($1,74/M) в 8,6 раз дешевле Claude Opus 4.8 ($15/M) и сопоставим с GPT-5.6 Sol (~$15/M).

7. Миграция API для разработчиков (дедлайн 24 июля)

Важно: deepseek-chat и deepseek-reasoner будут окончательно отключены 24.07.2026 в 15:59 UTC (24.07. 23:59 по Пекину).

Старое имя Новое имя Примечание
deepseek-chat deepseek-v4-flash (non-think) Быстро, лёгкие задачи
deepseek-reasoner deepseek-v4-flash (think mode) или апгрейд на deepseek-v4-pro для более сильного reasoning

7.1 Пять шагов миграции

  1. Поиск по репозиторию: код, CI, env vars — deepseek-chat и deepseek-reasoner.
  2. Маппинг по сценарию: лёгкие диалоги → deepseek-v4-flash; бывший reasoner → flash think или deepseek-v4-pro.
  3. OpenAI SDK: менять только model; think mode через extra_body.
  4. Пиковый планировщик: cron для batch; фиксированные system prompts для cache hit.
  5. Staging-приёмка: до 24.07. прогнать критические цепочки, без старых имён.

7.2 Python-пример (OpenAI SDK)

# Старый код (недействителен после 24.07.)
client.chat.completions.create(
    model="deepseek-chat",
    messages=[...]
)

# Новый код
client.chat.completions.create(
    model="deepseek-v4-pro",          # или deepseek-v4-flash
    messages=[...],
    # Think mode:
    # extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

7.3 Anthropic SDK (совместимый)

V4 поддерживает OpenAI ChatCompletions и Anthropic Messages — base_url без изменений, обновить model:

client = anthropic.Anthropic(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com"
)
message = client.messages.create(
    model="deepseek-v4-pro",
    max_tokens=4096,
    messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)

8. FAQ

В: Стоит ли ждать от GA чуда?
Ценность не в мгновенном обгоне Claude Fable 5 или GPT-5.6, а в лучшей open source производительности за 1/10–1/100 стоимости closed флагманов — с опцией private deployment.

В: Пиковые тарифы — откат?
Усложняют планирование, но непиковые ставки остаются крайне конкурентными — признак зрелой платформы, а не вечного демпинга.

В: Всё ещё на deepseek-chat?
Завершите миграцию до 24 июля, иначе сервис оборвётся.

9. Итог: GA как веха open source 2026

DeepSeek V4 GA — для компаний без экспорта данных, разработчиков с ограниченным бюджетом, agent-инженеров с 1M контекстом и команд, оптимизирующих price/performance — сейчас почти беспробельный выбор в open source.

Локальный прогон весов V4 для agent-интеграции на Windows/Linux/VPS упирается в отсутствие Xcode/Metal/unified memory stack Apple Silicon: ноутбук в sleep рвёт 7×24 cron batch-inference и SFTP/rsync sync workspace. Всегда онлайн remote Mac на Apple Silicon стабилизирует пиковый планировщик, batch cron и приёмку миграции до 24.07. — см. локальный V4-Flash inference на Mac. SFTPMAC аренда удалённого Mac даёт нативные macOS-ноды с низкой latency для API-switch и agent pipelines в окне миграции.

Источники: Официальная документация DeepSeek · arXiv:2606.19348 · HuggingFace model pages · LLMReference · Artificial Analysis · MangoMind Blog