2026 DeepSeek V4 GA: цены, архитектура CSA+HCA и сравнение с GPT-5.6 — руководство
После трёх месяцев ожидания DeepSeek V4 в полной GA-версии вышел 20 июля 2026. Относительно апрельской preview production-сборка усилила оркестрацию агентов, математический reasoning и генерацию кода — и впервые ввела пиковое/непиковое ценообразование, сигнал зрелой коммерциализации вместо бесконечного демпинга. Этот разбор опирается на официальную документацию и tech report: таймлайн, архитектура CSA+HCA, бенчмарки, сравнение с GPT-5.6 и Claude Fable 5, полные таблицы тарифов и миграция API до 24 июля — с акцентом на throughput, KV-cache footprint и self-host на Apple Silicon.
1. Три болевые точки выбора: изменения GA, сложность биллинга и срочность миграции
- Preview ≠ production end-state: Архитектура апреля уже была сильной; GA точечно дотюнивает агентов, математику и код. Старые имена
deepseek-chatиdeepseek-reasonerбудут навсегда отключены 24.07. в 23:59 (пекинское время) — откладывание миграции = гарантированный инцидент. - Пиковые тарифы усложняют ops: Будни 09:00–12:00 и 14:00–18:00 (Пекин) — тариф ×2. Batch-inference, code review и разметку данных нужно выносить в непиковые окна, иначе счёт удвоится.
- «Сильнейший open source» ≠ «сильнейший closed source»: V4-Pro набирает 80,6 % на SWE-bench Verified (рекорд open source), но Claude Fable 5 ведёт с 96,0 % (Verified) и 80,3 % (Pro). Выбирайте по метрике «способность ÷ цена», а не по одному лидерборду.
2. Таймлайн: от preview к полной версии
| Дата | Событие |
|---|---|
| 2026-04-24 | Preview V4 в open source (MIT): V4-Pro (1,6T) и V4-Flash (284B) |
| 2026-05 | Production-tuned V4-Flash и V4-Pro; API в продакшене |
| 2026-06 | Постоянное снижение цены V4-Pro на 75 % (output $0,87/M tokens) — лучший price/performance в истории линейки |
| 2026-06-29 | Email всем API-пользователям: GA в середине июля, первое раскрытие пикового ценообразования |
| 2026-07-19 | GA greyscale для части разработчиков; СМИ: «полная версия завтра» |
| 2026-07-20 | Официальный релиз GA (дата публикации статьи) |
| 2026-07-24 | Окончательное отключение deepseek-chat и deepseek-reasoner |
Итог одной строкой: preview уже был мощным; GA добавляет апгрейд агентов, математики и кода плюс формальную коммерческую тарифную сетку.
3. Архитектура: как удержать 1M token context без взрыва KV-cache
3.1 Спеки семейства моделей
| Параметр | V4-Pro | V4-Flash |
|---|---|---|
| Всего параметров | 1,6 трлн (1,6T) | 284 млрд (284B) |
| Active params на token | 49 млрд (49B) | 13 млрд (13B) |
| Слои Transformer | 61 | 43 |
| Контекстное окно | 1 000 000 tokens | 1 000 000 tokens |
| Макс. вывод | 384K tokens | 384K tokens |
| Точность | FP4 (expert weights) + FP8 (остальное) | FP4 + FP8 mixed |
| Pretrain data | 33T+ tokens | 32T+ tokens |
| Лицензия | MIT | MIT |
3.2 Гибридное внимание CSA + HCA
DeepSeek V4 отказывается от MLA (V2/V3) в пользу двух новых механизмов:
- Compressed Sparse Attention (CSA): KV-последовательность сжимается Softmax-gated pooling в 4 раза; FP4 «lightning indexer» делает top-k sparse selection (V4-Pro: top-1024, V4-Flash: top-512) при sliding window 128 tokens. На 1M контекста — всего 27 % inference FLOPs относительно V3.2.
- Heavy Compressed Attention (HCA): сжатие tokens в 128 раз для глобального dense attention, дополняет CSA. V4-Flash: первые 2 слоя HCA, далее чередование CSA/HCA; V4-Pro — аналогичная схема.
Суммарный эффект: память KV Cache на 1M контекста — 10 % от V3.2 (V4-Flash до 7 %). Это напрямую влияет на batch size при self-host на unified memory Apple Silicon и на стоимость API-inference.
3.3 Manifold-Constrained Hyper-Connections (mHC) и оптимизатор Muon
mHC апгрейдит residual connections: 4-канальный residual stream с doubly-stochastic mixing matrices (Birkhoff polytope) — стабильная propagation сигнала через 61 слой без gradient blow-up.
Muon (замена AdamW) ортогонализует градиенты через Newton-Schulz — быстрее сходимость, стабильнее training runs на FP4/FP8 mixed precision.
3.4 Три режима inference и официальные sampling-параметры
| Режим | Характеристика | Сценарий |
|---|---|---|
| Non-think | Без chain-of-thought, минимальная latency | Простые Q&A, routing |
| Think High | Явный reasoning (<redacted_thinking>) |
Средняя сложность, отладка кода |
| Think Max | Максимальная глубина reasoning, нужен контекст 384K+ | Сложная математика, длинные agent chains |
Официальная рекомендация (все режимы): temperature=1.0, top_p=1.0
4. Бенчмарки: scorecard open source лидера
4.1 Ключевые метрики V4-Pro
| Бенчмарк | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % (рекорд open source) | 96,0 % | не опубликовано отдельно | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench (Pass@1) | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3 206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
SWE-bench Verified измеряет фиксы багов в реальных GitHub-репозиториях — 80,6 % — текущий максимум open source, наравне с Gemini 3.1 Pro. SWE-bench Pro строже; Claude Fable 5 лидирует с 80,3 %.
4.2 Price/performance (Artificial Analysis)
- Claude Fable 5: Strategy & Ops Index — $3,48 за прогон, score 50
- DeepSeek V4-Pro: та же задача $0,03, score 38
- DeepSeek V4-Flash: все шесть index-задач — каждая ниже $0,04
Fable 5 дороже V4-Pro в 116 раз при отрыве ~12 пунктов (~31 %). Для большинства production-сценариев V4-Pro — лучший price/performance в классе.
5. Полное сравнение: GPT-5.6 и Claude Fable 5
| Измерение | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open source | MIT, self-host | Closed | Closed |
| Контекст | 1M tokens | не раскрыт | 1M tokens |
| Code capability | Очень сильная (близко к Fable 5) | Очень сильная | Максимум класса |
| API output (непик) | $0,87/M tokens | ~$15/M | $50/M |
| API output (пик) | $1,74/M tokens | — | — |
| Agent capability | Сильная, multi-agent orchestration | Сильная | Максимум класса |
| Data privacy | Private deployment | Только cloud | Только cloud |
Рекомендации по сценарию:
- Бюджет / высокая частота / self-host: V4-Pro или V4-Flash
- Максимум code quality, цена не критична: Claude Fable 5 (вершина SWE-bench Pro)
- Сложные алгоритмы + математика: GPT-5.6 Sol / Ultra
- Массовая обработка логов/документов дёшево: V4-Flash (cache hit input от $0,0028/M)
6. Пиковые/непиковые тарифы: как не переплатить
Главное изменение GA: временная дифференциация цен, аналог тарифов на электроэнергию. Пик (пекинское время): будни 09:00–12:00 и 14:00–18:00 — тариф ×2.
| Модель | Статья | Непик (Off-Peak) | Пик (Peak) |
|---|---|---|---|
| V4-Pro | Input (cache hit) | ¥0,025 / $0,0035 / 1M | ×2 |
| V4-Pro | Input (cache miss) | ¥3,00 / $0,435 / 1M | ¥6,00 / $0,87 / 1M |
| V4-Pro | Output | ¥6,00 / $0,87 / 1M | ¥12,00 / $1,74 / 1M |
| V4-Flash | Input (cache hit) | ¥0,02 / $0,0028 / 1M | ×2 |
| V4-Flash | Input (cache miss) | ¥1,00 / $0,14 / 1M | ¥2,00 / $0,28 / 1M |
| V4-Flash | Output | ¥2,00 / $0,28 / 1M | ¥4,00 / $0,56 / 1M |
Четыре тактики экономии:
- Нерелтайм в непик: batch-документы, разметка, code review после 18:00 или до 09:00.
- Prompt Cache: повторяющиеся system prompts — V4-Flash cache hit $0,0028/M.
- Flash как router: простой intent на V4-Flash, сложный reasoning — на V4-Pro.
- Email-уведомления о биллинге: DeepSeek обещает предупреждение за 24 часа до изменения тарифов.
Даже в пик V4-Pro output ($1,74/M) в 8,6 раз дешевле Claude Opus 4.8 ($15/M) и сопоставим с GPT-5.6 Sol (~$15/M).
7. Миграция API для разработчиков (дедлайн 24 июля)
Важно: deepseek-chat и deepseek-reasoner будут окончательно отключены 24.07.2026 в 15:59 UTC (24.07. 23:59 по Пекину).
| Старое имя | Новое имя | Примечание |
|---|---|---|
deepseek-chat |
deepseek-v4-flash (non-think) |
Быстро, лёгкие задачи |
deepseek-reasoner |
deepseek-v4-flash (think mode) |
или апгрейд на deepseek-v4-pro для более сильного reasoning |
7.1 Пять шагов миграции
- Поиск по репозиторию: код, CI, env vars —
deepseek-chatиdeepseek-reasoner. - Маппинг по сценарию: лёгкие диалоги →
deepseek-v4-flash; бывший reasoner → flash think илиdeepseek-v4-pro. - OpenAI SDK: менять только
model; think mode черезextra_body. - Пиковый планировщик: cron для batch; фиксированные system prompts для cache hit.
- Staging-приёмка: до 24.07. прогнать критические цепочки, без старых имён.
7.2 Python-пример (OpenAI SDK)
# Старый код (недействителен после 24.07.)
client.chat.completions.create(
model="deepseek-chat",
messages=[...]
)
# Новый код
client.chat.completions.create(
model="deepseek-v4-pro", # или deepseek-v4-flash
messages=[...],
# Think mode:
# extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
7.3 Anthropic SDK (совместимый)
V4 поддерживает OpenAI ChatCompletions и Anthropic Messages — base_url без изменений, обновить model:
client = anthropic.Anthropic(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
message = client.messages.create(
model="deepseek-v4-pro",
max_tokens=4096,
messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)
8. FAQ
В: Стоит ли ждать от GA чуда?
Ценность не в мгновенном обгоне Claude Fable 5 или GPT-5.6, а в лучшей open source производительности за 1/10–1/100 стоимости closed флагманов — с опцией private deployment.
В: Пиковые тарифы — откат?
Усложняют планирование, но непиковые ставки остаются крайне конкурентными — признак зрелой платформы, а не вечного демпинга.
В: Всё ещё на deepseek-chat?
Завершите миграцию до 24 июля, иначе сервис оборвётся.
9. Итог: GA как веха open source 2026
DeepSeek V4 GA — для компаний без экспорта данных, разработчиков с ограниченным бюджетом, agent-инженеров с 1M контекстом и команд, оптимизирующих price/performance — сейчас почти беспробельный выбор в open source.
Локальный прогон весов V4 для agent-интеграции на Windows/Linux/VPS упирается в отсутствие Xcode/Metal/unified memory stack Apple Silicon: ноутбук в sleep рвёт 7×24 cron batch-inference и SFTP/rsync sync workspace. Всегда онлайн remote Mac на Apple Silicon стабилизирует пиковый планировщик, batch cron и приёмку миграции до 24.07. — см. локальный V4-Flash inference на Mac. SFTPMAC аренда удалённого Mac даёт нативные macOS-ноды с низкой latency для API-switch и agent pipelines в окне миграции.
Источники: Официальная документация DeepSeek · arXiv:2606.19348 · HuggingFace model pages · LLMReference · Artificial Analysis · MangoMind Blog