2026 DeepSeek подорожание API: ёмкость, Qwen open weights и GLM-5.3
За пять дней DeepSeek вынес дефицит пиковой GPU-ёмкости в прайс (до 1 100% на cache-hit input V4-Pro), Alibaba открыла веса MoE 2,4T / 95B, Zhipu подняла GLM-5.3 тем же 743B foundation через post-training RL. Это уже не гонка «кто дешевле», а борьба за ценовую власть. Ниже — арифметика peak/off-peak, лицензионный потолок Qwen и матрица, куда уводить откладываемые eval.
1. Три ошибки решения: заголовки, «всегда дешевле», ноутбук со сном
- Смешивать «11×», «1 100%» и «350%» как один рост: все три цифры верны, но описывают разные строки биллинга — cache-hit input, output и cache-miss input. Смешение раздувает или сжимает инвойс на порядок.
- Считать официальный API DeepSeek всегда самым дешёвым: на пике собственный list price уже выше ряда реселлеров (GMI Cloud, Novita и другие сейчас держат V4 Pro ниже нового официального peak). Дефолт «китайская модель = минимум цены» больше не безопасен.
- Гонять peak-чувствительные агентные eval на ноутбуке, который засыпает: в анонсе прямо просят более гибкое расписание нагрузки. Закрытая крышка в пекинский off-peak — это покупка дорогих часов по ошибке.
2. Хронология: что случилось и в какие даты
| Дата | Событие |
|---|---|
| 16 июля 2026 | Moonshot AI открывает веса Kimi K3 (2,8T параметров), реакция US security |
| 2–3 августа 2026 | Alibaba показывает, затем запускает Qwen3.8-Max как hosted API |
| 10 августа 2026 | Meta выпускает Muse Glimmer (30B, Apache 2.0), намекает на open weights флагмана Muse Spark 1.2 |
| 12 августа 2026 | Alibaba публикует Qwen3.8-2.4T-A95B на Hugging Face/ModelScope; xAI выпускает Grok 4.6 |
| 13 августа 2026 | DeepSeek-V4-Pro выходит в GA и объявляет повышение с 17 августа; Google выпускает уценённый Gemini 3.7 Flash |
| 14 августа 2026 | Zhipu выпускает GLM-5.3, тот же 743B base, что у GLM-5.2 |
| 17 августа 2026, 00:00 по пекинскому времени | Новый прайс DeepSeek вступает в силу |
Шире кадр ещё жёстче: 30 июля OpenAI срезала самый дешёвый tier (GPT-5.6 Luna, −80%), а 6–7 августа сделала Luna бесплатным дефолтом с безлимитным текстовым чатом. Пока китайские лаборатории поднимают цены и открывают флагманские веса, американские режут consumer-слой до нуля — в том же календарном окне. Это не совпадение, а две стороны одной борьбы за прайс. Предыдущие разборы на уровне продукта: релиз Qwen3.8-Max, официальные бенчмарки V4-Flash и снижение GPT-5.6 Luna на 80%.
3. Цифры: что именно изменилось в биллинге
Повышение DeepSeek по строкам (с 17 августа, 00:00 по пекинскому времени; пик — 09:00–12:00 и 14:00–18:00 по Пекину)
| Строка биллинга (за 1M токенов) | Старый тариф | Новый off-peak | Новый peak | Рост на пике |
|---|---|---|---|---|
| V4-Flash cache hit (input) | ¥0.02 | ¥0.05 | ¥0.10 | ~400% |
| V4-Flash cache miss (input) | ¥1.0 | ¥1.5 | ¥3.0 | 200% |
| V4-Flash output | ¥2.0 | ¥4.5 | ¥9.0 | 350% |
| V4-Pro cache hit (input) | ¥0.025 | ¥0.15 | ¥0.30 | ~1 100% |
| V4-Pro cache miss (input) | ¥3.0 | ¥4.5 | ¥9.0 | 200% |
| V4-Pro output | ¥6.0 | ¥13.5 | ¥27.0 | 350% |
Заголовок «1 100%» относится строго к peak cache-hit input — строке, которая стартовала почти с нуля. Output, который доминирует в большинстве реальных счетов, вырос на 350%. Независимое моделирование тяжёлой нагрузки (~84 млн токенов/мес, в основном off-peak, половина попаданий в кэш) даёт рост счёта ближе к 1,8×: рост есть, но это не «счёт ×11».
Qwen3.8-2.4T-A95B (открытые веса Qwen3.8-Max): ключевые спеки
| Параметр | Значение |
|---|---|
| Параметры | 2,4T всего, 95B активных на токен (MoE, 512 экспертов, 10 routed + 1 shared) |
| Контекст | 262 144 токена native (открытый чекпоинт), расширяется до ~1,01M; hosted Max по умолчанию 1M |
| Каденция релиза | Preview 2 августа → API live 3 августа → open weights 12 августа |
| API (международный) | $2/M input, $6/M output |
| Лицензия | Не Apache 2.0 — кастомная «Qwen3.8-Max License» |
| Почему это важно | Первый раз Alibaba открыла веса Max-tier (флагман); Qwen3.5/3.6/3.7 Max оставались только API |
Арифметика MoE здесь важнее маркетингового «2,4 триллиона». На каждый токен живы 10 routed + 1 shared из 512 экспертов — то есть ~95B активных. Счёт за inference ближе к dense-модели на ~100B, а не к полному чекпоинту. Полный 2,4T checkpoint — это multi-node serving; API обходит этот барьер железа.
GLM-5.3 vs GLM-5.2: та же база, только post-training
| Бенчмарк | GLM-5.2 | GLM-5.3 | Изменение |
|---|---|---|---|
| Terminal-Bench 3.0 | 4,6% | 28,3% | +23,7 п.п. |
| DeepSWE v1.1 | 46,2% | 66,9% | +20,7 п.п. |
| Agents' Last Exam (CLI) | 23,8% | 28,5% | +4,7 п.п. |
| CyberGym | 77,2% | 84,5% | +7,3 п.п. |
| AutomationBench | 26,2% | 48,2% | +22,0 п.п. |
Это собственные цифры Zhipu — независимого третьего прогона пока нет. На Terminal-Bench 3.0 GLM-5.3 всё ещё позади GPT-5.6 Sol (34,6%) и Claude Fable 5 (33,7%): сильный open-weight результат, не абсолютная победа на frontier.
4. Три стратегии: ёмкость, лицензия, post-training RL
DeepSeek: с плоского тарифа на time-of-day — это задача ёмкости, не смена идеологии
Самое дешёвое прочтение хода DeepSeek — «самая дешёвая китайская модель сдалась марже». Структура прайса говорит об обратном: компания впервые сделала дефицит compute видимым в таблице. Плоский всегда-дешёвый тариф работал как инструмент захвата, пока GPU-ёмкость успевала за спросом. Когда usage рос экспоненциально, а ёмкость — нет, что-то должно было стать явным. Формула анонса про «более гибкое расписание нагрузки» — корпоративный перевод фразы «пиковый compute стал дефицитом, сдвиньте нагрузку сами».
Деталь, которую международные обзоры почти не заметили: на пике официальный API DeepSeek теперь дороже ряда сторонних реселлеров (GMI Cloud, Novita и другие держат V4 Pro ниже нового peak). Допущение «официальный endpoint всегда самый дешёвый способ гонять DeepSeek» — часть репутации — сломано впервые.
Alibaba: открытые веса покупают экосистему; кастомная лицензия держит потолок выручки
Выгрузка Qwen3.8-Max — не жест щедрости. Alibaba сделала два хода одновременно: опубликовала полный чекпоинт 2,4T для свободного скачивания и повесила кастомную лицензию — не permissive Apache 2.0 младших Qwen. Любой бизнес «Model-as-a-Service» или «AI Work Assistant» с выручкой свыше 50 млн долларов за любые 12 месяцев обязан согласовать отдельную коммерческую лицензию; продукты с 100 млн+ MAU или 20 млн+ долларов месячной выручки должны заметно показывать имя модели.
Логика: отдать веса ради mindshare разработчиков (особенно за рубежом, где «модель made-in-China» всё ещё тормозит enterprise-закупки) и сохранить рычаг над теми немногими, кто реально способен поднять конкурирующий inference-бизнес на этом чекпоинте. Это другая ставка, чем Muse Glimmer у Meta под неограниченным Apache 2.0: «open weights» в этих двух релизах означает разное.
Слух, который стоит убить явно: в сети утверждали, что лицензия Alibaba запрещает скачивание из США, ЕС, Великобритании и Южной Кореи. Это ложь. В опубликованном тексте нет географической или территориальной оговорки. В цикле релизов такой плотности проверка первоисточника (файл LICENSE, не тред анонса) занимает секунды и избавляет от повторения опровергнутого тезиса.
GLM-5.3: новой базы нет, есть более крупная ставка на post-training — и это главный сюжет
Самый интересный факт про GLM-5.3 — не скор, а метод: тот же 743B foundation, что у GLM-5.2, нулевой retrain базы и скачок примерно 6× на Terminal-Bench 3.0 (4,6% → 28,3%) только за счёт масштабирования RL-окружений на этапе post-training. Это фиксирует тренд, который копился месяцами: законы масштабирования pretraining дают убывающую отдачу, а масштаб post-training RL становится независимым рычагом с гораздо более низким полом затрат, чем обучение нового foundation. Барьер входа падает — поэтому mid-tier лаборатории без бюджета OpenAI всё ещё могут закрывать разрыв на агентных и coding-бенчмарках.
5. Сравнение: DeepSeek ещё самый дешёвый frontier?
| Модель | Input (за 1M токенов) | Output (за 1M токенов) | Open weights? |
|---|---|---|---|
| DeepSeek V4-Pro (peak) | ¥9.0 (~$1.26) | ¥27.0 (~$3.78) | Нет |
| DeepSeek V4-Pro (off-peak) | ¥4.5 (~$0.63) | ¥13.5 (~$1.89) | Нет |
| Qwen3.8-Max (международный API) | $2.00 | $6.00 | Да (кастомная лицензия) |
| OpenAI GPT-5.6 Luna | $0.20 | $1.20 | Нет |
| Claude Opus 5 (оценка по собственному сравнению Alibaba) | ~$5.00 | ~$25.00 | Нет |
Пересчёт RMB→USD по ~¥7.15/$1, оценка. Короткий ответ: нет. Даже после повышения off-peak V4-Pro всё ещё заметно ниже Claude Opus 5, но это уже не абсолютный минимум на столе — и международный прайс Qwen3.8-Max, и Luna от OpenAI обходят новый off-peak DeepSeek. «Китайская модель = самая дешёвая» держалось большую часть 2025 и начала 2026; как безопасное допущение это больше не работает.
6. Что спорно и не подтверждено
- Заголовок «1 100%» технически верен, но без контекста вводит в заблуждение. Он относится только к peak cache-hit input — строке, которая стартовала ближе всего к нулю. Output — статья, которая доминирует в большинстве реальных счетов — вырос на 350%. Разные издания цитировали разные строки так, будто это весь прайс.
- Утверждения, что Qwen3.8-Max крутится на собственных чипах Alibaba Zhenwu M890 (ряд китайских финансовых изданий подавал это как полностью отечественный inference-стек) Alibaba в своей технической документации и независимые бенчмарки не подтвердили. Читайте как vendor-adjacent, не верифицировано, пока не появится подтверждение.
- Сообщение, что GLM-5.3 нашёл «серьёзную уязвимость» в Cursor, идёт из материала VentureBeat и собственного раскрытия Zhipu; конкретные технические детали уязвимости не опубликованы. Это vendor-sourced находка, не независимый аудит.
- Сообщения, что Министерство коммерции КНР готовит ответные экспортные ограничения на ИИ/полупроводники, спекулятивны и опираются на неподтверждённые медиа, не на официальный анонс. Фон, не установленный факт.
7. Две ценовые войны параллельно
В широкой рамке проявляется паттерн. За примерно месяц топ-лаборатории КНР штамповали мажорные релизы в темпе, который местная финансовая пресса уже называет «три обновления модели в неделю» (一周三更) — DeepSeek, Alibaba и Zhipu, плюс ранее Moonshot Kimi K3 (open weights 16 июля, 2,8T) и MiniMax H3. Китайские обзоры в целом рисуют это как открытые веса, которые «принуждают отрасль к глобальному пересмотру цен» — формулировка заметно жёстче, чем у англоязычной прессы по тем же событиям.
Американские лаборатории в это же время играют противоположную партию на consumer-слое: OpenAI срезала 80% на самом дешёвом tier (30 июля), затем сделала эту модель бесплатной и безлимитной для всех (6–7 августа); Google выпустила coding-модель вдвое дешевле трёхнедельного предшественника (13 августа). Китай открывает флагманские веса и вводит ступенчатый, более высокий прайс на compute-ограниченном верхе; США гонят consumer-конец к нулю. Обе стратегии реальны; они оптимизируют разные участки воронки.
Есть и геополитический слой, который стоит называть аккуратно. Open weights Kimi K3 в июле уже вызвали реакцию US security; выбор Alibaba именно этого окна для выгрузки флагмана 2,4T часть аналитиков читает как фиксацию международного mindshare и нарратива «технологического паритета» до возможного ужесточения регуляторики. Это обоснованная интерпретация, не подтверждённый факт — но часть контекста, которую почти не видно, если читать только англоязычный tech press: там релизы идут как изолированные продуктовые новости, а не как согласованный национальный паттерн.
8. Пять шагов: пересчитать счёт и переложить нагрузку
- Развести заголовочные множители: 1 100% — это peak cache-hit input V4-Pro. Output — 350%. Cache-miss input — 200%. Сверьте официальную строку, прежде чем менять маршрутизацию.
- Разрезать последние 30 дней по пекинскому часу: пик — 09:00–12:00 и 14:00–18:00. Доля пика решает, увидите ли вы ~1,8× или заголовочный множитель.
- Оценить cache-hit rate: тяжёлая, в основном off-peak нагрузка с половиной попаданий смоделирована около 1,8×. Пик плюс низкий hit rate — там, где заголовки становятся реальностью.
- Прочитать лицензию Qwen до выкладки: личное и внутреннее использование допустимо. MaaS / AI Work Assistant свыше 50 млн долларов за любые 12 месяцев требует отдельной коммерческой лицензии. 100 млн+ MAU или 20 млн+ долларов месячной выручки — обязаны показывать имя модели. Географического запрета нет.
- Положить откладываемую работу на удалённый Mac без сна: батчи и ночные агентные eval должны миновать пекинский пик. Ноутбук со сном это окно не удерживает.
9. Матрица хоста для off-peak eval
| Вариант | Подходит | Главный предел | Peak/off-peak |
|---|---|---|---|
| Личный ноутбук | Чтение анонса, правка маршрутов, короткие smoke-тесты | Сон рвёт off-peak окно; дрейф таймзоны относительно пекинского пика | Только черновик — не ночной батч |
| Обычная облачная Linux VM | API-only батч, headless-регрессия | Нет нативного стека macOS / Cursor / Xcode | Нормально для серверного off-peak, слабо для eval на Apple-инструментах |
| Удалённый Mac Apple Silicon SFTPMAC | Агентные eval по пекинскому расписанию, Cursor / OpenClaw, прогоны open weights | Нужно заложить тариф и полосу | Always-on + синхронизация SFTP, рассчитан на дешёвые off-peak часы |
10. FAQ
DeepSeek после повышения всё ещё дешевле GPT-5.6 или Claude?
Off-peak ставка по-прежнему ниже Claude Opus 5, но это уже не самый дешёвый вариант в целом: GPT-5.6 Luna от OpenAI (0,20 / 1,20 доллара за миллион токенов) и международный прайс Alibaba Qwen3.8-Max (2 / 6 долларов) обходят новый off-peak DeepSeek хотя бы по одному измерению. Для модели frontier-класса DeepSeek всё ещё относительно дёшев, просто больше не абсолютный минимум.
Можно ли бесплатно использовать открытые веса Alibaba Qwen3.8-Max в коммерческом продукте?
Да, для большинства сценариев: личные проекты и внутреннее корпоративное использование не затрагиваются. Ограничение срабатывает только если вы ведёте бизнес «Model-as-a-Service» или «AI Work Assistant» и заработали свыше 50 млн долларов за любые последовательные 12 месяцев; этому уровню нужна отдельная коммерческая лицензия Alibaba.
Qwen3.8-Max запрещён или ограничен для пользователей США, ЕС или Великобритании?
Нет. Утверждение гуляло в сети, но оно ложно: в опубликованной лицензии нет географического ограничения любого вида. Ограничения завязаны на выручку (сколько зарабатывает ваш сервис), а не на то, где находитесь вы или ваши пользователи.
Чем GLM-5.3 реально отличается от GLM-5.2?
На уровне базовой модели — ничем: оба используют один и тот же foundation на 743 млрд параметров. Прирост (примерно 6× на Terminal-Bench 3.0) целиком получен масштабированием обучения с подкреплением на этапе post-training, без повторного обучения базы.
Meta действительно откроет веса флагмана, а не только меньший Muse Glimmer?
Пока нет. Muse Glimmer — дистиллированная модель на 30B, не настоящий флагман Meta. CEO Марк Цукерберг заявил, что открытые веса более крупной закрытой Muse Spark 1.2 появятся «вскоре»; если это случится, это будет первый открытый флагман США. На момент публикации релиза нет; это заявленное намерение, а не подтверждённый факт.
Источники: официальный анонс тарифов DeepSeek, сверка с Wall Street CN, IT Home, AIGC.cn и обсуждением V2EX; официальные репозитории моделей Qwen (Hugging Face / ModelScope) и материал South China Morning Post по условиям лицензии; официальная техническая страница GLM-5.3 Zhipu (Z.ai), плюс обзоры VentureBeat и StableLearn; официальный блог Meta AI Research и материал VentureBeat по Muse Glimmer; китайские финансовые издания (Yicai/第一财经, Sohu Finance) по темпу и рамке цикла open-weight релизов. Цены, лицензии и бенчмарки отражают публичные данные на момент публикации. Перед перепечаткой сверяйте актуальный официальный прайс и текст лицензии; детали, помеченные выше как неподтверждённые (взгляд на отечественные чипы, отчёт об уязвимости Cursor, слухи об экспортном контроле), независимо не верифицированы.
11. Что даёт пересчёт — и где ноутбук всё ещё ломает окно
Хронология, три таблицы данных и head-to-head ставки достаточны для одного решения: развести заголовок по строкам биллинга, затем пересчитать против вашей доли пекинского пика и cache-hit rate. Открытые веса — не «бери и продавай», пока не прочитана лицензия.
Пределы так же явны. Скоры GLM-5.3 — vendor-reported. Zhenwu M890, тезис про уязвимость Cursor и слухи об экспортном контроле остаются неподтверждёнными. Курс — оценка по ~¥7.15/$1. Обзор не заменяет ваш собственный срез трафика и ревью лицензии.
Если следующий шаг — ночные батч-eval, агентные прогоны по пекинскому расписанию или проба открытых весов Qwen внутри Cursor / OpenClaw, ноутбук со сном — это способ промахнуться мимо дешёвых часов. Поставьте планировщик на круглосуточный удалённый Mac Apple Silicon и синхронизируйте eval-репо по SFTP/rsync. Аренда удалённого Mac SFTPMAC даёт нативный macOS, низколатентную совместную работу и аптайм 24/7 — более надёжное место, чтобы превратить этот сдвиг прайса в воспроизводимую смену маршрутизации.