数据中心机柜与指示灯,象征大模型推理算力与峰谷定价背后的容量约束

DeepSeek涨价+阿里开源2.4万亿旗舰+GLM-5.3跃升:中国大模型8月为何集体「变阵」?

8月12日到17日的五天里,中国大模型圈接连做了三件互相矛盾又互相呼应的事:DeepSeek宣布API涨价最高超1100%,阿里同步把从未开源过的Qwen-Max级旗舰模型2.4万亿参数权重放出来,智谱则用同一个基座模型、纯靠后训练把编程测试成绩拉高数倍。三家公司、三种打法,共同指向同一个信号——国产大模型正在从「卷价格」转向「卷定价权」。

1. 三类决策痛点:口径、比价与错峰宿主机

  1. 把「涨11倍」「涨超1100%」「涨350%」当成同一回事:这些说法都对,但对应的是不同计费维度——缓存命中输入、输出、缓存未命中输入。混读 headline 会把账单估错一个数量级。
  2. 默认「官方 DeepSeek 永远最便宜」:涨价后高峰时段官方价已反超部分第三方转售平台(如 GMI Cloud、Novita 目前报价仍低于官方高峰价)。「国产=全场最低」正在瓦解。
  3. 用会休眠的笔记本跑必须错峰的 Agent 评测:新定价鼓励「更灵活的工作负载调度」。合盖即断、时区对不齐,等于主动买高峰价。

2. 发生了什么:一张时间线看懂这两周

日期 事件
7月16日 月之暗面Kimi K3(2.8万亿参数)开源,此前已引发美方安全关注
8月2日-3日 阿里Qwen3.8-Max先预告、后上线云端API
8月10日 Meta发布开源模型Muse Glimmer(300亿参数,Apache 2.0),预告旗舰Muse Spark 1.2权重「即将开源」
8月12日 阿里正式在ModelScope/Hugging Face放出Qwen3.8-2.4T-A95B开源权重;同日xAI发布Grok 4.6
8月13日 DeepSeek-V4-Pro正式版上线,同步公告8月17日起API涨价;谷歌发布降价的Gemini 3.7 Flash
8月14日 智谱发布GLM-5.3,沿用GLM-5.2的7430亿参数基座
8月17日 0点(北京时间) DeepSeek新定价正式生效

把镜头拉远一点:7月30日OpenAI已经把最便宜档的GPT-5.6 Luna降价80%,8月6日-7日又把Luna设为免费用户默认模型并开放无限文本对话——也就是说,中国厂商在涨价和开源上做加法的同一时间,美国厂商正在免费和降价上做加法。这不是巧合,而是同一场定价博弈的两个侧面。更早的产品向拆解见《Qwen3.8-Max发布解读》与《V4-Flash正式版评测》;OpenAI降价背景见《GPT-5.6 Luna降价80%》。

3. 核心数据一览

DeepSeek涨价明细(8月17日0点起,北京时间9-12点、14-18点为高峰时段)

计费项(每百万tokens) 涨价前 空闲时段(新) 高峰时段(新) 涨幅(高峰)
V4-Flash 缓存命中输入 ¥0.02 ¥0.05 ¥0.10 约400%
V4-Flash 缓存未命中输入 ¥1.0 ¥1.5 ¥3.0 200%
V4-Flash 输出 ¥2.0 ¥4.5 ¥9.0 350%
V4-Pro 缓存命中输入 ¥0.025 ¥0.15 ¥0.30 约1100%
V4-Pro 缓存未命中输入 ¥3.0 ¥4.5 ¥9.0 200%
V4-Pro 输出 ¥6.0 ¥13.5 ¥27.0 350%

数据来源:DeepSeek官方公告,经华尔街见闻、IT之家、V2EX等多方交叉核对。缓存命中场景涨幅最大(最高约12倍/1100%+),但绝对金额仍很小;对重度调用者影响更大的其实是输出价格(350%)和缓存未命中输入价格。

Qwen3.8-2.4T-A95B(Qwen3.8-Max开源权重)关键规格

项目 数据
参数规模 2.4万亿总参数,950亿激活参数(MoE,512个专家,10路由+1共享)
上下文窗口 开源权重原生26.2万tokens,可扩展至约101万;云端Max版默认100万tokens
发布节奏 8月2日预告→8月3日API上线→8月12日开源权重
API定价(国际站) 输入$2/M tokens,输出$6/M tokens
许可证 非Apache 2.0,自定义「Qwen3.8-Max License」
意义 阿里历史上首次把Max级(旗舰)模型开源,此前Qwen3.5/3.6/3.7 Max均为闭源API

GLM-5.3 vs GLM-5.2:同基座,纯靠后训练

基准测试 GLM-5.2 GLM-5.3 变化
Terminal-Bench 3.0 4.6% 28.3% +23.7
DeepSWE v1.1 46.2% 66.9% +20.7
Agents' Last Exam(CLI) 23.8% 28.5% +4.7
CyberGym 77.2% 84.5% +7.3
AutomationBench 26.2% 48.2% +22.0

以上为智谱官方自测数据,尚无独立第三方复测结果。GLM-5.3在Terminal-Bench 3.0上仍落后GPT-5.6 Sol(34.6%)和Claude Fable 5(33.7%),并非全面登顶,而是「开源模型第一梯队」。

4. 深度拆解:三种打法,三种逻辑

DeepSeek:从「贴地价」到「分时定价」,本质是算力紧张的显性化

DeepSeek这次涨价最容易被误读为「跟涨」,但细看结构会发现它更像一次「算力账单透明化」。此前DeepSeek长期采用不分时段的统一低价,本质上是用低价换取用户规模,再靠缓存命中率和错峰调度摊薄成本。但当调用量指数级增长、GPU产能跟不上时,这套模式撑不住了——涨价公告里「鼓励更灵活的工作负载调度」这句话,翻译过来就是「我们的算力已经不够用了,请你自己错峰」。

值得注意的细节:涨价后DeepSeek官方API的价格,在高峰时段已经反超部分第三方转售平台(如GMI Cloud、Novita等目前报价仍低于DeepSeek官方高峰价)。这意味着「官方价格最便宜」这个曾经支撑DeepSeek护城河的假设,第一次被打破。

阿里:开源权重,圈住生态;自定义许可证,圈住收入

Qwen3.8-Max的开源不是简单的「慈善」。阿里同时做了两件事:把2.4万亿参数的权重公开下载,同时给这个权重配了一份不同于以往Apache 2.0的自定义许可证——年营收超5000万美元的「模型即服务」或「AI工作助手」业务,必须单独找阿里谈商业授权;月活超1亿或月收入超2000万美元的产品,必须在界面上显著展示模型名称。

这套组合拳的逻辑是:用开源换开发者生态和口碑(尤其是海外开发者,缓解「国产模型上不了台面」的印象),但在真正能产生现金流的大客户身上,继续保留议价权。这也是为什么它和Meta的Muse Glimmer(完全Apache 2.0,无附加条款)在「开源程度」上其实不是一个量级。

需要澄清一个流传较广的谣言:网上一度传阿里的许可证禁止美国、欧盟、英国、韩国用户下载,这是不实信息,官方许可证原文中并无任何地域限制条款——这类谣言的传播速度往往比读一遍原始许可证文本更快,值得对信息源保持警惕。

智谱GLM-5.3:不换基座,只换「后训练配方」,说明规模化训练已不是唯一杠杆

GLM-5.3最值得关注的不是分数本身,而是「怎么拿到这个分数」——基座模型和GLM-5.2完全相同(7430亿参数),没有重新预训练,仅靠扩大强化学习环境规模做后训练,就把Terminal-Bench 3.0从4.6%拉到28.3%,接近6倍提升。这印证了行业内近半年逐渐清晰的一个趋势:当预训练的Scaling Law边际收益放缓,「后训练强化学习规模化」正在成为新的性能杠杆,而这个杠杆的门槛显著低于重新训练一个千亿级基座模型,意味着更多中小厂商也有机会靠「精装修」追上头部模型。

5. 横向对比:涨价之后,DeepSeek还是「最便宜的旗舰」吗?

模型 输入价格(每百万tokens) 输出价格(每百万tokens) 开源程度
DeepSeek V4-Pro(高峰) ¥9.0(约$1.26) ¥27.0(约$3.78) 权重未开源
DeepSeek V4-Pro(空闲) ¥4.5(约$0.63) ¥13.5(约$1.89) 权重未开源
Qwen3.8-Max(国际站) $2 $6 开源(自定义许可证)
OpenAI GPT-5.6 Luna $0.20 $1.20 闭源
Claude Opus 5(据阿里披露的倍数关系推算) 约$5 约$25 闭源

换算汇率按约¥7.15/$1估算,仅供参考,实际以官方公告为准。可以看到:涨价后DeepSeek V4-Pro空闲时段价格仍明显低于Claude Opus 5,但已经不再是「全场最低」——阿里国际站的Qwen3.8-Max、OpenAI的Luna都比DeepSeek的空闲价更便宜,说明「国产=最便宜」的等式正在瓦解,价格竞争进入分层阶段。

6. 争议点与需要注意的细节

  • 涨价幅度的口径混乱:不同媒体分别报道「涨11倍」「涨超1100%」「涨350%」,这些说法都对,但对应的是不同计费维度(缓存命中输入 vs 输出 vs 缓存未命中输入),阅读时需要看清具体是哪一项。
  • 阿里「震悟M890国产芯片」服务的说法:多家中文财经媒体报道称Qwen3.8-Max部分推理服务跑在阿里自研的震悟M890芯片和「盘古AL128」超节点上,但这一细节目前仅见于中文媒体转述,未见阿里官方独立技术文档或第三方基准测试确认,建议标注为未经独立验证的信息。
  • GLM-5.3「发现Cursor严重漏洞」的说法:来自VentureBeat报道及智谱方面透露,具体漏洞细节未公开披露,真实性和影响范围有待第三方安全机构确认,属于厂商单方面披露
  • 中国商务部可能酝酿反制出口管制:部分报道提及中国官方可能针对AI/半导体技术酝酿反制性出口管制措施,这一说法目前未见官方正式确认,属于媒体推测/传闻性质,仅供背景参考。

7. 影响与背景:这不是孤立事件,而是一场「两线战争」

把这几件事放进更大的叙事里看:过去一个月,中国头部模型厂商呈现出「一周三更」的密集发布节奏——DeepSeek、阿里、智谱之外,还有月之暗面Kimi K3(7月16日,2.8万亿参数开源)、MiniMax H3等轮番登场。国内财经媒体普遍将这一现象解读为「中国开源模型密集发布,倒逼全球AI行业重新定价」。

与此同时,美国厂商走的是另一条路径:OpenAI 7月30日大幅降价(Luna降80%),8月6日-7日把降价后的Luna设为免费用户默认模型并开放无限文本对话;谷歌8月13日发布价格减半的Gemini 3.7 Flash。也就是说,中国厂商在「开源旗舰+梯度涨价」,美国厂商在「消费端免费+降价防守」——两条路径同时发生,共同把2026年8月变成了大模型行业定价逻辑重构的一个关键节点。

另一层背景是地缘政治:月之暗面Kimi K3的开源此前已引发美方安全审查关注,阿里选择在这个窗口把2.4万亿参数的旗舰模型开源,被部分分析解读为「在潜在监管收紧前,抢先巩固国产模型的国际影响力和技术对等叙事」。这一判断带有一定推测性质,但确实是理解这波开源潮时机选择时不可忽略的背景。

8. 五步实操:涨价后如何重算账单并选型

  1. 先分清涨幅口径:1100%对应的是V4-Pro高峰时段缓存命中输入;输出是350%;缓存未命中输入是200%。先对照官方计费项,再决定要不要改路由。
  2. 按北京时间切分近30天调用:高峰是9-12点、14-18点。把日志按小时聚合,算出高峰占比——这决定你看到的是1.8倍还是headline倍数。
  3. 测算缓存命中率:重度、可错峰、命中率较高的工作负载,有分析测算实际账单涨幅约为1.8倍;高峰+低命中才会接近headline。
  4. 核验Qwen开源权重的商用门槛:个人与内部使用基本不受影响。过去12个月「模型即服务」或「AI工作助手」累计收入超5000万美元须单独谈授权;月活超1亿或月收入超2000万美元须显著标注模型名。许可证原文无地域限制。
  5. 把可延迟任务放到持续在线的远程Mac:批处理、回归评测、夜间Agent跑分应主动错峰。笔记本合盖即丢掉空闲窗口;7×24 Apple Silicon节点才能按北京时间调度。

9. 错峰评测宿主机决策矩阵

方案 适合场景 主要限制 峰谷定价语境推荐度
个人笔记本 读公告、改路由配置、短时冒烟测试 合盖休眠打断错峰窗口;时区与北京高峰对不齐 仅适合草稿,不适合夜间批处理
通用云 Linux VM 纯 API 批处理、无 GUI 的回归评测 缺原生 macOS / Cursor / Xcode 生态;Apple 工具链联调另搭 适合服务端错峰,不适配 Apple 生态联调
SFTPMAC 远程 Apple Silicon Mac 按北京时间调度的 Agent 评测、Cursor / OpenClaw 联调、开源权重试验 需规划套餐与带宽 持续在线 + SFTP 同步,便于吃空闲价

10. 常见问题

Q1:DeepSeek这次涨价之后,是不是意味着以后用起来更贵了?
A:要分场景看。如果你的调用大多落在空闲时段(非北京时间9-12点、14-18点),且是缓存命中率较高的重度用户,实际涨幅会明显低于表面的「350%」「1100%」这类headline数字(有分析测算重度用户实际账单涨幅约为1.8倍左右);但如果集中在高峰时段调用、且缓存命中率低,涨幅会接近甚至达到headline数字。

Q2:阿里开源的Qwen3.8-Max,个人开发者能免费商用吗?
A:个人开发者和内部使用基本不受影响。但如果你的业务是「模型即服务」或「AI工作助手」类产品,且过去12个月内该业务累计收入超过5000万美元,需要单独向阿里申请商业授权;如果产品月活超1亿或月收入超2000万美元,需要在界面上显著标注模型名称。

Q3:GLM-5.3和GLM-5.2是同一个模型吗?为什么突然变强这么多?
A:底层基座模型确实完全相同(7430亿参数),智谱没有重新训练。分数大幅提升的原因是后训练阶段大幅扩大了强化学习环境的规模,这说明当前阶段「后训练规模化」本身就是一个独立、有效的性能杠杆,不一定需要重新预训练一个更大的基座。

Q4:网传阿里的Qwen3.8-Max许可证禁止美国、欧盟用户下载,是真的吗?
A:不是真的。这是网络上流传的不实信息,官方许可证原文中没有任何地域限制条款,主要限制是针对超过特定营收规模的商业化服务,与用户所在地区无关。

Q5:Meta这次开源Muse Glimmer,是不是意味着Llama时代的开源精神又回来了?
A:目前还只能算「部分回归」。Muse Glimmer本身只是一个300亿参数的蒸馏小模型,Meta真正的旗舰闭源模型Muse Spark 1.2尚未开源,扎克伯格只是「预告」未来会开放其权重。如果这一步真的落地,才称得上是美国厂商首次把旗舰级闭源模型转为开源,目前仍需持续关注后续进展。

数据来源:DeepSeek官方涨价公告,经华尔街见闻、IT之家、AIGC工具导航、V2EX社区讨论交叉核对;阿里Qwen官方模型仓库(Hugging Face / ModelScope)及南华早报(SCMP)关于许可证条款的报道;智谱(Z.ai)GLM-5.3官方技术页面及VentureBeat、StableLearn相关报道;Meta AI Research官方博客及VentureBeat关于Muse Glimmer的报道;第一财经、搜狐财经等关于中国大模型密集发布节奏的综合报道。以上数据截至发稿前公开信息整理,涉及价格、许可证条款、基准测试分数等内容建议发布前再次核实最新官方公告,部分细节(如芯片服务、安全漏洞发现、出口管制传闻)已在正文中标注为未经独立验证信息。

11. 总结:定价权变阵的价值、局限与工程底座

时间线、三张数据表和横向比价已经足够支撑一项决策:先按计费项拆开 headline,再按高峰占比与缓存命中率重算账单;开源权重要先读许可证,而不是先下 2.4 万亿参数。

局限同样明确:GLM-5.3 分数来自厂商自测;震悟 M890、Cursor 漏洞与出口管制传闻均未经独立验证;汇率按约¥7.15/$1估算。新闻本身不能替代你团队的真实流量切片与许可证审阅。

若下一步是按北京时间错峰跑批处理、回归评测,或在 Cursor / OpenClaw 上试验 Qwen 开源权重,个人笔记本更容易暴露「跑不完、对不齐高峰」的隐性成本。更稳妥的做法是把调度环境放到持续在线的 Apple Silicon 远程 Mac,用 SFTP/rsync 同步评测仓。SFTPMAC 远程 Mac 租赁提供原生 macOS 生态、低延迟协作与 7×24 在线——更适合把这次定价变阵,变成可复现的路由与评测动作。