DeepSeek V4 Flash 正式版大模型 API 定价与 Agent 跑分对比决策示意图

DeepSeek V4 Flash正式版评测:跑分逼近Opus 4.8,价格便宜近百倍,Pro版还要等多久?

2026 年 7 月 31 日,DeepSeek 将 V4-Flash 升级为官方版 0731:参数规模不变、仅重训后训练,Agent 跑分反超更大的 V4-Pro 预览版,价格仅为 Claude Opus 4.8 的几十分之一。旗舰 V4-Pro 官方版与自研 Agent 框架 Harness 仍处于「即将发布」状态。本文梳理完整时间线、定价表、CSA+HCA 架构拆解、Artificial Analysis 横向对比、Harness 争议与「斩杀线」行业背景,并给出五步 API 迁移清单与 Agent 宿主机决策矩阵。

1. 三类决策痛点:跑分、价格与 Harness 依赖

  1. 把 Terminal Bench 2.0 跑分当作通用 Agent 能力:V4-Flash-0731 公布的 Agent 类跑分(Terminal Bench 2.0 拿到 82.7 分,反超 V4-Pro 预览版的 67.9 分)全部基于 DeepSeek 自研且尚未公开发布的 Harness「极简模式」测得。官方 changelog 主动提示「跑分对 harness 的选择非常敏感」——在 Claude Code、Cursor 等第三方框架独立复现之前,不应把厂商自报数字直接套用到你的生产 Agent 栈。
  2. 只看价格不看缓存命中率与高峰加价:V4-Flash 输入价 $0.14(缓存未命中)/ $0.0028(命中)每百万 Token,相对 Claude Opus 4.8 便宜近百倍;但海外开发者社区反馈正式版存在输入缓存命中率偏低、安全分类器偶发超时等问题。DeepSeek 还预告未来将对 API 启用「高峰时段 2 倍加价」(北京时间 9–12 点、14–18 点),截至发稿未公布具体生效日期——批量 Agent 任务的真实成本可能高于表价。
  3. 等 V4-Pro 官方版而错过 Flash 窗口期:V4-Pro 官方版仍是「尽快发布」,媒体援引未署名消息源称 GA 窗口可能在 8 月 10–20 日之间,但未经 DeepSeek 官方证实。若你的场景是批量调用、Agent 流水线或对绝对智能上限不敏感,当前 V4-Flash-0731 已在 Agent 跑分上反超 V4-Pro 预览版,且仅限 API 公测(App 和网页端暂未同步)——拖延迁移等于继续支付更高单价或承担旧接口停用风险。

2. 时间线:从 4 月预览到 7 月「官方版」

DeepSeek 这次的版本迭代并不是一次性事件,而是拉了三个多月的连续动作,中间每一步都被国内外社区放大讨论:

  • 2026 年 4 月 24 日:DeepSeek-V4 预览版首次发布并开源,包含 V4-Pro(1.6T 总参数/49B 激活)和 V4-Flash(284B 总参数/13B 激活)两个版本,均支持 100 万 token 上下文,采用 MIT 协议。
  • 2026 年 7 月 24 日:旧接口模型名 deepseek-chatdeepseek-reasoner 正式停用,全部流量切换到 V4 系列命名。
  • 2026 年 7 月 27 日:月之暗面(Moonshot AI)的 Kimi K3(2.8T 总参数)开源权重上线 Hugging Face,是当时体量最大的开源权重发布之一,给 DeepSeek 制造了不小的竞争压力。
  • 2026 年 7 月 31 日:DeepSeek-V4-Flash-0731 正式版进入 API 公测,开源权重同步上线 Hugging Face,官方 changelog 首次点名自研 Agent 框架「Harness」,称即将随 V4 正式版一起发布。这次公测仅限 API,App 和网页端暂未同步更新。
  • 截至 2026 年 8 月 5 日(发稿时):V4-Pro 官方版仍是「尽快发布」,没有官方确认日期。国内有媒体援引未署名消息源称内部测试已在 7 月 28 日那周启动,正式 GA 窗口可能在 8 月 10 日至 20 日之间——这一时间点目前未经 DeepSeek 官方证实,仅供参考

3. 核心数据一览:定价与参数对比表

模型 状态 总参数 / 激活参数 上下文 输入价格(缓存未命中/命中,每百万 token) 输出价格(每百万 token) 协议
DeepSeek-V4-Flash-0731 官方正式版(2026-07-31) 284B / 13B 1M $0.14 / $0.0028 $0.28 MIT
DeepSeek-V4-Pro 预览版(2026-04-24,官方版未发布) 1.6T / 49B 1M $0.435 / $0.003625 $0.87 MIT
Kimi K3(月之暗面) 权重开源(2026-07-27) 2.8T / 激活参数未公开(约 104B,社区估算) ~1.05M $3.00 / $0.30 $15.00 Kimi K3 License(含商用附加条款)
GLM-5.2(智谱/Z.ai) 开源(2026 年 6 月) ~744B / ~40B 1M 未在本文核实范围内 未在本文核实范围内 MIT
Qwen3.8-Max(阿里) API 可用(2026-08-02),权重待放出 2.4T / 95B 1M $2.00 / ~$0.17–0.25 $6.00 官方承诺开源,尚未放出权重

说明:以上定价均为 DeepSeek、Moonshot、阿里等官方公开数据,属于「厂商自报」信息;DeepSeek 已预告未来将对 API 启用「高峰时段 2 倍加价」(北京时间 9–12 点、14–18 点),但截至发稿未公布具体生效日期。

4. 深度拆解:后训练、CSA+HCA 架构与 Harness

架构没有变,变的是后训练

这次最容易被忽略、但其实最关键的一点是:V4-Flash-0731 在参数规模、模型结构上和 4 月预览版完全相同,DeepSeek 官方明确说明性能提升「完全来自重新进行的后训练」,而非扩大模型规模。284B 总参数、13B 激活参数的 Flash 版本,在多项 Agent 基准上反而超过了参数量是自己好几倍的 V4-Pro 预览版——2026 年下半年的大模型竞争,后训练数据质量和方法的重要性正在逼近甚至超过单纯堆参数。

混合注意力机制:CSA+HCA、mHC、Muon 优化器

根据 DeepSeek 发布的技术报告(论文题为《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》),V4 系列在架构上做了三处关键改动:

  1. 混合注意力架构:结合压缩稀疏注意力(CSA)与高度压缩注意力(HCA),官方对外统一称为「DSA 稀疏注意力」,核心目的是在长上下文场景下降低计算和显存开销;
  2. 流形约束超连接(mHC):对传统残差连接结构做了改进;
  3. Muon 优化器:替换传统优化器,用于提升训练收敛速度和稳定性。

三项改动叠加的效果是:在 100 万 token 上下文场景下,V4-Pro 相比前代 V3.2,单 token 推理所需 FLOPs 仅为 27%,KV Cache 占用仅为 10%。这是 DeepSeek 官方公布的技术指标,尚未看到独立第三方机构的复现验证,但如果基本属实,意味着「百万级上下文」第一次有可能以接近主流上下文长度的成本大规模商用,而不只是一个营销参数。

自研 Agent 框架 Harness 首次亮相

7 月 31 日的 changelog 里第一次正式出现「DeepSeek Harness」这个名字——这是 DeepSeek 自研的 Agent 执行框架,用于让模型读写文件、调用工具、执行命令、完成端到端的工程任务,对标的产品是 Claude Code。在此之前,DeepSeek 的模型主要依赖 Claude Code、OpenCode 等第三方 Agent 工具来完成类似任务。官方公开的 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)全部是用 Harness 的「极简模式」(minimal mode)测出来的,DeepSeek 在 changelog 里也主动提示:「跑分对 harness(执行框架)的选择非常敏感,不能简单等同于模型本身能力的提升」——这句话本身就值得读者留意。

5. 横向对比:Artificial Analysis 六边形混战

DeepSeek-V4-Flash 的这次更新,恰好卡在中国大模型开源阵营最密集的窗口期。把几家近期动作放在一起看,格局会更清楚:

模型 实验室 发布/权重开放时间 总参数 独立测评 Intelligence Index(Artificial Analysis) 单任务平均成本(Artificial Analysis)
DeepSeek-V4-Flash-0731 DeepSeek 2026-07-31(官方版) 284B 50 $0.03
Kimi K3 月之暗面 2026-07-16 预览 / 07-27 权重 2.8T 57 $0.86
GLM-5.2 智谱/Z.ai 2026 年 6 月 ~744B 比 V4-Flash 高约 1 分 未在本次调研范围内核实
Qwen3.8-Max 阿里 2026-08-02 GA(权重待放出) 2.4T 未在本次调研范围内核实 未在本次调研范围内核实
GPT-5.6 Sol OpenAI 闭源 未公开 比 V4-Flash 高 9 分以上 $1.86
Claude Fable 5 Anthropic 闭源 未公开 比 V4-Flash 高 9 分以上 $3.15

数据来源标注:Intelligence Index 与单任务成本数据引自研究机构 Artificial Analysis(第三方独立评测),经财经媒体(旺得富理财网等)转引;DeepSeek 官方跑分(Terminal Bench 2.0、SWE Verified 等)为厂商自报,两组数据的评测方法和权重不完全一致,不能直接相加比较,本文分开列出以示区分。

可以看到一个有意思的反差:在 Artificial Analysis 这个第三方综合指数上,V4-Flash 的「智能分」其实不是最高的,甚至落后于 Kimi K3 和 GLM-5.2;但它的单任务成本只有 Kimi K3 的约 1/29、GPT-5.6 Sol 的约 1/62、Claude Fable 5 的约 1/105。DeepSeek 这次打的不是「跑分第一」,而是「够用的智能 + 极致的价格」——V4-Flash 预览版曾在 OpenRouter 上连续七周稳坐调用量第一,目标用户是需要大规模调用、对绝对智能上限没那么敏感的 Agent 和批量任务场景。

6. 争议点:跑分好看,不代表没有水分

  • 跑分方法依赖 Harness,官方自己都在提醒别只看数字:V4-Flash-0731 公布的 Agent 类跑分全部基于 DeepSeek 自研且尚未公开发布的 Harness 极简模式测得,参数设置为 max 档位、top_p=0.95、temperature=1.0。在独立社区(如 Hugging Face 博主、海外开发者论坛)复现之前,这组数字应被视为「厂商自报+特定框架」结果,而非可以直接横向套用到其他 Agent 框架(如 Claude Code、Cursor)上的通用能力。
  • 海外开发者反馈了具体的可用性问题:据 21 世纪经济报道援引的海外开发者社区反馈,V4-Flash 正式版存在输入缓存命中率偏低、安全分类器偶发超时等问题,这些细节反映出算力和参数储备仍是限制模型能力上限的现实瓶颈,和「跑分暴涨」的营销叙事形成一定反差。
  • V4-Pro 官方版和 Harness 的具体上线时间目前未经证实:多家中文媒体(如快科技援引的消息源)报道「内部测试」和「8 月 10–20 日 GA」等具体窗口,但这些均为未署名消息源或社区传言,DeepSeek 官方 changelog 的原话只是「将尽快发布」,没有给出确切日期,读者应以此为准,不要把猜测当成官方计划。
  • 企业融资与 IPO 传闻同样需要谨慎对待:多家媒体报道 DeepSeek 近期完成一轮约 74 亿美元(约合人民币 500 亿元)融资,投资方包括腾讯、网易,估值约 487 亿美元;也有报道称公司正在筹备新一轮约 710 亿美元估值的融资并为 IPO 做准备。这些信息目前主要来自财经媒体的「据报道」「消息人士称」,尚无 DeepSeek 官方或监管备案文件的直接确认,本文作为背景信息呈现,但不作为已核实事实处理。

7. 影响与背景:梁白开、斩杀线与芯片股

在 V4 正式版发布之前,因为 Pro 版本迟迟没有兑现此前「7 月中旬全量上线」的预期,中文 AI 社区一度把 DeepSeek 创始人梁文锋戏称为「梁白开」(谐音「白等」「放空炮」)。V4-Flash-0731 上线后,因为实际表现超出预期,不少网友又把「梁圣」的称号还了回去——这种戏谑式的昵称反转,本身就是观察中国 AI 社区情绪风向的一个有趣侧面。

更值得关注的是一个在中文开发者社区流传的说法:「斩杀线」(kill line)。意思是:DeepSeek 凭借「够用的性能+极端低价」的组合,给同行设下了一条门槛——友商的模型如果性能没有明显超过 DeepSeek,又拿不出更低的价格,就会在市场上失去存在感。这也解释了近期一些友商(比如有报道提到 GPT-5.6 Luna 低价版一次性降价 80%)为何密集调整定价策略。一位从事 AI 创业孵化的业内人士对 21 世纪经济报道的评价颇为形象:「所有大模型公司都在梁文锋前面奔跑,不管用什么方式,都必须跑到 DeepSeek 前面才能生存。」

从更大的行业背景看,V4-Flash 正式版上线当天(7 月 31 日),英伟达、博通、AMD 等算力芯片股并未出现明显波动——市场似乎已经习惯了「DeepSeek 式效率突破」这种叙事,不再简单把「用更少算力做到同等效果」等同于「利空算力股」。这和 2025 年初 DeepSeek-R1 发布时引发全球 AI 芯片股集体下跌的场景形成了鲜明对比,某种程度上说明市场对中国大模型工程创新的认知已经相对成熟。

8. 五步实操:V4-Flash Agent 接入与验证清单

  1. 迁移旧 model 名称:官方已于 7 月 24 日正式停用 deepseek-chatdeepseek-reasoner。若你仍在使用旧命名,需尽快切换为 deepseek-v4-flash;OpenAI ChatCompletions 或 Anthropic 格式接入无需改代码,model 字段更新即可。
  2. 验证 API 与缓存命中率:用 curl 或 SDK 发送测试请求,分别测试缓存命中与未命中路径,记录输入/输出 Token 单价与延迟基线。留意海外社区反馈的缓存命中率偏低问题,批量 Agent 任务应单独测算真实单任务成本。
  3. 配置 Cursor / OpenClaw / Claude Code:Harness 尚未公开发布前,可继续用 Claude Code 或 OpenCode 作为 Agent 执行框架。在 OpenClaw 的 openclaw.json 中将默认模型指向 deepseek-v4-flash,执行 openclaw doctoropenclaw channels status --probe 验收通道。
  4. 与 Kimi K3 / Qwen3.8-Max 做 A/B 压测:选取 3–5 个真实 Agent 任务(编码、工具调用、长上下文摘要),并行路由 V4-Flash 与竞品,记录单任务成本(参考 AA 指数:V4-Flash $0.03 vs Kimi K3 $0.86 vs Claude Fable 5 $3.15)与完成率,勿仅依赖厂商自报 Terminal Bench 分数。
  5. 迁移至 SFTPMAC 7×24 远程 Mac:大规模 Agent 流水线要求宿主机持续在线。将 OpenClaw 网关与 Cursor CLI 部署至 Apple Silicon 远程 Mac,通过 SFTP/rsync 同步代码库与 ~/.openclaw 配置,避免笔记本休眠中断批量任务,在 Harness 正式发布前并行压测多模型路由策略。
# 快速验证 V4-Flash API(OpenAI 兼容格式示例)
curl https://api.deepseek.com/v1/chat/completions \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"deepseek-v4-flash","messages":[{"role":"user","content":"ping"}]}'

9. Agent 宿主机决策矩阵

方案 适合场景 主要限制 V4-Flash 批量 Agent 推荐度
个人笔记本 + Cursor 轻量单次补全、短对话、API 功能验证 休眠中断批量 Agent 循环、难以 7×24 跑成本 A/B 测试、缓存命中率波动难复现 ⚠️ 不适合大规模 Agent 流水线
通用云 Linux VM 纯 API 调用、Hugging Face 权重下载后推理服务 无原生 Cursor/macOS 生态、OpenClaw 网关与 launchd 守护链路受限、Harness 发布后 macOS 工具链可能更优 ⚠️ 适合 API 侧,不适合 Cursor + OpenClaw 一体部署
SFTPMAC 远程 Apple Silicon Mac Cursor CLI、OpenClaw 网关、V4-Flash 批量 Agent、SFTP/rsync 团队同步 需规划套餐与带宽 ✅ V4-Flash 低价 Agent 工作流的最优底座

10. 常见问题

Q1:DeepSeek V4 和之前的 V3.2 相比,最大的区别是什么?
A:最直接的区别是原生支持 100 万 token 上下文,且长上下文场景下的计算和显存开销大幅降低(官方数据:V4-Pro 在百万 token 上下文下所需 FLOPs 仅为 V3.2 的 27%,KV Cache 仅为 10%)。此外 V4 系列在 Agent 能力上做了专项优化,适配了 Claude Code、OpenCode 等主流 Agent 工具。

Q2:日常使用应该选 V4 Flash 还是 V4 Pro?
A:如果只是普通对话、简单任务或者需要大规模、低成本调用(比如批量处理、Agent 流水线),目前的 V4-Flash-0731 官方版性价比更高,且 Agent 跑分已经反超 V4-Pro 预览版。如果任务涉及更深的世界知识或复杂推理,且预算不敏感,可以先用 V4-Pro 预览版,等官方版上线后再评估是否需要切换。

Q3:现在能用上 V4 Pro 官方版吗?
A:截至本文发稿(2026 年 8 月 5 日),还不能。目前上线的官方版只有 V4-Flash-0731,且仅限 API 调用,App 和网页端还是旧版本。V4-Pro 官方版和自研 Harness 框架官方口径是「尽快发布」,没有确切上线日期,网上流传的「8 月 10–20 日」等具体时间是未经证实的传言。

Q4:DeepSeek 公布的跑分能直接相信吗?
A:建议区分对待。像 SWE-bench Verified 这类被广泛采用、方法论透明的第三方基准,可信度相对较高;但 Terminal Bench 2.0 等 Agent 类跑分是用 DeepSeek 自研且未公开的 Harness 测出来的,官方自己也提示这类数字对框架选择高度敏感,建议等社区用其他 Agent 工具(Claude Code、Cursor 等)独立复现后再下结论。

Q5:这次更新对普通开发者有什么实际影响?
A:如果你在用 OpenAI ChatCompletions 或 Anthropic 格式的 API 接入 DeepSeek,不需要改代码,deepseek-v4-flash 这个 model 名会自动指向新的官方版本。如果你此前用的是已经停用的 deepseek-chat/deepseek-reasoner,需要尽快切换到新命名,官方已在 7 月 24 日正式停用旧名称。

数据来源:DeepSeek 官方 API 文档与更新日志(api-docs.deepseek.com);DeepSeek-V4 技术报告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》及 Hugging Face 模型卡(deepseek-ai/DeepSeek-V4-Pro、DeepSeek-V4-Flash);Artificial Analysis 第三方模型评测数据(经旺得富理财网、Meyka 等财经媒体转引);21 世纪经济报道《DeepSeek 又发重磅更新 行业梦回 2025 年春天》;快科技(凤凰网科技转载)《DeepSeek V4 正式版有多强》;V2EX 社区讨论帖《最新的 deepseek-v4-flash 正式版真的有这么强吗?》;36 氪欧洲版、HTX Insights 相关报道;Moonshot AI(Kimi K3)、智谱/Z.ai(GLM-5.2)、阿里云(Qwen3.8-Max)官方发布信息。发布前请务必核实最新定价、跑分及 V4-Pro/Harness 上线状态,本文所有数据截至 2026 年 8 月 5 日,AI 行业信息更新极快,具体细节可能已发生变化。

11. 总结:V4-Flash 的价值、局限与 Agent 底座选择

DeepSeek V4-Flash-0731 这次更新的核心故事是:参数不变、后训练重跑,在 Agent 跑分上反超自家更大的 V4-Pro 预览版,并以 $0.14/$0.28 的 API 定价打出「够用智能 + 极致价格」的组合——对需要大规模调用、对绝对智能上限不敏感的 Agent 和批量任务场景,这是 2026 年 8 月值得立刻接入测试的高性价比选项。

但局限同样清晰:Harness 尚未公开发布(Terminal Bench 等 Agent 跑分均依赖未公开的极简模式)、Artificial Analysis 智能分(50)落后于 Kimi K3(57)与 GLM-5.2V4-Pro 官方版与 App/网页端同步仍无确切日期。在第三方 Agent 框架独立复现与 Harness GA 完成之前,更务实的路径是走 API 做业务场景 A/B 测试,而非按营销话术全量迁移生产系统。

若你计划在 V4-Flash 低价窗口期大规模跑批量 Agent 流水线,笔记本与通用 Linux VM 更容易暴露「省 API 费、丢 Agent 循环」的隐性成本——长任务被休眠打断、代码库不同步导致重跑、缓存命中率波动拉高真实单价,都会吃掉近百倍的价格红利。建议将 Cursor CLI、OpenClaw 网关与团队代码库统一部署在持续在线的 Apple Silicon 远程 Mac上,通过 SFTP/rsync 保持仓库一致。SFTPMAC 远程 Mac 租赁提供面向 AI Agent 的 macOS 环境:原生 Cursor 兼容、低延迟 API 回调、7×24 不中断——比「个人设备兼 Agent 宿主机」更适合在 DeepSeek「斩杀线」定价窗口期把 API 价格优势真正转化为稳定的 Agent 生产收益。