DeepSeek V4 Flash正式版评测:跑分逼近Opus 4.8,价格便宜近百倍,Pro版还要等多久?
2026 年 7 月 31 日,DeepSeek 将 V4-Flash 升级为官方版 0731:参数规模不变、仅重训后训练,Agent 跑分反超更大的 V4-Pro 预览版,价格仅为 Claude Opus 4.8 的几十分之一。旗舰 V4-Pro 官方版与自研 Agent 框架 Harness 仍处于「即将发布」状态。本文梳理完整时间线、定价表、CSA+HCA 架构拆解、Artificial Analysis 横向对比、Harness 争议与「斩杀线」行业背景,并给出五步 API 迁移清单与 Agent 宿主机决策矩阵。
1. 三类决策痛点:跑分、价格与 Harness 依赖
- 把 Terminal Bench 2.0 跑分当作通用 Agent 能力:V4-Flash-0731 公布的 Agent 类跑分(Terminal Bench 2.0 拿到 82.7 分,反超 V4-Pro 预览版的 67.9 分)全部基于 DeepSeek 自研且尚未公开发布的 Harness「极简模式」测得。官方 changelog 主动提示「跑分对 harness 的选择非常敏感」——在 Claude Code、Cursor 等第三方框架独立复现之前,不应把厂商自报数字直接套用到你的生产 Agent 栈。
- 只看价格不看缓存命中率与高峰加价:V4-Flash 输入价 $0.14(缓存未命中)/ $0.0028(命中)每百万 Token,相对 Claude Opus 4.8 便宜近百倍;但海外开发者社区反馈正式版存在输入缓存命中率偏低、安全分类器偶发超时等问题。DeepSeek 还预告未来将对 API 启用「高峰时段 2 倍加价」(北京时间 9–12 点、14–18 点),截至发稿未公布具体生效日期——批量 Agent 任务的真实成本可能高于表价。
- 等 V4-Pro 官方版而错过 Flash 窗口期:V4-Pro 官方版仍是「尽快发布」,媒体援引未署名消息源称 GA 窗口可能在 8 月 10–20 日之间,但未经 DeepSeek 官方证实。若你的场景是批量调用、Agent 流水线或对绝对智能上限不敏感,当前 V4-Flash-0731 已在 Agent 跑分上反超 V4-Pro 预览版,且仅限 API 公测(App 和网页端暂未同步)——拖延迁移等于继续支付更高单价或承担旧接口停用风险。
2. 时间线:从 4 月预览到 7 月「官方版」
DeepSeek 这次的版本迭代并不是一次性事件,而是拉了三个多月的连续动作,中间每一步都被国内外社区放大讨论:
- 2026 年 4 月 24 日:DeepSeek-V4 预览版首次发布并开源,包含 V4-Pro(1.6T 总参数/49B 激活)和 V4-Flash(284B 总参数/13B 激活)两个版本,均支持 100 万 token 上下文,采用 MIT 协议。
- 2026 年 7 月 24 日:旧接口模型名
deepseek-chat与deepseek-reasoner正式停用,全部流量切换到 V4 系列命名。 - 2026 年 7 月 27 日:月之暗面(Moonshot AI)的 Kimi K3(2.8T 总参数)开源权重上线 Hugging Face,是当时体量最大的开源权重发布之一,给 DeepSeek 制造了不小的竞争压力。
- 2026 年 7 月 31 日:DeepSeek-V4-Flash-0731 正式版进入 API 公测,开源权重同步上线 Hugging Face,官方 changelog 首次点名自研 Agent 框架「Harness」,称即将随 V4 正式版一起发布。这次公测仅限 API,App 和网页端暂未同步更新。
- 截至 2026 年 8 月 5 日(发稿时):V4-Pro 官方版仍是「尽快发布」,没有官方确认日期。国内有媒体援引未署名消息源称内部测试已在 7 月 28 日那周启动,正式 GA 窗口可能在 8 月 10 日至 20 日之间——这一时间点目前未经 DeepSeek 官方证实,仅供参考。
3. 核心数据一览:定价与参数对比表
| 模型 | 状态 | 总参数 / 激活参数 | 上下文 | 输入价格(缓存未命中/命中,每百万 token) | 输出价格(每百万 token) | 协议 |
|---|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | 官方正式版(2026-07-31) | 284B / 13B | 1M | $0.14 / $0.0028 | $0.28 | MIT |
| DeepSeek-V4-Pro | 预览版(2026-04-24,官方版未发布) | 1.6T / 49B | 1M | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3(月之暗面) | 权重开源(2026-07-27) | 2.8T / 激活参数未公开(约 104B,社区估算) | ~1.05M | $3.00 / $0.30 | $15.00 | Kimi K3 License(含商用附加条款) |
| GLM-5.2(智谱/Z.ai) | 开源(2026 年 6 月) | ~744B / ~40B | 1M | 未在本文核实范围内 | 未在本文核实范围内 | MIT |
| Qwen3.8-Max(阿里) | API 可用(2026-08-02),权重待放出 | 2.4T / 95B | 1M | $2.00 / ~$0.17–0.25 | $6.00 | 官方承诺开源,尚未放出权重 |
说明:以上定价均为 DeepSeek、Moonshot、阿里等官方公开数据,属于「厂商自报」信息;DeepSeek 已预告未来将对 API 启用「高峰时段 2 倍加价」(北京时间 9–12 点、14–18 点),但截至发稿未公布具体生效日期。
4. 深度拆解:后训练、CSA+HCA 架构与 Harness
架构没有变,变的是后训练
这次最容易被忽略、但其实最关键的一点是:V4-Flash-0731 在参数规模、模型结构上和 4 月预览版完全相同,DeepSeek 官方明确说明性能提升「完全来自重新进行的后训练」,而非扩大模型规模。284B 总参数、13B 激活参数的 Flash 版本,在多项 Agent 基准上反而超过了参数量是自己好几倍的 V4-Pro 预览版——2026 年下半年的大模型竞争,后训练数据质量和方法的重要性正在逼近甚至超过单纯堆参数。
混合注意力机制:CSA+HCA、mHC、Muon 优化器
根据 DeepSeek 发布的技术报告(论文题为《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》),V4 系列在架构上做了三处关键改动:
- 混合注意力架构:结合压缩稀疏注意力(CSA)与高度压缩注意力(HCA),官方对外统一称为「DSA 稀疏注意力」,核心目的是在长上下文场景下降低计算和显存开销;
- 流形约束超连接(mHC):对传统残差连接结构做了改进;
- Muon 优化器:替换传统优化器,用于提升训练收敛速度和稳定性。
三项改动叠加的效果是:在 100 万 token 上下文场景下,V4-Pro 相比前代 V3.2,单 token 推理所需 FLOPs 仅为 27%,KV Cache 占用仅为 10%。这是 DeepSeek 官方公布的技术指标,尚未看到独立第三方机构的复现验证,但如果基本属实,意味着「百万级上下文」第一次有可能以接近主流上下文长度的成本大规模商用,而不只是一个营销参数。
自研 Agent 框架 Harness 首次亮相
7 月 31 日的 changelog 里第一次正式出现「DeepSeek Harness」这个名字——这是 DeepSeek 自研的 Agent 执行框架,用于让模型读写文件、调用工具、执行命令、完成端到端的工程任务,对标的产品是 Claude Code。在此之前,DeepSeek 的模型主要依赖 Claude Code、OpenCode 等第三方 Agent 工具来完成类似任务。官方公开的 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)全部是用 Harness 的「极简模式」(minimal mode)测出来的,DeepSeek 在 changelog 里也主动提示:「跑分对 harness(执行框架)的选择非常敏感,不能简单等同于模型本身能力的提升」——这句话本身就值得读者留意。
5. 横向对比:Artificial Analysis 六边形混战
DeepSeek-V4-Flash 的这次更新,恰好卡在中国大模型开源阵营最密集的窗口期。把几家近期动作放在一起看,格局会更清楚:
| 模型 | 实验室 | 发布/权重开放时间 | 总参数 | 独立测评 Intelligence Index(Artificial Analysis) | 单任务平均成本(Artificial Analysis) |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | DeepSeek | 2026-07-31(官方版) | 284B | 50 | $0.03 |
| Kimi K3 | 月之暗面 | 2026-07-16 预览 / 07-27 权重 | 2.8T | 57 | $0.86 |
| GLM-5.2 | 智谱/Z.ai | 2026 年 6 月 | ~744B | 比 V4-Flash 高约 1 分 | 未在本次调研范围内核实 |
| Qwen3.8-Max | 阿里 | 2026-08-02 GA(权重待放出) | 2.4T | 未在本次调研范围内核实 | 未在本次调研范围内核实 |
| GPT-5.6 Sol | OpenAI | 闭源 | 未公开 | 比 V4-Flash 高 9 分以上 | $1.86 |
| Claude Fable 5 | Anthropic | 闭源 | 未公开 | 比 V4-Flash 高 9 分以上 | $3.15 |
数据来源标注:Intelligence Index 与单任务成本数据引自研究机构 Artificial Analysis(第三方独立评测),经财经媒体(旺得富理财网等)转引;DeepSeek 官方跑分(Terminal Bench 2.0、SWE Verified 等)为厂商自报,两组数据的评测方法和权重不完全一致,不能直接相加比较,本文分开列出以示区分。
可以看到一个有意思的反差:在 Artificial Analysis 这个第三方综合指数上,V4-Flash 的「智能分」其实不是最高的,甚至落后于 Kimi K3 和 GLM-5.2;但它的单任务成本只有 Kimi K3 的约 1/29、GPT-5.6 Sol 的约 1/62、Claude Fable 5 的约 1/105。DeepSeek 这次打的不是「跑分第一」,而是「够用的智能 + 极致的价格」——V4-Flash 预览版曾在 OpenRouter 上连续七周稳坐调用量第一,目标用户是需要大规模调用、对绝对智能上限没那么敏感的 Agent 和批量任务场景。
6. 争议点:跑分好看,不代表没有水分
- 跑分方法依赖 Harness,官方自己都在提醒别只看数字:V4-Flash-0731 公布的 Agent 类跑分全部基于 DeepSeek 自研且尚未公开发布的 Harness 极简模式测得,参数设置为 max 档位、top_p=0.95、temperature=1.0。在独立社区(如 Hugging Face 博主、海外开发者论坛)复现之前,这组数字应被视为「厂商自报+特定框架」结果,而非可以直接横向套用到其他 Agent 框架(如 Claude Code、Cursor)上的通用能力。
- 海外开发者反馈了具体的可用性问题:据 21 世纪经济报道援引的海外开发者社区反馈,V4-Flash 正式版存在输入缓存命中率偏低、安全分类器偶发超时等问题,这些细节反映出算力和参数储备仍是限制模型能力上限的现实瓶颈,和「跑分暴涨」的营销叙事形成一定反差。
- V4-Pro 官方版和 Harness 的具体上线时间目前未经证实:多家中文媒体(如快科技援引的消息源)报道「内部测试」和「8 月 10–20 日 GA」等具体窗口,但这些均为未署名消息源或社区传言,DeepSeek 官方 changelog 的原话只是「将尽快发布」,没有给出确切日期,读者应以此为准,不要把猜测当成官方计划。
- 企业融资与 IPO 传闻同样需要谨慎对待:多家媒体报道 DeepSeek 近期完成一轮约 74 亿美元(约合人民币 500 亿元)融资,投资方包括腾讯、网易,估值约 487 亿美元;也有报道称公司正在筹备新一轮约 710 亿美元估值的融资并为 IPO 做准备。这些信息目前主要来自财经媒体的「据报道」「消息人士称」,尚无 DeepSeek 官方或监管备案文件的直接确认,本文作为背景信息呈现,但不作为已核实事实处理。
7. 影响与背景:梁白开、斩杀线与芯片股
在 V4 正式版发布之前,因为 Pro 版本迟迟没有兑现此前「7 月中旬全量上线」的预期,中文 AI 社区一度把 DeepSeek 创始人梁文锋戏称为「梁白开」(谐音「白等」「放空炮」)。V4-Flash-0731 上线后,因为实际表现超出预期,不少网友又把「梁圣」的称号还了回去——这种戏谑式的昵称反转,本身就是观察中国 AI 社区情绪风向的一个有趣侧面。
更值得关注的是一个在中文开发者社区流传的说法:「斩杀线」(kill line)。意思是:DeepSeek 凭借「够用的性能+极端低价」的组合,给同行设下了一条门槛——友商的模型如果性能没有明显超过 DeepSeek,又拿不出更低的价格,就会在市场上失去存在感。这也解释了近期一些友商(比如有报道提到 GPT-5.6 Luna 低价版一次性降价 80%)为何密集调整定价策略。一位从事 AI 创业孵化的业内人士对 21 世纪经济报道的评价颇为形象:「所有大模型公司都在梁文锋前面奔跑,不管用什么方式,都必须跑到 DeepSeek 前面才能生存。」
从更大的行业背景看,V4-Flash 正式版上线当天(7 月 31 日),英伟达、博通、AMD 等算力芯片股并未出现明显波动——市场似乎已经习惯了「DeepSeek 式效率突破」这种叙事,不再简单把「用更少算力做到同等效果」等同于「利空算力股」。这和 2025 年初 DeepSeek-R1 发布时引发全球 AI 芯片股集体下跌的场景形成了鲜明对比,某种程度上说明市场对中国大模型工程创新的认知已经相对成熟。
8. 五步实操:V4-Flash Agent 接入与验证清单
- 迁移旧 model 名称:官方已于 7 月 24 日正式停用
deepseek-chat与deepseek-reasoner。若你仍在使用旧命名,需尽快切换为deepseek-v4-flash;OpenAI ChatCompletions 或 Anthropic 格式接入无需改代码,model 字段更新即可。 - 验证 API 与缓存命中率:用 curl 或 SDK 发送测试请求,分别测试缓存命中与未命中路径,记录输入/输出 Token 单价与延迟基线。留意海外社区反馈的缓存命中率偏低问题,批量 Agent 任务应单独测算真实单任务成本。
- 配置 Cursor / OpenClaw / Claude Code:Harness 尚未公开发布前,可继续用 Claude Code 或 OpenCode 作为 Agent 执行框架。在 OpenClaw 的
openclaw.json中将默认模型指向deepseek-v4-flash,执行openclaw doctor与openclaw channels status --probe验收通道。 - 与 Kimi K3 / Qwen3.8-Max 做 A/B 压测:选取 3–5 个真实 Agent 任务(编码、工具调用、长上下文摘要),并行路由 V4-Flash 与竞品,记录单任务成本(参考 AA 指数:V4-Flash $0.03 vs Kimi K3 $0.86 vs Claude Fable 5 $3.15)与完成率,勿仅依赖厂商自报 Terminal Bench 分数。
- 迁移至 SFTPMAC 7×24 远程 Mac:大规模 Agent 流水线要求宿主机持续在线。将 OpenClaw 网关与 Cursor CLI 部署至 Apple Silicon 远程 Mac,通过 SFTP/rsync 同步代码库与
~/.openclaw配置,避免笔记本休眠中断批量任务,在 Harness 正式发布前并行压测多模型路由策略。
# 快速验证 V4-Flash API(OpenAI 兼容格式示例)
curl https://api.deepseek.com/v1/chat/completions \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"deepseek-v4-flash","messages":[{"role":"user","content":"ping"}]}'
9. Agent 宿主机决策矩阵
| 方案 | 适合场景 | 主要限制 | V4-Flash 批量 Agent 推荐度 |
|---|---|---|---|
| 个人笔记本 + Cursor | 轻量单次补全、短对话、API 功能验证 | 休眠中断批量 Agent 循环、难以 7×24 跑成本 A/B 测试、缓存命中率波动难复现 | ⚠️ 不适合大规模 Agent 流水线 |
| 通用云 Linux VM | 纯 API 调用、Hugging Face 权重下载后推理服务 | 无原生 Cursor/macOS 生态、OpenClaw 网关与 launchd 守护链路受限、Harness 发布后 macOS 工具链可能更优 | ⚠️ 适合 API 侧,不适合 Cursor + OpenClaw 一体部署 |
| SFTPMAC 远程 Apple Silicon Mac | Cursor CLI、OpenClaw 网关、V4-Flash 批量 Agent、SFTP/rsync 团队同步 | 需规划套餐与带宽 | ✅ V4-Flash 低价 Agent 工作流的最优底座 |
10. 常见问题
Q1:DeepSeek V4 和之前的 V3.2 相比,最大的区别是什么?
A:最直接的区别是原生支持 100 万 token 上下文,且长上下文场景下的计算和显存开销大幅降低(官方数据:V4-Pro 在百万 token 上下文下所需 FLOPs 仅为 V3.2 的 27%,KV Cache 仅为 10%)。此外 V4 系列在 Agent 能力上做了专项优化,适配了 Claude Code、OpenCode 等主流 Agent 工具。
Q2:日常使用应该选 V4 Flash 还是 V4 Pro?
A:如果只是普通对话、简单任务或者需要大规模、低成本调用(比如批量处理、Agent 流水线),目前的 V4-Flash-0731 官方版性价比更高,且 Agent 跑分已经反超 V4-Pro 预览版。如果任务涉及更深的世界知识或复杂推理,且预算不敏感,可以先用 V4-Pro 预览版,等官方版上线后再评估是否需要切换。
Q3:现在能用上 V4 Pro 官方版吗?
A:截至本文发稿(2026 年 8 月 5 日),还不能。目前上线的官方版只有 V4-Flash-0731,且仅限 API 调用,App 和网页端还是旧版本。V4-Pro 官方版和自研 Harness 框架官方口径是「尽快发布」,没有确切上线日期,网上流传的「8 月 10–20 日」等具体时间是未经证实的传言。
Q4:DeepSeek 公布的跑分能直接相信吗?
A:建议区分对待。像 SWE-bench Verified 这类被广泛采用、方法论透明的第三方基准,可信度相对较高;但 Terminal Bench 2.0 等 Agent 类跑分是用 DeepSeek 自研且未公开的 Harness 测出来的,官方自己也提示这类数字对框架选择高度敏感,建议等社区用其他 Agent 工具(Claude Code、Cursor 等)独立复现后再下结论。
Q5:这次更新对普通开发者有什么实际影响?
A:如果你在用 OpenAI ChatCompletions 或 Anthropic 格式的 API 接入 DeepSeek,不需要改代码,deepseek-v4-flash 这个 model 名会自动指向新的官方版本。如果你此前用的是已经停用的 deepseek-chat/deepseek-reasoner,需要尽快切换到新命名,官方已在 7 月 24 日正式停用旧名称。
数据来源:DeepSeek 官方 API 文档与更新日志(api-docs.deepseek.com);DeepSeek-V4 技术报告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》及 Hugging Face 模型卡(deepseek-ai/DeepSeek-V4-Pro、DeepSeek-V4-Flash);Artificial Analysis 第三方模型评测数据(经旺得富理财网、Meyka 等财经媒体转引);21 世纪经济报道《DeepSeek 又发重磅更新 行业梦回 2025 年春天》;快科技(凤凰网科技转载)《DeepSeek V4 正式版有多强》;V2EX 社区讨论帖《最新的 deepseek-v4-flash 正式版真的有这么强吗?》;36 氪欧洲版、HTX Insights 相关报道;Moonshot AI(Kimi K3)、智谱/Z.ai(GLM-5.2)、阿里云(Qwen3.8-Max)官方发布信息。发布前请务必核实最新定价、跑分及 V4-Pro/Harness 上线状态,本文所有数据截至 2026 年 8 月 5 日,AI 行业信息更新极快,具体细节可能已发生变化。
11. 总结:V4-Flash 的价值、局限与 Agent 底座选择
DeepSeek V4-Flash-0731 这次更新的核心故事是:参数不变、后训练重跑,在 Agent 跑分上反超自家更大的 V4-Pro 预览版,并以 $0.14/$0.28 的 API 定价打出「够用智能 + 极致价格」的组合——对需要大规模调用、对绝对智能上限不敏感的 Agent 和批量任务场景,这是 2026 年 8 月值得立刻接入测试的高性价比选项。
但局限同样清晰:Harness 尚未公开发布(Terminal Bench 等 Agent 跑分均依赖未公开的极简模式)、Artificial Analysis 智能分(50)落后于 Kimi K3(57)与 GLM-5.2、V4-Pro 官方版与 App/网页端同步仍无确切日期。在第三方 Agent 框架独立复现与 Harness GA 完成之前,更务实的路径是走 API 做业务场景 A/B 测试,而非按营销话术全量迁移生产系统。
若你计划在 V4-Flash 低价窗口期大规模跑批量 Agent 流水线,笔记本与通用 Linux VM 更容易暴露「省 API 费、丢 Agent 循环」的隐性成本——长任务被休眠打断、代码库不同步导致重跑、缓存命中率波动拉高真实单价,都会吃掉近百倍的价格红利。建议将 Cursor CLI、OpenClaw 网关与团队代码库统一部署在持续在线的 Apple Silicon 远程 Mac上,通过 SFTP/rsync 保持仓库一致。SFTPMAC 远程 Mac 租赁提供面向 AI Agent 的 macOS 环境:原生 Cursor 兼容、低延迟 API 回调、7×24 不中断——比「个人设备兼 Agent 宿主机」更适合在 DeepSeek「斩杀线」定价窗口期把 API 价格优势真正转化为稳定的 Agent 生产收益。