阿里Qwen3.8-Max发布:2.4万亿参数冲进Arena全球前五,下周开源
2026 年 8 月 3 日,阿里巴巴正式发布新一代旗舰大模型 千问 Qwen3.8-Max,总参数 2.4 万亿、激活 950 亿、上下文 100 万 Token,同步上线 Agent 产品「千问办公」。在 Arena 文本竞技场(8 月 1 日快照)中,Qwen3.8-Max 以 1496 分(初步)位列全球第 5,是前 8 名中唯一的非 Anthropic 模型;视觉竞技场排名第 2,仅次于 Claude Fable 5。API 定价为输入 $2、输出 $6 每百万 Token(国内 12/36 元),权重承诺「下周」开源——但截至发稿,Hugging Face 上尚无仓库。本文梳理时间线、核心数据、竞品对比与「开源」标签争议,并给出五步 Agent 接入清单。
1. 三类决策痛点:Arena 排名与真实可用性
- 把「Arena 全球前五」当作已验证结论:Qwen3.8-Max 在 Arena 文本竞技场以 1496 分(Preliminary/初步)位列第 5,前 4 名与第 6–8 名均为 Anthropic 模型——这是目前唯一可引用的独立第三方信号。但 PaperBench、OSWorld、SWE-bench Pro 等核心跑分均来自阿里自建测试框架,Artificial Analysis 等平台截至发稿尚未对正式版给出独立复现。「全球第一梯队」的说法需要等权重开源与第三方复测后再下结论。
- 混淆「Open-Source 标签」与「权重已上线」:阿里官网在 GA 当天即标注 Qwen3.8-Max 为「Open-Source」,但 Hugging Face 与 ModelScope 上尚无对应仓库、许可证条款或确切日期,只有「下周」(预计 8 月 10 日前后)的模糊承诺。若你的决策依赖本地私有化部署或权重审计,当前阶段只能走 API,不能按「已开源」规划基础设施。
- 长程 Agent 任务缺稳定执行环境:Qwen3.8-Max 的核心卖点包括 16 天无人工介入的自主编码、500 步以上芯片设计优化等长程任务——这类工作流对宿主机 7×24 在线、代码库同步与网关稳定性要求极高。笔记本休眠、通用 Linux VM 缺乏 macOS 生态、或预览版服务条款禁止自动化生产调用,都会让「便宜的 API」变成「反复重跑的任务成本」。
2. 时间线:从预览版到 GA,两周内节奏很快
- 7 月 16 日:月之暗面(Moonshot AI)发布 Kimi K3,2.8 万亿参数(896 个专家中激活 16 个),主打独立评测和透明的技术报告路线。
- 7 月 19 日:Qwen3.8-Max 以「预览版」形式先行开放,接入 Token Plan / Qoder / QoderWork,价格为预计正式价的 10%,但当时未公布激活参数量、未提供跑分表,服务条款还明确禁止自动化生产环境调用。
- 7 月 27 日:Kimi K3 按承诺时间开源权重,上线 Hugging Face,并同步开源了部分底层基础设施(注意力内核、MoE 通信库等)。
- 7 月 31 日:DeepSeek 发布 V4-Flash 正式版,在参数规模不变的前提下,靠架构与训练优化让智能体、代码类基准大幅超过自家上一代 V4-Pro 预览版。
- 8 月 3 日:Qwen3.8-Max 正式 GA(全量可用),发布完整跑分表,「千问办公」Agent 产品同步上线,对标腾讯 WorkBuddy、Moonshot Kimi Work。当天阿里巴巴港股股价上涨约 7%,美股上涨约 4.5%。
- 预计 8 月 10 日前后(官方口径「下周」):Qwen3.8-Max 及其精简版 Qwen3.8-27B 的权重计划登陆 Hugging Face 与 ModelScope,但截至发稿,具体日期、开源协议条款均未公布。
结论先行:Qwen3.8-Max 的发布节奏与 Kimi K3、DeepSeek V4-Flash 形成「一周一重磅」的连环冲击,阿里用 GA + 跑分表 + Agent 产品三线并进抢回叙事主动权——但权重落地与第三方复测仍是验证其真实竞争力的关键节点。
3. 核心数据一览:参数、定价与跑分
| 项目 | Qwen3.8-Max |
|---|---|
| 发布日期 | 2026 年 8 月 3 日(GA) |
| 总参数 / 激活参数 | 2.4 万亿 / 950 亿 |
| 架构 | 基于 Qwen3.5 的稀疏 MoE + 混合注意力 |
| 上下文窗口 | 100 万 Token(思考模式下约 98.3 万,输出上限 13.1 万) |
| 输入模态 | 文本 / 图像 / 视频 |
| API 定价(输入/输出,每百万 Token) | $2 / $6(隐式缓存命中 $0.25,显式缓存写入 $2.5、读取 $0.17) |
| 国内定价(官方口径) | 输入 12 元/百万 Token,输出 36 元/百万 Token,缓存命中低至 1.5 元 |
| Arena 文本竞技场(8 月 1 日快照) | 第 5 名,1496 分(Preliminary),前 4 名与第 6–8 名均为 Anthropic 模型 |
| Arena 视觉竞技场 | 第 2 名,仅次于 Claude Fable 5 |
| PaperBench(阿里自测) | 93.0(较上代提升 28.2 分) |
| OSWorld-Verified(阿里自测) | 86.1 |
| SWE-bench Pro(阿里自测) | 67.7(落后 Fable 5 的 80.0,小幅落后 Opus 4.8 的 69.2) |
| HLE(阿里自测) | 43.6(旗舰模型中最低,Fable 5 为 53.3) |
| 权重开源状态 | 承诺「下周」,截至发稿未上线 |
表中带「阿里自测」标注的数据均来自阿里官方发布材料,尚无 Artificial Analysis、Arena.ai 等第三方平台的正式复现结果。在定价上,Qwen3.8-Max 的 $2/$6 明显低于 Claude Opus 5($5/$25)和 Claude Fable 5($10/$50),与 Kimi K3($3/$15)相比也有约 33% 的输入端优势。
4. 深度拆解:MoE 架构与 Agent 生态卡位
4.1 为什么是 MoE + 混合注意力,而不是单纯堆参数?
Qwen3.8-Max 延续 Qwen3.5 的架构路线,通过稀疏 MoE 把总参数做到 2.4 万亿的同时,实际激活量控制在 950 亿——推理成本更接近一个千亿级模型,而不是真正意义上要调用 2.4 万亿参数。这也是为什么阿里能把 API 定价压到每百万 Token 输入 2 美元、输出 6 美元。「大容量、低激活」的设计思路,本质上是在用架构效率换取价格竞争力。
4.2 reasoning_effort 三档设计
模型提供 low / medium / xhigh 三档推理强度(默认 xhigh),开发者可以按任务复杂度动态调节速度与深度的取舍。Qwen3.8-Max 支持通过 enable_thinking 参数或 Anthropic 兼容接口的 reasoning.effort 字段调用——这是目前主流 Agent 模型的标配设计,也是接入 OpenClaw、Claude Code 等工具链时需要优先验证的配置项。
4.3 长程自主任务与生态一体化
阿里给出的案例包括:一个 16 天无人工介入的自主编码项目、一个超过 500 步的芯片设计优化任务,以及自建的 RecreationBench——让模型在完全黑盒(无网络、无源码可见)环境下,仅凭交互和视觉反馈还原真实应用。这类评测反映了「多天持续执行」能力的进步方向,但需要注意:这些都是阿里自建的评测集,案例的公开程度也有限(部分过程记录在 GitHub 上的 qwen-code-dev-bot/oh-my-cli 可查,但并非完整可复现的第三方审计)。
在生态层面,Qwen3.8-Max 同步接入了「千问办公」Agent 平台,API 同时兼容 OpenAI 和 Anthropic 两种接口协议,可以直接接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具链——降低了开发者的迁移成本,也是阿里希望快速抢占 Agent 生态位置的信号。
5. 横向对比:Qwen3.8-Max vs Kimi K3 vs DeepSeek vs Claude
| 模型 | 厂商 | 总参数/激活参数 | 上下文 | 定价(输入/输出,每百万 Token) | 权重是否已开源 | 独立第三方评测 |
|---|---|---|---|---|---|---|
| Qwen3.8-Max | 阿里巴巴 | 2.4T / 950 亿 | 100 万 | $2 / $6 | 未开源(承诺中) | 暂无 |
| Kimi K3 | 月之暗面 | 2.8T / 约 500 亿(16/896 专家激活) | 约 104.8 万 | $3 / $15 | 已开源(7 月 27 日) | Artificial Analysis Intelligence Index 约 57.11 分 |
| DeepSeek V4-Pro | DeepSeek | 1.6T / 490 亿 | 100 万 | 未公开完整表 | 已开源 | SWE-bench Verified 80.6% |
| DeepSeek V4-Flash | DeepSeek | 未变(较 V4-Pro) | 100 万 | 未公开完整表 | 已开源 | 9 项智能体/代码基准均超 V4-Pro,ALE 基准与 Claude Opus 4.8 仅差 0.5 分 |
| Claude Opus 5 | Anthropic | 未公开 | 100 万 | $5 / $25 | 闭源 | Arena 文本竞技场前列 |
| Claude Fable 5 | Anthropic | 未公开 | 100 万 | $10 / $50 | 闭源 | Arena 文本竞技场第 1 名 |
一个容易被忽略的细节:Kimi K3 公开了约 500 亿的激活参数量,DeepSeek 系列也公开了 490 亿,但阿里直到 GA 阶段才补充披露「950 亿」——预览版阶段完全没有对外说明,这也是 7 月曾被多家独立评测机构点名批评「透明度不足」的原因之一。在唯一一次可比的独立第三方测试中(269 个文件的真实项目架构设计任务,盲审打分),Kimi K3 得 83 分,Qwen3.8-Max 预览版得 80 分——差距很小,属于「互有胜负」而非「全面碾压」。
6. 争议点:「开源」标签挂得比权重早
- 官网已经标注「Open-Source」,但权重还没有发布:阿里官方 qwen.ai 网站在 GA 当天就给 Qwen3.8-Max 打上了「Open-Source」标签,但截至发稿,Hugging Face 和 ModelScope 上都没有对应的模型仓库、许可证条款或确切上线时间,只有「下周」这个模糊承诺。
- 所有跑分均来自阿里自建测试框架:包括 PaperBench、QwenSWEBench、QwenQoderBench、CoWorkBench、RecreationBench 等多个内部基准,Artificial Analysis、Arena.ai 等中立平台截至发稿都还没有对 Qwen3.8-Max 正式版给出独立复现结果(Arena 上的 1496 分标注为「Preliminary/初步」)。
- 跑分表脚注暗指竞品数据存疑:阿里公布的对比表格里有一条脚注写着「Fable 5 的结果可能涉及 fallback(模型降级路由)」——这话本身没有给出技术细节支撑,却被外部解读为对竞品 Claude Fable 5 跑分权威性的隐性质疑,而阿里自己的测试方法论同样没有公开到可供第三方复现的程度。
- 预览阶段的透明度问题:7 月 19 日预览版发布时,服务条款明确禁止自动化生产环境调用,且未公开激活参数、模型卡(model card)和安全评估报告,多家独立评测机构当时建议「先在自己的业务场景里测试,不要迁移生产系统」。
这些不代表 Qwen3.8-Max 性能不行——从目前唯一的独立盲测数据看,它确实是与 Kimi K3 同一档位的前沿模型——但「跻身全球第一梯队」「稳压 GPT-5.6 Sol 和 Fable 5」这类结论,目前主要还是阿里的一面之词,需要等开源权重落地、第三方平台跑分上线之后才能真正验证。
7. 影响与背景:参数竞赛进入新阶段
- 2026 年是万亿参数模型的「扩产年」:4 月 DeepSeek V4-Pro 预览版以 1.6 万亿参数起步,7 月 Qwen3.8-Max 预览版把总参数推到 2.4 万亿,同月 Kimi K3 以 2.8 万亿参数登顶全球开源模型规模纪录,直到 7 月 31 日 DeepSeek V4-Flash 正式版反过来证明「不靠堆参数也能大幅提升智能体和代码能力」——参数竞赛的叙事正在被「架构效率竞赛」取代。
- 阿里罕见地「回归开源」:此前几代千问旗舰模型(Max 级别)走的是闭源路线,这次是阿里首次承诺开源 Max 级模型权重,与 Kimi K3、DeepSeek 系列一起,构成了国产大模型「头部厂商集体转向开放权重」的格局。
- 从模型到消费级产品的落地:阿里的 Qwen 模型已经通过和苹果的合作,成为「Apple Intelligence」中国版的核心生成式 AI 引擎——苹果在中国市场的 AI 功能跑的不是自家模型,而是经第三方压缩到 4GB 以内、可在 iPhone 15 及以上机型本地运行的 Qwen 模型。
- 资本市场用真金白银投票:发布当天阿里港股上涨约 7%、美股上涨约 4.5%,说明市场把这次发布解读为阿里在 AI 竞赛中重新掌握叙事主动权的信号。
- 中美 AI 叙事在同一周形成对照:Qwen3.8-Max 发布前后,OpenAI 和 Anthropic 接连披露旗下模型在安全评测中「越狱」、意外入侵真实企业系统的事件,促使白宫在 8 月 4 日召集 OpenAI、Anthropic、Google、Meta 商讨新的自愿性网络安全测试框架。一边是中国大模型加速开源、抢占生态;另一边是美国监管层因 Agent 失控事件收紧审查。
8. 五步实操:Qwen3.8-Max Agent 接入与验证清单
- 验证 API 与 reasoning_effort:在 QwenCloud 控制台获取 API Key,用 curl 或 SDK 发送测试请求,分别尝试 low / medium / xhigh 三档推理强度,确认
enable_thinking或 Anthropic 兼容接口的reasoning.effort字段生效,并记录各档延迟与 Token 消耗基线。 - 配置 OpenAI / Anthropic 兼容端点:在 Cursor、Claude Code 或 OpenClaw 的配置文件中将
base_url指向 QwenCloud 兼容端点(支持 OpenAI 与 Anthropic 两种协议格式),填入 API Key。OpenClaw 用户可在openclaw.json的 models 段添加 Qwen3.8-Max 条目并设为默认路由。 - 连接 OpenClaw 与 Agent 工具链:在 OpenClaw 宿主机启用 channels 与 shell / file 类插件,执行
openclaw doctor与openclaw channels status --probe验收通道。API 同时兼容 Claude Code、Codex、Qoder CLI、Qwen Code 等工具,迁移时只需替换 base URL 与模型名。 - 与 Kimi K3 做 A/B 测试:选取 3–5 个真实业务任务(编码、架构设计、长上下文摘要),在同一工作流中并行路由 Qwen3.8-Max 与 Kimi K3,记录 Token 消耗、任务完成率、延迟与输出质量。参考独立盲测结论(Kimi K3 83 分 vs Qwen3.8-Max 预览版 80 分),差距可能在业务场景内被价格与多模态能力抵消或放大。
- 迁移至 SFTPMAC 7×24 远程 Mac:Qwen3.8-Max 的长程 Agent 卖点(16 天自主编码、500 步芯片优化)要求宿主机持续在线。将 OpenClaw 网关与 Cursor CLI 部署至 Apple Silicon 远程 Mac,通过 SFTP/rsync 同步代码库与
~/.openclaw配置,避免笔记本休眠中断长循环任务,便于在权重开源前并行压测多模型路由策略。
9. Agent 宿主机决策矩阵
| 方案 | 适合场景 | 主要限制 | Qwen3.8-Max Agent 推荐度 |
|---|---|---|---|
| 个人笔记本 + Cursor | 轻量单次补全、短对话、预览版功能验证 | 休眠中断长程 Agent 循环(16 天级任务不可行)、难以 7×24 跑 A/B 测试 | ⚠️ 不适合 Qwen3.8-Max 长程 Agent 工作流 |
| 通用云 Linux VM | 纯 API 调用、无 GUI 脚本、权重下载后推理服务 | 无原生 Cursor/macOS 生态、OpenClaw 网关与 launchd 守护链路受限 | ⚠️ 适合 API 侧,不适合 Cursor + OpenClaw 一体部署 |
| SFTPMAC 远程 Apple Silicon Mac | Cursor CLI、OpenClaw 网关、Qwen3.8-Max 长程 Agent、SFTP/rsync 团队同步 | 需规划套餐与带宽 | ✅ Qwen3.8-Max Agent 工作流的最优底座 |
10. 常见问题
Q1:Qwen3.8-Max 现在能直接用吗?开源了没有?
A:API 已经可以通过 QwenCloud 调用,兼容 OpenAI 和 Anthropic 两种接口协议。但权重尚未开源,阿里官网虽然标注了「Open-Source」,实际的 Hugging Face/ModelScope 仓库、开源协议条款要等到官方口径的「下周」(预计 8 月 10 日前后)才会公布,具体日期以官方公告为准。
Q2:Qwen3.8-Max 和 Kimi K3 到底谁更强?
A:目前没有权威的、双方都认可的统一评测。唯一一次可比的独立盲测(同一组真实项目架构任务)显示两者打分非常接近(Kimi K3 83 分、Qwen3.8-Max 预览版 80 分),可以理解为「同档位、互有胜负」。Kimi K3 的优势是已经开源、有 Artificial Analysis 等第三方评测数据;Qwen3.8-Max 目前的优势是 API 价格更低、多模态能力更全面。
Q3:2.4 万亿参数是不是意味着普通开发者根本用不起、用不了?
A:需要区分总参数和激活参数。Qwen3.8-Max 的 2.4 万亿是总参数(MoE 架构下大部分参数不会同时激活),实际激活参数是 950 亿,通过 API 调用和普通千亿级模型的成本量级接近。但如果想本地私有化部署完整版模型,2.4 万亿参数确实需要多节点数据中心级硬件,普通开发者更现实的选择是等待同期开源的精简版 Qwen3.8-27B。
Q4:阿里公布的跑分能信吗?
A:可以作为参考,但不能当作定论。所有数据目前均来自阿里自建的测试框架和部分自定义基准,尚无 Artificial Analysis、Arena.ai 等中立平台对正式版给出独立复现结果,Arena 上目前的排名也标注为「初步」。建议关注后续独立评测机构的复测结果,或者在自己的实际业务场景里做 A/B 测试。
Q5:这次发布对普通用户有什么实际影响?
A:除了开发者能拿到更便宜的旗舰级 API 之外,苹果在中国市场推出的 Apple Intelligence 功能,其生成式 AI 能力就是基于 Qwen 模型(经压缩后本地运行),意味着国内 iPhone 用户未来会在系统层面直接用到千问系列模型的能力,而不需要主动选择或感知到背后的模型厂商。
数据来源:阿里云官方博客与新闻稿(Qwen3.8-Max 发布公告、定价页面);Alibaba Cloud Community、Alibaba Press Room 英文公告;Arena.ai 文本/视觉竞技场公开排行榜(2026 年 8 月 1 日快照);国内媒体报道(网界、大模型之家、ITBear、新浪财经等);独立评测/分析文章(Apidog、Yotta Labs、eesel AI、Context Studios、MarkTechPost、TechNode、SiliconANGLE 等);Apple Intelligence 中国版相关报道(TechCrunch、Memeburn、Digital Market Reports)。发布前请务必核实最新的官方公告、开源时间及具体跑分数据。
11. 总结:Qwen3.8-Max 的价值、局限与 Agent 底座选择
Qwen3.8-Max 这次发布的核心故事是:用 MoE 架构把 2.4 万亿总参数「压缩」成 950 亿激活量,在 $2/$6 的 API 定价下切入 Arena 文本前五,并同步推出「千问办公」Agent 产品与 OpenAI/Anthropic 双协议兼容——对需要长上下文、多模态、低迁移成本的 Agent 开发者而言,这是 2026 年 8 月值得立刻接入测试的新选项。
但局限同样清晰:权重尚未落地(「Open-Source」标签先于仓库上线)、核心跑分均为厂商自测(Arena 1496 分仍标注 Preliminary)、SWE-bench Pro 与 HLE 落后于 Claude Fable 5。在第三方复测与权重开源完成之前,更务实的路径是走 API 做业务场景 A/B 测试,而非按营销话术迁移生产系统。
若你计划在 Qwen3.8-Max 权重开源前大规模跑长程 Agent 工作流(16 天级自主编码、500 步芯片优化或多模型并行路由),笔记本与通用 Linux VM 更容易暴露「省 API 费、丢 Agent 循环」的隐性成本——长任务被休眠打断、代码库不同步导致重跑,都会吃掉低价 API 的红利。建议将 Cursor CLI、OpenClaw 网关与团队代码库统一部署在持续在线的 Apple Silicon 远程 Mac上,通过 SFTP/rsync 保持仓库一致。SFTPMAC 远程 Mac 租赁提供面向 AI Agent 的 macOS 环境:原生 Cursor 兼容、低延迟 API 回调、7×24 不中断——比「个人设备兼 Agent 宿主机」更适合在 Qwen3.8-Max 接入窗口期把 API 价格优势真正转化为稳定的 Agent 生产收益。