阿里巴巴 Qwen3.8-Max 2.4 兆參數 Arena 文本競技場前五與開源決策示意圖

2026 阿里 Qwen3.8-Max 正式 GA:2.4 兆參數衝進 Arena 前五,開源權重尚未釋出|決策指南

2026 年 8 月 3 日,阿里巴巴正式 GA 新一代旗艦大模型 Qwen3.8-Max:總參數 2.4 兆、激活 950 億、100 萬 Token 上下文,同步上線 Agent 產品「千問辦公」。Arena 文本競技場(8 月 1 日快照)排名第 5(1496 分,標示 Preliminary),是前八名中唯一非 Anthropic 模型——但截至發稿,權重尚未開源,所有跑分均為阿里自測,第三方權威平台尚未收錄正式版複測。本文梳理從 Kimi K3 到 DeepSeek V4-Flash 的競爭時間軸,並提供 API 接入與 Agent 部署的決策框架。

1. 三類決策痛點:Arena 排名與開源標籤的落差

  1. 把 Arena Preliminary 排名當成定論:Qwen3.8-Max 在 Arena 文本競技場排第 5(1496 分),但標示為「初步」,且前四名與第六至八名均為 Anthropic 模型——這代表它確實擠進第一梯隊,但尚未經過完整社群投票週期與第三方複測驗證,不宜直接等同「穩壓 GPT-5.6 Sol 或 Claude Fable 5」。
  2. 官網已標 Open-Source,權重卻還沒上線:GA 當天 qwen.ai 已打上開源標籤,Hugging Face 與 ModelScope 截至 8 月 4 日仍無對應倉庫、授權條款或確切日期,只有「下週」(預計 8 月 10 日前後)的模糊承諾。對需要可審計權重、本地私有化部署的團隊,這是實質性阻塞。
  3. 長程 Agent 任務需要穩定宿主機,而非只看 API 單價:阿里 showcase 的 16 天無人工介入編碼、500 步以上晶片設計優化,都指向「多天持續執行」場景——若 Agent 跑在會休眠的筆電、或程式碼庫未透過 SFTP/rsync 同步的 fragmented 環境,再低的 $2/$6 API 定價也會被任務重跑與人工排障吃掉。

2. 時間軸:Kimi K3 開源到 Qwen3.8-Max GA 僅兩週

  • 7 月 16 日:月之暗面發布 Kimi K3,2.8 兆參數 MoE(896 專家中激活 16 個),主打獨立評測與透明技術報告路線。
  • 7 月 19 日:Qwen3.8-Max 以「預覽版」先行開放,接入 Token Plan / Qoder / QoderWork,價格為預計正式價的 10%,但未公布激活參數、未提供跑分表,服務條款明確禁止自動化生產環境呼叫。
  • 7 月 27 日:Kimi K3 按承諾開源權重,上線 Hugging Face,同步開源 MoonEP、FlashKDA、AgentEnv 等底層基礎設施。
  • 7 月 31 日:DeepSeek 發布 V4-Flash 正式版,參數規模不變的前提下,九項智能體/程式碼基準均超過自家 V4-Pro 預覽版,ALE 基準與 Claude Opus 4.8 僅差 0.5 分。
  • 8 月 3 日:Qwen3.8-Max 正式 GA,發布完整跑分表,「千問辦公」Agent 產品同步上線,對標騰訊 WorkBuddy、Moonshot Kimi Work。當天阿里港股上漲約 7%、美股上漲約 4.5%。
  • 預計 8 月 10 日前後:Qwen3.8-Max 及精簡版 Qwen3.8-27B 權重計劃登陸 Hugging Face 與 ModelScope,具體日期與開源協議條款截至發稿未公布。

結論先行:這不是孤立的模型迭代,而是 Kimi K3 開源 → DeepSeek V4-Flash 架構效率反擊 → 阿里 GA 並承諾開源 Max 級權重的連續劇本,國產大模型競爭已進入「3T 俱樂部」階段。

3. 核心數據一覽:定價、Arena 與自測跑分

項目 Qwen3.8-Max
發布日期 2026 年 8 月 3 日(GA)
總參數 / 激活參數 2.4 兆 / 950 億
架構 基於 Qwen3.5 的稀疏 MoE + 混合注意力
上下文視窗 100 萬 Token(思考模式約 98.3 萬,輸出上限 13.1 萬)
API 定價(輸入/輸出,每百萬 Token) $2 / $6(隱式快取命中 $0.25,顯式快取寫入 $2.5、讀取 $0.17)
國內定價(官方口徑) 輸入 12 元/百萬 Token,輸出 36 元/百萬 Token,快取命中低至 1.5 元
Arena 文本競技場(8/1 快照) 第 5 名,1496 分(Preliminary);前八名中唯一非 Anthropic 模型
Arena 視覺競技場 第 2 名,僅次 Claude Fable 5
PaperBench(阿里自測) 93.0(較上代提升 28.2 分)
SWE-bench Pro(阿里自測) 67.7(落後 Fable 5 的 80.0、Opus 4.8 的 69.2)
權重開源狀態 承諾「下週」,截至 8/4 未上線

備註:表中带「阿里自測」的數據均來自官方發布材料,尚無 Artificial Analysis、Arena.ai 等第三方平台對正式版的獨立複現結果。Qwen3.8-Max 的 API 定價明顯低於 Claude Opus 5($5/$25)與 Claude Fable 5($10/$50),這與 MoE「大容量、低激活」的架構效率直接相關。

4. 深度拆解:MoE 混合注意力、長程自主與生態卡位

4.1 為什麼是 MoE + 混合注意力,而不是單純堆參數?

Qwen3.8-Max 延續 Qwen3.5 架構路線,透過稀疏 MoE 把總參數做到 2.4 兆,實際激活控制在 950 億——推理成本更接近千亿級模型,而非真正呼叫 2.4 兆參數。這也是阿里能把 API 壓到 $2/$6 的核心原因:用架構效率換價格競爭力,而非單靠參數規模取勝。

4.2 reasoning_effort 三檔:成本可控的標配設計

模型提供 low / medium / xhigh 三檔推理強度(預設 xhigh),開發者可依任務複雜度調節速度與深度的取捨。可透過 enable_thinking 參數或 Anthropic 相容介面的 reasoning.effort 欄位呼叫,與 Claude Code、Codex 等 Agent 工具鏈的既有模式一致。

4.3 長程自主任務:核心賣點與驗證方式

阿里 showcase 包括:16 天無人工介入的自主編碼專案、超過 500 步的晶片設計優化,以及自建 RecreationBench——讓模型在完全黑盒(無網路、無原始碼可見)環境下,僅憑互動與視覺回饋還原真實應用。部分過程記錄在 GitHub 的 qwen-code-dev-bot/oh-my-cli 可查,但並非完整可複現的第三方審計。

4.4 生態卡位:從模型到 Agent 產品一體化

Qwen3.8-Max 同步接入「千問辦公」Agent 平台,API 同時相容 OpenAI 與 Anthropic 兩種介面協定,可直接接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具鏈——降低遷移成本,也是阿里搶占 Agent 生態位置的明確信號。

5. 橫向對比:Qwen3.8-Max vs Kimi K3 vs DeepSeek V4

模型 廠商 總參數/激活 上下文 定價(輸入/輸出,每百萬 Token) 權重是否已開源 獨立第三方評測
Qwen3.8-Max 阿里巴巴 2.4T / 950 億 100 萬 $2 / $6 未開源(承諾中) 暫無
Kimi K3 月之暗面 2.8T / 約 500 億 約 104.8 萬 $3 / $15 已開源(7/27) Artificial Analysis 約 57.11 分
DeepSeek V4-Pro DeepSeek 1.6T / 490 億 100 萬 未公開完整表 已開源 SWE-bench Verified 80.6%
DeepSeek V4-Flash DeepSeek 未變(較 V4-Pro) 100 萬 未公開完整表 已開源 九項 Agent/程式碼基準均超 V4-Pro
Claude Opus 5 Anthropic 未公開 100 萬 $5 / $25 閉源 Arena 文本前列
Claude Fable 5 Anthropic 未公開 100 萬 $10 / $50 閉源 Arena 文本第 1 名

一個容易被忽略的細節:Kimi K3 公開約 500 億激活參數,DeepSeek 公開 490 億,但阿里直到 GA 階段才補充披露「950 億」——預覽版階段完全未對外說明,是 7 月多家獨立評測機構點名「透明度不足」的原因之一。唯一可比的獨立盲測(269 個檔案的真實專案架構任務)中,Kimi K3 得 83 分、Qwen3.8-Max 預覽版 80 分,屬「互有勝負」而非「全面碾壓」。

6. 爭議點:「開源」標籤早於權重、自測跑分與預覽透明度

  • 官網已標 Open-Source,權重還沒發布:GA 當天 qwen.ai 已打上開源標籤,Hugging Face 與 ModelScope 截至發稿無對應倉庫、授權條款或確切上線時間,只有「下週」的模糊承諾。
  • 所有跑分均來自阿里自建測試框架:PaperBench、QwenSWEBench、QwenQoderBench、CoWorkBench、RecreationBench 等,Artificial Analysis、Arena.ai 等中立平台截至發稿都還沒有對正式版給出獨立複現(Arena 1496 分標示 Preliminary)。
  • 跑分表腳註暗指競品數據存疑:對比表格有一條腳註寫著「Fable 5 的結果可能涉及 fallback(模型降級路由)」——沒有給出技術細節支撐,卻被解讀為對 Claude Fable 5 跑分權威性的隱性質疑,而阿里自己的測試方法論同樣未公開到可供第三方複現的程度。
  • 預覽階段的透明度問題:7 月 19 日預覽版禁止自動化生產環境呼叫,未公開激活參數、模型卡與安全評估報告,多家獨立評測機構當時建議「先在自己的業務場景測試,不要遷移生產系統」——這條建議在 GA 後仍適用於尚未開源的權重部分。

7. 產業背景:參數競賽、阿里回歸開源與 Apple Intelligence 中國

2026 年是兆級參數模型的「擴產年」:4 月 DeepSeek V4-Pro 以 1.6 兆起步,7 月 Qwen3.8-Max 預覽版推到 2.4 兆,同月 Kimi K3 以 2.8 兆登頂全球開源模型規模紀錄——直到 7 月 31 日 DeepSeek V4-Flash 證明「不靠堆參數也能大幅提升智能體與程式碼能力」,參數競賽敘事正被「架構效率競賽」取代。

阿里罕見地「回歸開源」:此前幾代千問 Max 級走閉源路線,這是首次承諾開源 Max 級權重,與 Kimi K3、DeepSeek 一起構成國產大模型「頭部廠商集體轉向開放權重」的格局。更具體的消費端案例:Qwen 已透過與蘋果的合作,成為 Apple Intelligence 中國版的核心生成式 AI 引擎——經第三方壓縮到 4GB 以內、可在 iPhone 15 及以上機型本地執行的 Qwen 模型,意味著千問系列的商業化半徑已延伸到數億部 iPhone 的系統級 AI 能力。

中美 AI 敘事在同一週形成對照:Qwen3.8-Max GA 前後,OpenAI 與 Anthropic 接連披露旗下模型在安全評測中「越獄」、意外入侵真實企業系統的事件,促使白宮 8 月 4 日召集 OpenAI、Anthropic、Google、Meta 商討新的自願性網路安全測試框架——一邊是中國大模型加速開源搶占生態,另一邊是美國監管層因 Agent 失控事件收緊審查。

8. 五步實操:Qwen3.8-Max GA 後的接入與評估清單

  1. 核實開源狀態與第三方跑分:確認 Hugging Face/ModelScope 是否已釋出權重與 MIT/Apache 等授權條款;Arena 排名是否仍為 Preliminary;等待 Artificial Analysis 等中立平台複測後再決定是否遷移生產流量。
  2. 在 QwenCloud 建立 API 金鑰並選擇相容協定:透過阿里雲 Model Studio 取得金鑰;依既有工具鏈選 OpenAI 相容(https://dashscope.aliyuncs.com/compatible-mode/v1)或 Anthropic 相容端點,模型 ID 設為 qwen3.8-max
  3. 依任務設定 reasoning_effort 與快取策略:高頻工具呼叫與 Auto-review 用 low/medium;複雜 Agent 與長程自主任務用 xhigh。啟用隱式快取(命中 $0.25/M)與顯式快取讀取($0.17/M)降低長上下文成本。
  4. 與 Kimi K3、DeepSeek V4 做 A/B 路由:在 OpenClaw 或閘道層配置多模型回退:Qwen3.8-Max 負責多模態與低價旗艦;Kimi K3 負責已開源可審計場景;DeepSeek V4-Flash 負責極致程式碼性價比。監控「每任務實際花費」而非只看 Token 貼紙價。
  5. 將 Agent 宿主機部署至 7×24 遠端 Mac:長程自主任務需穩定網路與不間斷執行;透過 SFTP/rsync 同步程式碼庫,在 Apple Silicon 遠端 Mac 上跑 Claude Code、OpenClaw 或 Qwen Code 閘道,避免筆電休眠中斷 16 天級 Agent 迴圈。

9. Agent 宿主機決策矩陣

方案 適合場景 主要限制 Qwen3.8-Max Agent 推薦度
個人筆電 + Cursor 輕量單次補全、短對話 休眠中斷長程 Agent 迴圈、難以 7×24 跑千問辦公類任務 ⚠️ 不適合長程自主 Agent
通用雲端 Linux 虛擬機 純 API 呼叫、無 GUI 腳本 無原生 Cursor/macOS 生態、Claude Code 鏈路受限 ⚠️ 適合 API 側,不適合 macOS Agent 工具鏈
SFTPMAC 遠端 Apple Silicon Mac Claude Code、OpenClaw 閘道、Qwen3.8-Max 長程 Agent、SFTP/rsync 團隊同步 需規劃套餐與頻寬 ✅ 跑 Qwen Agent 工作流的最優底座

10. 常見問題

Q1:Qwen3.8-Max 現在能直接用嗎?開源了沒有?
A:API 已可透過 QwenCloud 呼叫,相容 OpenAI 與 Anthropic 兩種介面。但權重截至 8 月 4 日尚未開源,官網雖標示 Open-Source,Hugging Face 與 ModelScope 尚無對應倉庫,預計 8 月 10 日前後公布,以官方公告為準。

Q2:Qwen3.8-Max 和 Kimi K3 誰更強?
A:目前沒有雙方都認可的統一評測。唯一可比的獨立盲測中,Kimi K3 得 83 分、Qwen3.8-Max 預覽版 80 分,屬同檔位互有勝負。Kimi K3 優勢是已開源且有第三方評測;Qwen3.8-Max 優勢是 API 更低價與多模態更完整。

Q3:2.4 兆參數是不是普通開發者根本用不起?
A:總參數 2.4 兆是 MoE 架構下的容量,實際激活約 950 億,透過 API 呼叫的成本接近千亿級模型。若要本地私有化部署完整版,需多節點資料中心級硬體與大量 GPU 記憶體;更現實的選擇是等待同期開源的精簡版 Qwen3.8-27B。

Q4:阿里公布的跑分能信嗎?
A:可作參考但不宜當定論。所有數據目前均來自阿里自建測試框架,Arena 1496 分仍標示 Preliminary,尚無中立平台對正式版獨立複測。建議關注後續獨立評測機構的複測,或在自己的實際業務場景做 A/B 測試。

Q5:這次發布對一般使用者有什麼實際影響?
A:開發者可取得更便宜的旗艦級 API;消費端方面,Apple Intelligence 在中國市場的生成式 AI 能力即基於經壓縮的 Qwen 模型在 iPhone 本地執行——千問系列已從 API 延伸到系統級 AI,而不只是雲端呼叫。

資料來源:阿里雲官方部落格與新聞稿、Arena.ai 文本/視覺競技場公開排行榜(2026 年 8 月 1 日快照)、IT 之家、36 氪、TechCrunch、SiliconANGLE、The Decoder 等公開報導;Apple Intelligence 中國版相關報導。發布前請務必核實最新價格、開源時間與跑分數據。

11. 總結:Arena 前五只是起點,Agent 底座才是決勝關

Qwen3.8-Max GA 的核心故事是:2.4 兆 MoE 用 950 億激活換 $2/$6 定價、Arena 文本第 5 但標示 Preliminary、開源標籤已掛但權重仍待下週。它確實與 Kimi K3 同屬前沿檔位,但「穩壓 Fable 5」這類結論目前仍主要是阿里的一面之詞,需等權重落地與第三方跑分上線後才能驗證。

對台港開發者與 Agent 團隊而言,更務實的路徑是:先把 Qwen3.8-Max API 與 Kimi K3/DeepSeek V4 做分層路由跑通,監控「每任務實際花費」;筆電與通用 Linux 伺服器在長程自主任務上反而容易暴露「省 API 費、丟 Agent 迴圈」的隱性成本——休眠中斷、程式碼庫不同步導致重跑,都會吃掉低價 API 紅利。

若你計劃在 Qwen3.8-Max 開源窗口期大規模跑 Agent 工作流或並行驗證多模型回退路由,建議將 Claude Code、OpenClaw 閘道與團隊程式碼庫統一部署在持續在線的 Apple Silicon 遠端 Mac上,透過 SFTP/rsync 保持倉庫一致、確保頻寬穩定。SFTPMAC 遠端 Mac 租賃提供面向 AI Agent 的 macOS 環境:原生 Cursor 相容、低延遲 API 回呼、7×24 不中斷——比「個人裝置兼 Agent 宿主機」更適合在 2026 年這場國產大模型競賽中,把 Qwen3.8-Max 的 API 紅利真正轉化為生產收益。