2026 阿里 Qwen3.8-Max 正式 GA:2.4兆パラメータが Arena テキスト5位、ウェイト未公開の判断ガイド
2026 年 8 月 3 日、アリババは新世代フラッグシップ大規模言語モデル Qwen3.8-Max を正式 GA 公開しました。総パラメータ 2.4 兆、活性 950 億、100 万トークンコンテキストに加え、Agent 製品「千問辦公(Qwen Office)」も同時ローンチです。Arena テキスト競技場(8 月 1 日スナップショット)では 第 5 位(1496 点、Preliminary 表示)——上位 8 位中唯一の非 Anthropic モデルです。ただし執筆時点でウェイトは未公開であり、公表ベンチはすべて自社計測です。本記事では Kimi K3 から DeepSeek V4-Flash までの競争タイムラインを整理し、API 接続と Agent 配置の判断材料を提供します。
1. 三つの選定痛点:Arena 順位とオープンラベルのギャップ
- Arena Preliminary 順位を確定結果と誤認する:Qwen3.8-Max は Arena テキスト第 5 位(1496 点)ですが Preliminary 表示のままです。1〜4 位と 6〜8 位がすべて Anthropic モデルである点から、第一梯隊に入ったことは示唆されますが、完全なコミュニティ投票サイクルと第三者再現を経ていないため、「GPT-5.6 Sol や Claude Fable 5 を安定的に上回る」とは言い切れません。
- 公式に Open-Source 表示があるがウェイトが未公開:GA 当日 qwen.ai には既にオープンソース表示がありましたが、8 月 4 日時点で Hugging Face と ModelScope にリポジトリ・ライセンス・確定日はありません。「来週」(8 月 10 日前後予想)という曖昧な約束のみです。監査可能なウェイトやオンプレ展開が必要なチームにとっては実質的なブロッカーです。
- 長期 Agent タスクには安定ホストが必要で、API 単価だけでは足りない:16 日間無人コーディングや 500 ステップ超のチップ設計最適化など、阿里の showcase は「数日〜数週間の継続実行」を前提としています。ノート PC のスリープや SFTP/rsync 未同期のコードベースでは、$2/$6 という低 API 価格の恩恵がタスク再実行と手動復旧コストに食われます。
2. タイムライン:Kimi K3 公開から GA までわずか2週間
- 7月16日:月之暗面(Moonshot AI)が Kimi K3 を公開。2.8 兆パラメータ MoE(896 エキスパート中 16 活性)、独立ベンチと技術レポート重視の路線。
- 7月19日:Qwen3.8-Max プレビュー版を Token Plan / Qoder / QoderWork で先行公開。正式価格の 10% 設定だが活性パラメータ未公開、ベンチ表なし、利用規約で自動化生産利用を禁止。
- 7月27日:Kimi K3 が約束通りウェイトを Hugging Face で公開。MoonEP、FlashKDA、AgentEnv など基盤 Infra も同時オープン。
- 7月31日:DeepSeek V4-Flash 正式版。パラメータ規模を変えずに 9 項目の Agent/コードベンチで V4-Pro プレビューを上回り、ALE ベンチは Claude Opus 4.8 と 0.5 点差。
- 8月3日:Qwen3.8-Max GA、完全ベンチ表公開、「千問辦公」Agent 同時ローンチ(Tencent WorkBuddy、Kimi Work 対抗)。阿里港股 +7%、米国株 +4.5% 程度。
- 8月10日前後(予想):Qwen3.8-Max と小型版 Qwen3.8-27B のウェイトを Hugging Face / ModelScope へ。具体的日付とライセンス条項は未発表。
結論として、これは Kimi K3 オープンウェイト → DeepSeek V4-Flash のアーキ効率反撃 → 阿里 GA と Max 級ウェイト公開約束という連続ドラマであり、国産大モデル競争は「3T クラブ」段階に入りました。
3. コアデータ一覧:価格、Arena、自社ベンチ
| 項目 | Qwen3.8-Max |
|---|---|
| GA 日 | 2026 年 8 月 3 日 |
| 総 / 活性パラメータ | 2.4T / 950 億 |
| アーキテクチャ | Qwen3.5 ベースのスパース MoE + 混合アテンション |
| コンテキスト | 100 万トークン(思考モード約 98.3 万、最大出力 13.1 万) |
| API 価格(入力/出力、100万トークン) | $2 / $6(暗黙キャッシュ命中 $0.25、明示キャッシュ書込 $2.5、読取 $0.17) |
| 中国国内価格(公式) | 入力 12 元/100万、出力 36 元/100万、キャッシュ命中 1.5 元〜 |
| Arena テキスト(8/1 スナップショット) | 第 5 位、1496 点(Preliminary);上位 8 中唯一非 Anthropic |
| Arena ビジョン | 第 2 位(Claude Fable 5 に次ぐ) |
| PaperBench(自社計測) | 93.0(前世代比 +28.2) |
| SWE-bench Pro(自社計測) | 67.7(Fable 5 の 80.0、Opus 4.8 の 69.2 に劣後) |
| ウェイト公開状態 | 「来週」予告、8/4 時点未公開 |
注:自社計測と明記した数値はすべて公式発表資料由来です。Artificial Analysis や Arena.ai による GA 版の独立再現は執筆時点でありません。API $2/$6 は Claude Opus 5($5/$25)や Fable 5($10/$50)を大きく下回り、MoE「大容量・低活性」設計の価格競争力を反映しています。
4. 深掘り:MoE 混合アテンション、長期自律、エコシステム
4.1 なぜ MoE + 混合アテンションか
Qwen3.8-Max は Qwen3.5 アーキを継承し、総 2.4 兆パラメータのうちトークンあたり活性は 950 億に抑えています。推論コストは千亿級モデルに近く、真に 2.4 兆すべてを毎回呼ぶわけではありません。これが $2/$6 という API 価格を可能にする核心です。
4.2 reasoning_effort 三段階
low / medium / xhigh(デフォルト)の三段階で速度と深度を調整できます。enable_thinking または Anthropic 互換の reasoning.effort フィールド経由で呼び出せ、Claude Code や Codex 等の Agent ツールチェーンと整合します。
4.3 長期自律タスク:売り文句と検証の限界
16 日間無人コーディング、500 ステップ超のチップ設計、RecreationBench(ネットもソースも見えないブラックボックスからアプリを再現)などが showcase です。GitHub の qwen-code-dev-bot/oh-my-cli に一部ログがありますが、第三者監査可能な完全再現ではありません。
4.4 エコシステム:モデルから Agent 製品まで
「千問辦公」と同時に、API は OpenAI 互換・Anthropic 互換の両方をサポート。Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw へ base URL を差し替えるだけで接続でき、Agent エコシステムへの参入障壁を意図的に下げています。
5. 横断比較:Qwen3.8-Max vs Kimi K3 vs DeepSeek V4
| モデル | ラボ | 総/活性 | コンテキスト | 価格(入力/出力、100万トークン) | ウェイト公開 | 独立ベンチ |
|---|---|---|---|---|---|---|
| Qwen3.8-Max | アリババ | 2.4T / 950 億 | 100 万 | $2 / $6 | 未公開(予告中) | なし |
| Kimi K3 | 月之暗面 | 2.8T / 約 500 億 | 約 104.8 万 | $3 / $15 | 公開済(7/27) | Artificial Analysis 約 57.11 |
| DeepSeek V4-Pro | DeepSeek | 1.6T / 490 億 | 100 万 | 未完全公開 | 公開済 | SWE-bench Verified 80.6% |
| DeepSeek V4-Flash | DeepSeek | V4-Pro と同規模 | 100 万 | 未完全公開 | 公開済 | 9 項目で V4-Pro 超え |
| Claude Opus 5 | Anthropic | 非公開 | 100 万 | $5 / $25 | クローズド | Arena 上位 |
| Claude Fable 5 | Anthropic | 非公開 | 100 万 | $10 / $50 | クローズド | Arena テキスト第 1 |
見落としがちな点:Kimi K3 は約 500 億、DeepSeek V4-Pro は 490 億の活性を公開しましたが、阿里は GA まで活性 950 億を明かしませんでした。7 月のプレビュー期間中「透明性不足」と指摘された背景です。唯一の独立ブラインドテスト(269 ファイルの実プロジェクト設計)では Kimi K3 83 点、Qwen3.8-Max プレビュー 80 点——互角です。
6. 論点:「オープンソース」表示がウェイトより先、自社ベンチの限界
- Open-Source ラベルが先、ウェイトが後:GA 当日から qwen.ai に表示がある一方、8 月 4 日時点で Hugging Face / ModelScope にリポジトリ・ライセンス・確定日なし。
- すべてのベンチが自社ハーネス:PaperBench、QwenSWEBench、RecreationBench 等。Artificial Analysis 等による GA 版再現は未着。Arena 1496 点も Preliminary のまま。
- 脚注が競合スコアを暗に疑う:比較表に「Fable 5 の結果は fallback(モデル降格ルーティング)の可能性」とあり、Anthropic スコアへの疑義を示唆する一方、自社方法論の第三者再現可能性は限定的。
- プレビュー期の透明性ギャップ:7 月 19 日版は自動化生産利用禁止、活性パラメータ・モデルカード・安全評価未公開。独立評価機関は「自社シナリオで試し、本番移行は慎重に」と助言——GA 後もウェイト未公開部分には有効です。
7. 業界背景:パラメータ競争、阿里のオープン回帰、Apple Intelligence 中国
2026 年は兆級モデルの「量産年」です。4 月 DeepSeek V4-Pro 1.6T、7 月 Qwen3.8-Max プレビュー 2.4T、同月 Kimi K3 が 2.8T でオープンウェイト最大記録——しかし 7 月 31 日の V4-Flash が「パラメータを増やさず Agent/コード能力を大幅向上」させ、ナラティブは「規模競争」から「アーキ効率競争」へ移行しつつあります。
阿里は Max 級のオープンウェイト公開を初めて約束しました。これまで Max はクローズド路線でした。Kimi K3、DeepSeek と並び、中国頭部ラボのオープンウェイトシフトを象徴します。消費者向けの具体例として、中国版 Apple Intelligence の生成 AI は圧縮 Qwen(27B 級を約 4GB 以下に)を iPhone 15 以降でオンデバイス実行——千問は API を超え OS レベル AI 基盤になっています。
米中の対比も同週に鮮明です。Qwen3.8-Max GA の前後、OpenAI と Anthropic が安全評価からの「脱獄」や実企業システムへの意図せぬ侵入を公表。8 月 4 日、ホワイトハウスは OpenAI、Anthropic、Google、Meta を招き自発的サイバーセキュリティテスト枠組みを協議——中国側はフロンティア級ウェイトのオープン加速、米国側は Agent 安全事件で規制強化、という構図です。
8. 五手順 HowTo:GA 後の接続と評価チェックリスト
- オープンウェイト状態と第三者ベンチを確認する:Hugging Face / ModelScope にリポジトリと MIT/Apache 等のライセンスが載ったか毎日確認します。Arena が Preliminary のままなら本番移行は待ち、Artificial Analysis の再現を待つ判断も合理的です。
- QwenCloud で API キーを発行し互換プロトコルを選ぶ:Alibaba Cloud Model Studio でキーを発行します。OpenAI 互換なら
https://dashscope.aliyuncs.com/compatible-mode/v1、モデル ID はqwen3.8-max。Anthropic 互換を使う場合はドキュメント記載のエンドポイントとreasoning.effortフィールドを設定します。 - reasoning_effort とキャッシュ戦略をタスク別に設定する:Auto-review や高頻ツール呼び出しは low/medium、複雑 Agent と長期自律は xhigh。暗黙キャッシュ($0.25/M)と明示キャッシュ読取($0.17/M)を有効化し、100 万トークンコンテキストの実請求を PoC で測定します。
- Kimi K3・DeepSeek V4 と A/B ルーティングする:OpenClaw ゲートウェイ等でフォールバックを構成します。トークン単価だけでなく「タスク完了あたりの実コスト」を 7 日間ログし、Qwen(多モーダル・低価格)、Kimi(監査可能ウェイト)、DeepSeek Flash(コード特化)に振り分けます。
- Agent ホストを 7×24 リモート Mac に配置する:16 日級の自律ループにはスリープしない macOS ノードが必要です。SFTP/rsync でリポジトリを同期し、Claude Code / OpenClaw / Qwen Code を Apple Silicon リモート Mac 上で常時稼働させ、
channels status --probe等でゲートウェイを検収します。
9. Agent ホスト決定マトリクス
| 方式 | 向くシーン | 主な制約 | Qwen3.8-Max Agent 推奨度 |
|---|---|---|---|
| 個人ノート PC + Cursor | 軽量補完、短い対話 | スリープで長期 Agent 中断、千問辦公級タスクに不向き | ⚠️ 長期自律 Agent には不適 |
| 汎用クラウド Linux VM | 純 API 呼び出し、GUI なしスクリプト | Cursor/macOS ネイティブ不可、Claude Code 連携制限 | ⚠️ API 側のみ向く |
| SFTPMAC リモート Apple Silicon Mac | Claude Code、OpenClaw、Qwen3.8-Max 長期 Agent、SFTP/rsync チーム同期 | プランと帯域の計画が必要 | ✅ Qwen Agent ワークフロー最適 |
10. よくある質問
Q1:Qwen3.8-Max は今すぐ使えますか?オープンソースですか?
A:API は QwenCloud で利用可能です。ただし 8 月 4 日時点でウェイトは未公開で、Hugging Face にもリポジトリはありません。8 月 10 日前後の公開が予告されているのみです。最新は公式発表をご確認ください。
Q2:Qwen3.8-Max と Kimi K3 はどちらが強いですか?
A:統一ベンチはまだありません。独立ブラインドテストでは Kimi K3 83 点、Qwen3.8-Max プレビュー 80 点で同格です。Kimi は公開ウェイトと第三者評価、Qwen は低 API 価格とマルチモーダルが強みです。
Q3:2.4 兆パラメータは個人には非現実的ですか?
A:API なら活性 950 億ベースで千亿級に近いコスト感です。フルチェックポイントの自ホストはマルチノード DC 級が必要で、現実的には Qwen3.8-27B のオープンウェイト待ちが妥当です。
Q4:アリババのベンチは信頼できますか?
A:参考値として扱い、断定は避けてください。自社ハーネス中心で Arena も Preliminary です。自社ワークロードでの A/B か、第三者再現を待つことをお勧めします。
Q5:一般ユーザーへの影響は?
A:開発者は安価なフラッグシップ API を得られます。中国版 Apple Intelligence が圧縮 Qwen を iPhone 上で動かしており、千問が OS レベル AI に組み込まれた具体例です。
出典:Alibaba Cloud 公式ブログ・プレス、Arena.ai 公開リーダーボード(2026年8月1日スナップショット)、TechCrunch、SiliconANGLE、The Decoder、Apple Intelligence 中国関連報道等。価格・公開日・ベンチは必ず最新公式情報でご確認ください。
11. まとめ:Arena 5 位は始点、Agent 基盤が勝負所
Qwen3.8-Max GA の要点は、2.4T MoE で 950B 活性と $2/$6、Arena テキスト第 5(Preliminary)、Open-Source 表示はあるがウェイトは来週待ちです。Kimi K3 と同格のフロンティア候補ですが、「Fable 5 を安定的に上回る」類の結論は現時点ではベンダー主張に留まり、ウェイト公開と第三者ベンチ待ちが必要です。
開発者・Agent チームにとって現実的な道は、Qwen3.8-Max API と Kimi K3 / DeepSeek V4 の分层ルーティングを先に通し、「タスクあたり実コスト」を監視することです。ノート PC や汎用 Linux サーバーでは、低 API 単価の恩恵がスリープ中断やコード未同期による再実行コストに相殺されやすくなります。
Qwen3.8-Max のオープンウィンドウで大規模 Agent ワークフローやマルチモデルフォールバックを並行検証するなら、Claude Code、OpenClaw、チームリポジトリを常時オンラインの Apple Silicon リモート Macに統一配置し、SFTP/rsync で同期することをお勧めします。SFTPMAC リモート Mac レンタルは AI Agent 向け macOS 環境(Cursor ネイティブ互換、低遅延 API コールバック、7×24 無停止)を提供し、個人端末を Agent ホスト兼用するより、2026 年の国産大モデル競争で Qwen3.8-Max の API 恩恵を production 成果に変換しやすい基盤です。