Claude Opus 5 と Kimi K3 蒸留論争の技術判断ガイド表紙

2026年 Claude Opus 5 半額で Fable 5 接近、Kimi K3 蒸留論争「Claude 自称」:技術時代の判断マトリクス

2026 年 7 月 24 日、Anthropic は Claude Opus 5 を公開し Claude Max のデフォルトに設定しました。料金は従来どおり $5/$25 per 100 万 tokens のまま、CursorBench では Fable 5 ピークからわずか 0.5% 以内——実質「半額で旗艦に近い」位置づけです。一方 7 月 16 日に API が出た Moonshot の Kimi K3(総パラメータ 2.8T)は、白宫による蒸留疑惑に加え、Redwood Research の Ryan Greenblatt 氏が「Claude 自称かつ内部デプロイ ID を出力」する統計を公開し、技術コミュニティの注目を集めています。本稿はニュースの転載ではなく、OpenClaw や社内 Agent を運用するエンジニア向けの判断マトリクスとして、痛点・比較表・五手順・数値を整理します。

1. 三つの痛点:コスパ・出所・常時稼働

今週の二大トピックは、見た目は別件ですが、現場の意思決定では次の三層に収束します。

  1. 痛点一:旗艦性能と請求額のギャップ。 Fable 5 はベンチマーク最前線ですが、約 2 倍の token 単価と 30 日データ保持ポリシーが障壁です。Opus 5 は単価据え置きで CursorBench 0.5% 差まで接近——「あと 0.5% のために 2 倍払うか」が実務の問いになります。
  2. 痛点二:オープンウェイトの訓練出所が監査不能。 K3 は GPQA-Diamond 93.5% を謳いますが、完全重みは 7 月 27 日まで未公開。蒸留疑惑と身份統計は、低価格モデルを本番ルートに載せる際のサプライチェーンリスクとして扱う必要があります。
  3. 痛点三:モデルが優秀でもホストが眠れば無意味。 長時間ツールループ、SSH コールバック、SFTP 同期は24 時間 macOS ホストに依存します。ノート PC のスリープやコンテナ再作成で API キーが消える事故は、モデル選びより頻繁に起きます。

2. Claude Opus 5:Max デフォルト化の意味

7 月 24 日(太平洋時間)、Anthropic は claude-opus-5 を Claude API/Bedrock/Vertex 等で提供開始し、Claude Max のデフォルトおよび Pro 向け最強公開モデルに位置づけました。入力 $5、出力 $25 per 100 万 tokens、コンテキスト 100 万 tokens、Thinking デフォルト ON です。

公開ベンチマークの要点は次のとおりです。Frontier-Bench v0.1 では Opus 4.8 の2 倍以上かつタスク単価低下。CursorBench 3.2 max effort で Fable 5 ピークから 0.5% 以内。ARC-AGI 3 は次点の 3 倍。OSWorld 2.0 では Fable 5 最良スコアを、コストの約 3 分の 1 弱で上回る、と Anthropic は説明しています。

技術選定で見落とされがちな点:Opus 5 は歴代 Opus と同様、一般利用で 30 日データ保持を強制しません。Fable 5/Mythos 5 は opt-in が必要です。社内コードや顧客データを Agent に渡す場合、この差は 0.5% ベンチ差より重いことがあります。

3. Kimi K3 蒸留論争:政治と統計の境界

Moonshot は 7 月 16 日に Kimi K3 を公開。総パラメータ 2.8 兆、896 エキスパート MoE(トークンあたり 16 活性、約 500 億活性相当)、100 万 token コンテキスト、ネイティブビジョンを備えます。

7 月 22–23 日、白宫 OSTP 長 Michael Kratsios 氏が X で「大規模かつ隠蔽的な産業級蒸留」による Fable 能力窃取を Moonshot に問う投稿を行い、Nvidia GB300 芯片の不正取得疑惑も言及。財務長 Scott Bessent 氏も「中国モデルに米 LLM の watermark」を述べました。Anthropic は 2026 年 2 月時点で Moonshot 等に 340 万回超の異常 API 相互作用を指摘しています。

TechCrunch(7/23)は Braden Hancock 氏(Snorkel AI 共同創業)らのコメントを掲載。「Fable は 7/1 から公開。2 週間で蒸留・学習・リリースは非現実的」との指摘が主流です。Allen AI の Nathan Lambert 氏は、蒸留より RL 訓練体制の差が前沿を決める、と分析しています。

本論争で最もエンジニア向けの材料は、Greenblatt 氏 7 月 24 日前後の GitHub 分析(rgreenblatt/which_claude_is_k3)です。K3 は自己紹介で異常な頻度で Claude を名乗りclaude-opus-4-5-20250929 等のAnthropic 内部デプロイ IDを出力します——本物の Claude Sonnet 4.5 は通常「Claude Sonnet 4.5」とだけ答えます。Greenblatt 氏は「教師モデルのメタデータを教師自身より正確に再現する」現象は、会話模倣だけでは説明しにくく、デプロイメタデータ付き Claude データ混入を示唆する、と述べつつ、蒸留の直接証明ではないとも強調しています。K3 の信号は Claude 4.5 世代(2025 年末)に固定され、K2 はより古い Sonnet 4 世代を指す——世代ごとに「最新 Claude を追う」パターンが見えます。

4. 三モデル比較マトリクス

観点 Claude Opus 5 Claude Fable 5 Kimi K3
token 単価 $5 in / $25 out 約 $10 / $50 Fable 5 より大幅に低い(公式)
CursorBench 3.2 Fable 5 ピーク -0.5% 基準 公式は Fable 5 次点
データ保持 デフォルトで 30 日強制なし 30 日保持 opt-in 必要 自前ホストなら制御可(重み 7/27)
Max デフォルト はい(7/24〜) いいえ 該当なし
出所リスク Anthropic SLA 同上+保持条項 蒸留未確定・身份統計要監査
向く用途 日常 Agent・コンプライアンス重視 极限ベンチ・保持許容 低コスト実験・重み公開後の検証

5. 五手順 HowTo:選定から本番検証まで

  1. コンプライアンスとデータ保持を文書化する: 顧客ソースコードや PHI を扱う場合、30 日保持を拒否するなら Opus 5 を優先。K3 完全重み公開前は機密 Prompt を Moonshot エンドポイントに流さない。
  2. ワークロードにベンチマーク層を割り当てる: コーディングは CursorBench/Frontier-Bench。業務自動化は Zapier AutomationBench(Opus 5 は 100% 通過を報告)。生命科学は内部スペクトル推論 +10.2pt 等を参照。
  3. オープンモデルに身份プローブを行う: 固定 Prompt セットで 100 回以上サンプリング。内部 ID 文字列の出現率が閾値を超えたらアーキテクチャレビューに「訓練譜系不明」フラグを立てる。
  4. API ルーティングと fallback を構成する: OpenClaw/OpenRouter で anthropic/claude-opus-5 を primary、Sonnet 5 や GPT 系を secondary に。429 監視とコストダッシュボードを同一画面で確認。
  5. 常時稼働リモート Mac で E2E 検証する: openclaw gateway restartchannels status --probedoctor。API キー・Skills・SFTP ワークスペースが launchd 管理下の同一ノードにあることを確認。
openclaw gateway restart
openclaw channels status --probe
openclaw doctor

6. 引用可能な数値とタイムライン

  • Opus 5 料金: $5/$25 per 100 万 input/output tokens(Opus 4.8 据え置き、Fable 5 約半額)。
  • CursorBench 3.2: max effort で Fable 5 から 0.5% 以内。
  • Frontier-Bench: Opus 4.8 の 2 倍超
  • ARC-AGI 3: 次点の 3 倍
  • K3 パラメータ: 2.8T、API 7/16、完全重み 7/27 予定。
  • GPQA-Diamond: K3 公式 93.5%
  • 蒸留タイムウィンドウ: Fable 公開 7/1 → K3 公開 7/16 = 14 日
  • Anthropic 2 月指摘: 異常 API 340 万+ 回。

7. よくある質問 FAQ

Opus 5 は Fable 5 よりどれくらい安いですか? token コストは約半分で、CursorBench 差は 1% 未満です。

Opus 5 は Max デフォルトですか? はい。2026 年 7 月 24 日から Claude Max のデフォルトです。

K3 は Claude を蒸留しましたか? 未確定。白宫証拠なし、タイムライン批判あり、Greenblatt 統計が現時点の最強技術手がかりです。

完全重みはいつ? 2026 年 7 月 27 日予定。公開前は外部再現不可です。

8. まとめ:モデル選定とホスト選定はセット

Opus 5 は「単価据え置き・能力跳級・データ保持非強制」という三拍子で、多くの OpenClaw 現場では Fable 5 より実務的なデフォルトになり得ます。Kimi K3 は低価格オープンウェイトの魅力が大きい一方、重み公開と蒸留論争が落ち着くまで、機密 Agent の primary には向きません。

いずれの API を選んでも、推論先を決めただけでは本番は回りません。長時間ツールループと SFTP 同期には途切れない macOS ホストが必要です。ノート PC のスリープ、Docker の pairing 消失、海外プロキシによるコールバック遅延——これらはベンチ 0.5% より先に障害チケットを生みます。

Claude Opus 5 駆動の Agent を Xcode ビルドや CI 成果物と同一ノードで 24 時間運用するなら、SFTPMAC のリモート Mac レンタルが現実的です。Apple Silicon の統合メモリはマルチ Agent に向き、macOS の権限モデルは allowedPaths 絞り込みに適し、バックボーン回線は API コールバック遅延を抑えます。今週のモデルニュースを、蓋を閉じると止まる実験ではなく継続稼働する自動化へつなげてください。