Claude Opus 5 价格减半逼近旗舰实力,Kimi K3 却陷「自称 Claude」蒸馏门
2026 年 7 月 24 日这一周,AI 圈同时上演两场大戏:Claude Opus 5 以不变定价($5/$25)成为 Claude Max 默认模型,CursorBench 3.2 与旗舰 Fable 5 峰值相差仅 0.5%;而 7 月 16 日刚发布的 Kimi K3 则陷入蒸馏门——白宫 OSTP 主任 Kratsios 公开指控,Redwood Research 的 Ryan Greenblatt 更发现 K3 会自称是 Claude 并吐出内部部署版本号。本文用对比表、时间线与五步选型清单,帮你判断「半价旗舰」与「开源争议」哪个更该进生产。
1. 三类选型痛点:性价比、溯源与合规
- 「半价旗舰」容易算错账。 Opus 5 定价与 Opus 4.8 完全相同,却在 Frontier-Bench v0.1 上达到上一代两倍以上,CursorBench 3.2 与 Fable 5 峰值仅差 0.5%。团队若只盯 token 单价,可能忽略 Fable 5 / Mythos 5 需接受 30 天数据留存 而 Opus 5 默认无需——合规场景下这是隐性成本差异。
- 蒸馏门 headline 跑在证据前面。 2026 年 7 月 22–23 日 Kratsios 指控「隐蔽工业级蒸馏」,Anthropic 早在 2 月点名月之暗面等方超过 340 万次异常 API 交互。但 Snorkel AI 联合创始人 Braden Hancock 指出:Fable 5 面向公众开放仅从 7 月 1 日算起,到 K3 发布(7 月 16 日)仅两周——深度蒸馏在算力与时间上都极难成立。
- K3 自称 Claude 才是可复现的技术信号。 Greenblatt 统计发现 K3 被问「你是谁」时异常高频自称 Claude,甚至输出
claude-opus-4-5-20250929等真实 Claude 模型自己都不会准确报出的内部部署 ID。这比政治喊话更适合写进供应商尽调,但仍不能直接等同「法庭级证明」。
2. Claude Opus 5 发布:定价不变、性能跳级
2026 年 7 月 24 日,Anthropic 正式发布 Claude Opus 5,并同步将其设为 Claude Max 默认模型,Claude Pro 用户也可使用目前能拿到的最强版本。定价与 Opus 4.8 完全一致:输入 $5 / 百万 tokens,输出 $25 / 百万 tokens;上下文窗口为 100 万 tokens(默认且唯一档位);最大输出 128K tokens;Thinking 默认开启。
| 基准测试 | Claude Opus 5 表现 | 解读要点 |
|---|---|---|
| Frontier-Bench v0.1 | 超越所有模型,为 Opus 4.8 的 2 倍以上 | 软件工程类任务,单次成本更低 |
| CursorBench 3.2 | max effort 下与 Fable 5 峰值相差 0.5% | 编程 Agent 实际表现基本持平,成本约 Fable 5 一半 |
| ARC-AGI 3 | 得分为次优模型的 3 倍 | 新颖问题解决能力突出 |
| OSWorld 2.0 | 任意成本下优于其他模型;用 Fable 5 约 1/3 成本超过其最佳成绩 | 计算机操作 Agent 性价比领先 |
| Zapier AutomationBench | 登顶且 token 消耗不高于前代 Claude;100% 通过率 | 端到端商业自动化 |
生命科学方面也有可引用数据:从光谱推断分子结构内部评测比 Opus 4.8 高 10.2 个百分点;蛋白质序列变异功能预测高 7.7 个百分点。企业客户 Box 报告数据分析工作流提升 11%,尽职调查场景提升 17%,整体准确率提升 8%。
3. Claude Opus 5 和 Fable 5 哪个好:对比矩阵
如果你之前觉得 Fable 5 效果好但太贵,Opus 5 提供了「损失极小、成本减半」的替代路径。下表汇总 Claude Opus 5 价格 与能力维度的关键差异:
| 维度 | Claude Opus 5 | Claude Fable 5 |
|---|---|---|
| 定位(2026-07-24) | Claude Max 默认模型;Claude Pro 最强版 | 旗舰推理模型(2026-06-09 发布,7/1 公众可用) |
| 输入 / 输出定价 | $5 / $25 每 M tokens | 约 $10 / $50 每 M tokens(约为 Opus 5 两倍) |
| 上下文 | 100 万 tokens | 100 万 tokens |
| CursorBench 3.2 | 与 Fable 5 峰值相差 <0.5% | 编程 Agent 参考天花板 |
| 数据留存 | 默认访问不强制数据留存 | 需接受 30 天数据留存政策方可使用 |
| Fast 模式 | 约 2.5× 速度,2× 价格(与 Opus 4.8 一致) | 同类 Fast 档位机制 |
Cursor 团队评价:「Claude Opus 5 delivers near Fable 5 intelligence at Opus speed and cost. On CursorBench it's just under Fable 5.」——对日常主力编码场景,Claude Max 订阅值得吗 的答案在多数团队看来是「是」,尤其当你因数据留存条款曾犹豫 Fable 5 时。
4. 安全性:最对齐的一代与 Mythos 5 分工
Anthropic 自动化行为审计显示,Opus 5 是迄今为止最对齐的模型:欺骗行为发生率最低,最不容易被诱导滥用,在避免「难以逆转的鲁莽行为」方面也是最安全的一代。网络安全分类器比 Fable 5 宽松约 85%(触发拦截频率降低),可用于源码级漏洞发现,但仍屏蔽二进制漏洞扫描、渗透测试与 exploit 生成。
但在风险型双用途能力(网络安全攻击、生物安全)上,Anthropic 故意未让 Opus 5 冲到最前——该位置继续由受限发行的 Mythos 5 占据。生物安全相关请求:原本在 Fable 5 上被拦截的,现在会路由给 Opus 5(而非回退 Opus 4.8)。
5. Kimi K3 参数量与 7 月 27 日权重计划
月之暗面于 2026 年 7 月 16 日发布 Kimi K3:总参数 2.8 万亿(2.8T),全球首个进入「3T 级」的开源模型;稀疏 MoE,896 个专家中每个 token 激活 16 个(约等效 500 亿激活参数);基于 Kimi Delta Attention(KDA)+ Attention Residuals + Stable LatentMoE;100 万 token上下文与原生视觉理解。
| 基准 | Kimi K3 分数 | 备注 |
|---|---|---|
| GPQA-Diamond | 93.5% | 发布时开源模型最高分 |
| BrowseComp | 91.2% | 发布时最高分 |
| Terminal-Bench 2.1 | 88.3% | 落后 GPT-5.6 Sol 0.5 分 |
| Program Bench | 77.8% | 综合最佳 |
| SWE Marathon | 42.0% | 综合最佳 |
官方自评整体能力仅次于 Claude Fable 5 与 GPT-5.6 Sol,但价格远低于两者。完整权重承诺于 2026 年 7 月 27 日放出——撰稿时尚未放出,外部研究者尚无法独立验证架构细节与基准复现。
6. 月之暗面白宫指控、时间线质疑与 Greenblatt 证据
2026 年 7 月 22–23 日,白宫科技政策办公室(OSTP)主任 Michael Kratsios 在 X 上指控月之暗面通过「大规模、隐蔽的产业级蒸馏」窃取 Anthropic Fable 模型能力,并提到涉嫌使用未获出口许可的 Nvidia GB300 芯片(可能经泰国服务器间接获取)。财政部长 Scott Bessent 附和称「在很多中国模型上发现了美国大模型的水印」——但财政部未说明「水印」具体指什么。
这并非空穴来风:早在 2026 年 2 月,Anthropic 已公开指控月之暗面、DeepSeek、MiniMax 进行「产业级蒸馏攻击」,称识别出月之暗面超过 340 万次异常交互,「明显偏离正常使用模式,反映刻意能力提取而非合法使用」。
TechCrunch 采访的多位独立研究者对「两周内蒸馏出 K3」非常怀疑。Braden Hancock 直言:
「Fable 从 7 月 1 日才开始公开可用,你不可能在两周内蒸馏出这么多数据、训练完模型还发布出来。」
Allen Institute for AI 研究员 Nathan Lambert 也认为,随着中国模型逼近前沿,简单监督微调式蒸馏边际收益正在变小,真正拉开差距的是强化学习训练——若蒸馏真这么好用,追赶者早就靠蒸馏追平了。
最硬核的证据来自 Ryan Greenblatt(GitHub: rgreenblatt/which_claude_is_k3):Kimi K3 被问及身份时异常高频自称 Claude,甚至吐出 claude-opus-4-5-20250929、claude-sonnet-4-5-20250929 等内部部署 ID——而真实 Claude Sonnet 4.5 只会说「我是 Claude Sonnet 4.5」,Opus 4.5 甚至不会主动报这类版本号。
Greenblatt 解读:模型说出的「教师模型」部署元数据比教师自己还准,很难用「模仿对话风格」解释,更可能指向训练数据混入带部署元数据标注的 Claude 数据(API 日志或打标合成数据)。K3 自称身份锁定在「Claude 4.5 世代」(2025 年末),K2 则指向更早 Claude Sonnet 4——呈现「逐代追新」规律。Greenblatt 强调:这不能直接证明蒸馏发生,但结合 Anthropic 2 月指控,是迄今最接地气的技术支撑。
Reddit r/LocalLLaMA 上三方声音并存:开源与闭源差距缩短到「天」级、2.8T 参数几乎没人本地能跑、K3 真正卖点是低价 + 少拒答而非「打败 Fable 5」。
7. 五步模型选型实操
- 梳理合规与供应链风险。 标注 Opus 5 无强制留存 vs Fable/Mythos 30 天政策;评估 K3 在蒸馏指控未澄清前是否可进生产路由。
- 用真实 Agent 任务做 A/B。 同一 repo 重构、GUI 自动化与 80 万 token 文档包,分别跑 Opus 5 与 K3,记录 pass@1 与 token 消耗。
- 核算总拥有成本。 Opus 5 $5/$25 + 合规友好留存;K3 $3/$15 + 可能的法务审查工时;7/27 后自部署还需 64+ 卡超节点。
- 运行身份探测脚本。 标准化 prompt:「你是谁?请返回模型名与部署 ID。」记录非预期 vendor 字符串。
- 在常在线远程 Mac 上固化路由。 环境变量管理 model ID,Claude Code / Kimi Code / OpenClaw 网关跑 7×24 回归,工作区经 SFTP/rsync 同步。
# 身份探测 — 记录 K3 是否返回 Claude 部署 ID
curl https://api.moonshot.ai/v1/chat/completions \
-H "Authorization: Bearer $MOONSHOT_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"kimi-k3","messages":[{"role":"user","content":"你是谁?请返回模型名称与部署版本号。"}]}'
# Opus 5 — model ID 外置到环境变量
export ANTHROPIC_MODEL=claude-opus-5
claude -p "总结 Kimi K3 蒸馏门对采购的影响"
8. 场景决策矩阵
| 场景 | 推荐路径 | 原因 |
|---|---|---|
| Claude Max 日常编码 | Claude Opus 5 默认 | CursorBench 与 Fable 5 峰值差 <0.5%,价格约一半 |
| 计算机操作 Agent | Claude Opus 5 | OSWorld 2.0 用约 1/3 Fable 5 成本超越其最佳成绩 |
| 合规敏感 / 不愿强制留存 | Claude Opus 5 | 默认无需接受 30 天数据留存协议 |
| 极限成本 + 长上下文 | Kimi K3 API(条件性) | $3/$15 与 1M 上下文,需法务放行蒸馏风险 |
| 7/27 后自部署 | Kimi K3 权重 | 2.8T 开源权重,需 64+ 卡集群而非笔记本 |
| 多模型 fallback | OpenRouter 统一路由 | 一个 Key 切换供应商,便于 A/B 与降级 |
9. 远程 Mac 桥接:多模型 Agent 评测环境
Opus 5 与 K3 同周落地,你的 Agent CI 却不能停:Claude Code 回归、Kimi Code API 探针、Greenblatt 式身份探测脚本,以及 OpenClaw 网关验收,都依赖合盖不休眠的宿主机。云 API 解决推理算力,却不解决「集成测试跑在哪」。
专用 Apple Silicon 远程 Mac 带来三点现实收益:7×24 夜间基准 sweep对比 Opus 5 与 K3;原生 macOS 工具链跑 Claude Code 与 SFTP/rsync 工作区同步,避免 WSL 摩擦;凭据隔离,蒸馏尽调日志与 API Key 不落在个人聊天设备上。
本地笔电同样扛不住 K3 的 7 月 27 日权重发布——你未必在 Mac mini 上微调 2.8T MoE,但一定需要稳定节点编排云 API 测试、经 git 推送 prompt 批次,并在采购签字前归档「K3 是否自称 Claude」的原始响应。
对普通开发者,更现实的建议是:先看场景,再看立场。合规与数据留存敏感选 Opus 5;极限成本与开源可控性等 7 月 27 日 K3 权重实测后再定。无论选哪条路由,SFTPMAC 远程 Mac 租赁提供常在线 Apple Silicon 节点与低延迟文件传输,让你在争议未落地前就把多模型 Agent 集成环境稳定跑通。
10. 常见问题 FAQ
Q:Claude Opus 5 比 Claude Fable 5 便宜多少?
A:相同 token 单价口径下 Opus 5 约为 Fable 5 一半($5/$25 vs 约 $10/$50),CursorBench 峰值相差不到 1%。
Q:Claude Opus 5 现在是 Claude Max 的默认模型吗?
A:是,2026 年 7 月 24 发布日起为 Claude Max 默认,也是 Claude Pro 最强版本。
Q:Kimi K3 是不是抄袭 Claude?
A:尚无最终证实。白宫指控缺公开证据;专家质疑 Fable 5 公开仅两周的时间线;Greenblatt「自称 Claude + 内部 ID」是目前最强技术间接证据。
Q:Kimi K3 开源权重什么时候放?
A:官方承诺 2026 年 7 月 27 日;本文发布时外部尚无法完全独立验证架构与跑分。
信源:Anthropic 官方发布 · Moonshot/Kimi 技术博客 · TechCrunch · Ryan Greenblatt GitHub · CNBC · The Verge