Kimi K3 오픈웨이트 전면 공개: 2.8T·100만 컨텍스트·상업 라이선스 결정 가이드
7월 27일 밤, Moonshot AI(월지암면)가 Kimi K3 전체 모델 웨이트·기술 보고서를 공개하고 MoonEP·FlashKDA·AgentEnv 세 가지 핵심 인프라를 동시 오픈했습니다——API 첫 출시 후 11일 만입니다. Hugging Face 트렌드 1위를 30분 만에 기록한 1.56TB(MXFP4) 다운로드는 사실상 글로벌 최초 완전 공개 3T급 모델이지만, 공식은 일관되게 「open weight」를 쓰며 「오픈소스」와 구분합니다. 본 가이드는 라이선스 경계·KDA 아키텍처·API/자체 호스팅 트렌드와 실무 선택을 한 번에 정리합니다.
1. 3대 선택痛点: 오픈웨이트 착각·자체 호스팅 환상·실비용
- 「오픈웨이트」를 「오픈소스」로 오인: 국내외 매체는 「오픈소스」로 번역하지만 Moonshot 공식 자료는 open source를 쓰지 않습니다——웨이트·기술 보고서만 공개, 학습 데이터·전체 학습 코드 비공개. OSI 기준 법무 감사 시 라이선스 범위 오판 리스크.
- 자체 호스팅 하드웨어 과소평가: 2.8T 총 파라미터·104B 활성·896 MoE 전문가 규모로 K3는 소비자 GPU에서 사실상 불가. 공식 64카드 이상 슈퍼노드 권장, 웨이트 1.56TB. 「다운로드하면 돌아간다」 계획은 인프라에서 즉시 좌절.
- API 캐시가 실청구에 미치는 영향 간과: 표면 가격 입력 $3/M·출력 $15/M이지만 Mooncake 분리형 추론에서 코딩 부하 캐시 적중률 90%+, 실비용은 $0.30/M 근접——PoC 없이는 과대·과소 견적 모두 발생.
2. 타임라인: API 첫 출시→전면 오픈웨이트 11일
- 7월 16일 밤(WAIC 2026 전야): Kimi K3 kimi.com·Kimi Work·Kimi Code·Kimi API 첫 출시, 온라인 호출만, 웨이트 미공개. 공식 기술 블로그 「Kimi K3: Open Frontier Intelligence」.
- 7월 17일: 업계 아키텍처 집중 분석, 신화통신 「현재 글로벌 최대 파라미터 오픈소스 모델」 보도.
- 7월 22–23일: 미중 「모델 증류」 분쟁 격화. 백악관 과학 고문 Michael Kratsios가 Anthropic Fable 대규모·은밀한 「산업 증류」 비난; 재무장관 Scott Bessent 제재·「엔티티 리스트」 검토 발표.
- 7월 27일 23시: K3 전체 웨이트·기술 보고서 공식 공개, MoonEP·AgentEnv 오픈(FlashKDA는 기존 오픈). Hugging Face 30분 만 트렌드 1위.
- 7월 28일: 중국 상무부 공개 응답, 미국 「AI 패권주의」 비난·보복 경고; 국내 매체 오픈소스 세부 추적.
3. Kimi K3 핵심 스펙(引用可)
| 항목 | 스펙 |
|---|---|
| 총 파라미터 | 2.8조(2.8T) |
| 활성 파라미터 | 약 1040억(104B) |
| 아키텍처 | 혼합 전문가(MoE) |
| 전문가 구성 | 896 루팅 전문가, 토큰당 16 활성(공유 전문가 별도) |
| 어텐션 | Kimi Delta Attention(KDA) + Gated MLA |
| 컨텍스트 | 100만 token(1M) |
| 멀티모달 | 네이티브 비전(ViT-V2, 27층) |
| 웨이트 형식 | MXFP4 웨이트 + MXFP8 활성(SFT부터 QAT) |
| 웨이트 용량 | 약 1.56TB(Hugging Face, 96 safetensors 분할) |
| License | 커스텀 Kimi K3 License(open weight, 비 open source) |
4. KDA·AttnRes·Per-Head Muon: 단순 스케일업이 아닌 재설계
Kimi K3는 어텐션·잔차 연결·옵티마이저 이 삼대 고정 컴포넌트를 재구성했습니다——파라미터 쌓기와는 다른 차별점입니다.
Kimi Delta Attention(KDA): 정밀한 「망각」
기존 Gated DeltaNet은 스칼라 망각 게이트——전체 기억이 동일 감쇠. KDA는 채널별 게이트로 각 특성 차원이 독립 감쇠율을 갖습니다. chunkwise DPLR로 선형 시간 재귀, 장시퀀스 KV Cache 비용 급감. K3는 KDA와 소수 글로벌 어텐션(Gated MLA)을 교차——100만 token 컨텍스트의 핵심.
Attention Residuals(AttnRes): 선택적 잔차 집약
기존 잔차는 층별 균등 가산, 깊은 층에서 초기 정보 희박화. AttnRes는 입력 기반 동적 집약——층당 RMSNorm·의사 쿼리 벡터 1개 추가로 약 25% 학습 효율 향상(비용 2% 미만).
Per-Head Muon: 헤드별 독립 최적화
Muon 옵티마이저를 어텐션 헤드별 독립 최적화로 확장. API 사용자에게는 보이지 않지만, 104B 활성으로 클로즈드 SOTA에 근접하는 성능의 누적 효과입니다.
Stable LatentMoE: 896→16 스파스 아트
896 루팅 전문가, 토큰당 16만 활성(스파스도 약 1.8%). Quantile Balancing + MoonEP로 노드별 중복 전문가 수 이론 상한 수학적 증명.
5. MoonEP·FlashKDA·AgentEnv: 웨이트만이 아닌 풀스택 공개
| 기술 | 포지션 | 핵심 역량 |
|---|---|---|
| MoonEP | 초대규모 세밀 MoE 고성능 통신 라이브러리 | 과부하 전문가 임시 복제·노드 균등 token; 중복 전문가 수 이론 상한 증명 |
| FlashKDA | NVIDIA CUTLASS 기반 KDA 연산자(기존 오픈) | H20 prefill flash-linear-attention 대비 1.72–2.22배; chunk_kda 백엔드 무코드 변경 교체 |
| AgentEnv | KVCache.ai 공동 Agent 샌드박스(Firecracker microVM) | 대규모 병렬 Agent RL; 공식값 checkpoint 133ms·복구 49ms·메모리 오버서브scribe 6.5배(독립 검증 미완) |
6. 벤치 트렌드: SWE-bench 93.4%·AA Index 글로벌 3위
Vals AI 독립 재측정(2026년 7월) 우선引用:
| 모델 | SWE-bench Verified | 출시일 |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| Qwen3.7-Max | 79.4% | 2026-05-19 |
| DeepSeek-V4 | 76.2% | 2026-04-23 |
Artificial Analysis 지능 지수(max 추론档): Claude Fable 5 60·GPT-5.6 Sol 59·Kimi K3 약 57(글로벌 3위, 오픈웨이트 1위)·GLM-5.2 51·DeepSeek V4 Pro 44.
비용: K3 태스크당 $0.95——Claude Fable 5(약 $2.4) 대비 60% 절감, GLM-5.2(약 $0.47) 대비 높음. 오픈웨이트 진영 능력 천장, 가성비 최적 아님. Arena.ai Frontend Code Arena 현재 1위.
7. 오픈소스인가 오픈웨이트인가: $20M MaaS 이중 게이트
Moonshot 공식 자료는 「open source」를 한 번도 쓰지 않음——일관되게 「open weight」. OSI 진정 오픈소스는 학습 데이터·코드·재현 파이프라인 전부 공개가 필요, K3는 웨이트·기술 보고서·추론 Infra만.
라이선스도 「Modified MIT」가 아닌 완전 커스텀, K2에 없던 두 상업 게이트:
- Model-as-a-Service 매출 게이트: 「모델 즉서비스」사업 연속 12개월 누적 매출 2000만 달러 초과 시 Moonshot과 별도 상업 계약.
- 규모 표시 게이트: MAU 1억 또는 월매출 2000만 달러 초과 시 UI에 「Kimi K3」현저 표시.
대부분 스타트업·중소 팀은 두 게이트 무관. 「K3로 Moonshot과 경쟁 MaaS」 계획이면 첫 게이트가 법무 레드라인.
8. API $3/$15 vs 64카드 자체 호스팅
API: OpenAI SDK 호환 Chat Completions(https://api.moonshot.ai/v1, kimi-k3).
| Token 유형 | 가격(백만 token) |
|---|---|
| 입력(캐시 적중) | $0.30 |
| 입력(캐시 미적중) | $3.00 |
| 출력(추론 포함) | $15.00 |
자체 호스팅: 공식 64카드 이상 슈퍼노드 권장. 개인·중소 팀은 OpenRouter 등 서드파티(약 7사 상선, 가격 대부분 공식 동일)가 현실적. 《Kimi K3 벤치 가이드》·《OpenRouter 통합 가이드》 참고.
9. 배경: 미중 AI 경쟁·WAIC 2026·3T 클럽
K3 공개는 WAIC 2026 창과 미중 「모델 증류」 분쟁이 겹친 시점. 웨이트 공개 직전 미측 「산업 증류」 비난·제재 압박; 중국 상무부 7월 28일 「AI 패권주의」 반격. Moonshot은 웨이트·기술 보고서·3 Infra 전면 공개로 기술 경로 독립성 자증. 3일 후 Alibaba(투자자) 24T Qwen3.8-Max-Preview——K3에 대한 직접 응답으로 해석, 국산 대모델 「3T 클럽」 진입.
10. 5단계 HowTo 실습
- Kimi K3 License 읽기: MaaS 연매출 2000만 달러·MAU 1억 게이트 해당 확인. 매체 「오픈소스」 번역을 법무 결론으로 쓰지 말 것.
- 연동 경로 선택: API(공식/OpenRouter) 99% 팀 적합. 자체 호스팅은 64카드 슈퍼노드 예산 기업만. 웨이트 다운로드는 연구·파인튜닝용, 노트북 비대상.
- OpenAI 호환 엔드포인트 설정: base URL
https://api.moonshot.ai/v1, 모델 IDkimi-k3, OpenAI SDK·OpenClaw 설정 재사용. - 자체 벤치 재검증: 실제 코딩/Agent 프롬프트에서 채택률·오류율·P95 지연 측정. 공개 SWE-bench 93.4%는 시장 신호, SLA 증명 아님.
- 상시 온라인 원격 Mac 게이트웨이: OpenClaw 등 Agent 파이프라인 7×24 macOS 노드 배치,
openclaw channels status --probe검수, SFTP/rsync로 설정·로그 동기화.
11. API vs 자체 호스팅 vs OpenRouter 결정 매트릭스
| 차원 | 공식 API | OpenRouter | 자체 호스팅 |
|---|---|---|---|
| 시작 비용 | 저(base URL 변경) | 저(1 Key 멀티모델) | 극고(64카드+1.56TB) |
| 캐시 | Mooncake 90%+ | 업스트림 의존 | 자체 KV 구축 |
| 데이터 주권 | Moonshot 클라우드 | 중계 1홉 | 완전 로컬(하드 충분 시) |
| 적합 대상 | K3 빠른 제품 통합 | 멀티모델·fallback | 슈퍼컴 예산 연구기관 |
12. FAQ
Q: Kimi K3는 오픈소스인가? 엄밀히 아님. 오픈웨이트——웨이트·기술 보고서·일부 Infra 공개, 학습 데이터·전체 코드 비공개, OSI 정의 불충족.
Q: 무료 상업 이용 가능? 대부분 제한 없음. MaaS 연매출 2000만 달러 초과·MAU 1억/월매출 2000만 달러 초과 시 특정 조항.
Q: 자체 호스팅 GPU 몇 장? 64카드 이상 슈퍼노드. 개인·대부분 기업은 API·OpenRouter 현실적.
Q: 7월 17일 K3 벤치 글과 차이? 7월 16일 API 첫 출시; 7월 27일 전체 웨이트+MoonEP/AgentEnv 오픈. 본 글은 오픈웨이트 라이선스·Infra·자체 호스팅 문턱에 집중.
Q: 7월 25일 증류 논쟁과 관계? 증류 논쟁과 7월 27일 웨이트 공개 거의 동시 발화. 《Kimi K3 증류 논쟁 가이드》 병행 권장.
13. 결론: 오픈웨이트는 능력 천장, 원격 Mac이 7×24 Agent 브릿지
7월 27일 K3 공개는 「글로벌 최초 완전 공개 3T급」을 약속에서 1.56TB 다운로드 현실로 전환——KDA·AttnRes·MoonEP 공개로 오픈웨이트 진영이 SWE-bench·Artificial Analysis에서 클로즈드 최전선에 근접. 대부분 팀의 정답: API·OpenRouter로 K3 연결, 자체 벤치 검증——노트북 웨이트 다운로드 환상은 버림.
API 연결은 게이트웨이 간헐 오프라인·로컬 슬립·OpenClaw probe 실패 운영 문제를 해결 못 함. 자체 호스팅은 99% 비현실. K3를 OpenClaw/Hermes Agent 파이프라인에 7×24 코딩 보조로 넣으려면 게이트웨이·워크스페이스를 상시 온라인 Apple Silicon 원격 Mac에, launchd 상주·SFTP/rsync 동기화. SFTPMAC 원격 Mac는 Kimi K3 API·OpenRouter 멀티모델 7×24 노드——「가정용 PC 겸 API 게이트웨이」보다 Agent 파이프라인을 인프라로 다루는 팀에 적합.