Kimi K3 오픈웨이트 Hugging Face 트렌드 1위 공개

Kimi K3 오픈웨이트 전면 공개: 2.8T·100만 컨텍스트·상업 라이선스 결정 가이드

7월 27일 밤, Moonshot AI(월지암면)가 Kimi K3 전체 모델 웨이트·기술 보고서를 공개하고 MoonEP·FlashKDA·AgentEnv 세 가지 핵심 인프라를 동시 오픈했습니다——API 첫 출시 후 11일 만입니다. Hugging Face 트렌드 1위를 30분 만에 기록한 1.56TB(MXFP4) 다운로드는 사실상 글로벌 최초 완전 공개 3T급 모델이지만, 공식은 일관되게 「open weight」를 쓰며 「오픈소스」와 구분합니다. 본 가이드는 라이선스 경계·KDA 아키텍처·API/자체 호스팅 트렌드와 실무 선택을 한 번에 정리합니다.

1. 3대 선택痛点: 오픈웨이트 착각·자체 호스팅 환상·실비용

  1. 「오픈웨이트」를 「오픈소스」로 오인: 국내외 매체는 「오픈소스」로 번역하지만 Moonshot 공식 자료는 open source를 쓰지 않습니다——웨이트·기술 보고서만 공개, 학습 데이터·전체 학습 코드 비공개. OSI 기준 법무 감사 시 라이선스 범위 오판 리스크.
  2. 자체 호스팅 하드웨어 과소평가: 2.8T 총 파라미터·104B 활성·896 MoE 전문가 규모로 K3는 소비자 GPU에서 사실상 불가. 공식 64카드 이상 슈퍼노드 권장, 웨이트 1.56TB. 「다운로드하면 돌아간다」 계획은 인프라에서 즉시 좌절.
  3. API 캐시가 실청구에 미치는 영향 간과: 표면 가격 입력 $3/M·출력 $15/M이지만 Mooncake 분리형 추론에서 코딩 부하 캐시 적중률 90%+, 실비용은 $0.30/M 근접——PoC 없이는 과대·과소 견적 모두 발생.

2. 타임라인: API 첫 출시→전면 오픈웨이트 11일

  • 7월 16일 밤(WAIC 2026 전야): Kimi K3 kimi.com·Kimi Work·Kimi Code·Kimi API 첫 출시, 온라인 호출만, 웨이트 미공개. 공식 기술 블로그 「Kimi K3: Open Frontier Intelligence」.
  • 7월 17일: 업계 아키텍처 집중 분석, 신화통신 「현재 글로벌 최대 파라미터 오픈소스 모델」 보도.
  • 7월 22–23일: 미중 「모델 증류」 분쟁 격화. 백악관 과학 고문 Michael Kratsios가 Anthropic Fable 대규모·은밀한 「산업 증류」 비난; 재무장관 Scott Bessent 제재·「엔티티 리스트」 검토 발표.
  • 7월 27일 23시: K3 전체 웨이트·기술 보고서 공식 공개, MoonEP·AgentEnv 오픈(FlashKDA는 기존 오픈). Hugging Face 30분 만 트렌드 1위.
  • 7월 28일: 중국 상무부 공개 응답, 미국 「AI 패권주의」 비난·보복 경고; 국내 매체 오픈소스 세부 추적.

3. Kimi K3 핵심 스펙(引用可)

항목 스펙
총 파라미터2.8조(2.8T)
활성 파라미터약 1040억(104B)
아키텍처혼합 전문가(MoE)
전문가 구성896 루팅 전문가, 토큰당 16 활성(공유 전문가 별도)
어텐션Kimi Delta Attention(KDA) + Gated MLA
컨텍스트100만 token(1M)
멀티모달네이티브 비전(ViT-V2, 27층)
웨이트 형식MXFP4 웨이트 + MXFP8 활성(SFT부터 QAT)
웨이트 용량약 1.56TB(Hugging Face, 96 safetensors 분할)
License커스텀 Kimi K3 License(open weight, 비 open source)

4. KDA·AttnRes·Per-Head Muon: 단순 스케일업이 아닌 재설계

Kimi K3는 어텐션·잔차 연결·옵티마이저 이 삼대 고정 컴포넌트를 재구성했습니다——파라미터 쌓기와는 다른 차별점입니다.

Kimi Delta Attention(KDA): 정밀한 「망각」

기존 Gated DeltaNet은 스칼라 망각 게이트——전체 기억이 동일 감쇠. KDA는 채널별 게이트로 각 특성 차원이 독립 감쇠율을 갖습니다. chunkwise DPLR로 선형 시간 재귀, 장시퀀스 KV Cache 비용 급감. K3는 KDA와 소수 글로벌 어텐션(Gated MLA)을 교차——100만 token 컨텍스트의 핵심.

Attention Residuals(AttnRes): 선택적 잔차 집약

기존 잔차는 층별 균등 가산, 깊은 층에서 초기 정보 희박화. AttnRes는 입력 기반 동적 집약——층당 RMSNorm·의사 쿼리 벡터 1개 추가로 약 25% 학습 효율 향상(비용 2% 미만).

Per-Head Muon: 헤드별 독립 최적화

Muon 옵티마이저를 어텐션 헤드별 독립 최적화로 확장. API 사용자에게는 보이지 않지만, 104B 활성으로 클로즈드 SOTA에 근접하는 성능의 누적 효과입니다.

Stable LatentMoE: 896→16 스파스 아트

896 루팅 전문가, 토큰당 16만 활성(스파스도 약 1.8%). Quantile Balancing + MoonEP로 노드별 중복 전문가 수 이론 상한 수학적 증명.

5. MoonEP·FlashKDA·AgentEnv: 웨이트만이 아닌 풀스택 공개

기술 포지션 핵심 역량
MoonEP 초대규모 세밀 MoE 고성능 통신 라이브러리 과부하 전문가 임시 복제·노드 균등 token; 중복 전문가 수 이론 상한 증명
FlashKDA NVIDIA CUTLASS 기반 KDA 연산자(기존 오픈) H20 prefill flash-linear-attention 대비 1.72–2.22배; chunk_kda 백엔드 무코드 변경 교체
AgentEnv KVCache.ai 공동 Agent 샌드박스(Firecracker microVM) 대규모 병렬 Agent RL; 공식값 checkpoint 133ms·복구 49ms·메모리 오버서브scribe 6.5배(독립 검증 미완)

6. 벤치 트렌드: SWE-bench 93.4%·AA Index 글로벌 3위

Vals AI 독립 재측정(2026년 7월) 우선引用:

모델 SWE-bench Verified 출시일
Claude Opus 597%2026-07-24
GPT-5.6 Sol96.2%2026-07-09
Claude Fable 595%2026-06-09
Kimi K393.4%2026-07-16
Qwen3.7-Max79.4%2026-05-19
DeepSeek-V476.2%2026-04-23

Artificial Analysis 지능 지수(max 추론档): Claude Fable 5 60·GPT-5.6 Sol 59·Kimi K3 약 57(글로벌 3위, 오픈웨이트 1위)·GLM-5.2 51·DeepSeek V4 Pro 44.

비용: K3 태스크당 $0.95——Claude Fable 5(약 $2.4) 대비 60% 절감, GLM-5.2(약 $0.47) 대비 높음. 오픈웨이트 진영 능력 천장, 가성비 최적 아님. Arena.ai Frontend Code Arena 현재 1위.

7. 오픈소스인가 오픈웨이트인가: $20M MaaS 이중 게이트

Moonshot 공식 자료는 「open source」를 한 번도 쓰지 않음——일관되게 「open weight」. OSI 진정 오픈소스는 학습 데이터·코드·재현 파이프라인 전부 공개가 필요, K3는 웨이트·기술 보고서·추론 Infra만.

라이선스도 「Modified MIT」가 아닌 완전 커스텀, K2에 없던 두 상업 게이트:

  1. Model-as-a-Service 매출 게이트: 「모델 즉서비스」사업 연속 12개월 누적 매출 2000만 달러 초과 시 Moonshot과 별도 상업 계약.
  2. 규모 표시 게이트: MAU 1억 또는 월매출 2000만 달러 초과 시 UI에 「Kimi K3」현저 표시.

대부분 스타트업·중소 팀은 두 게이트 무관. 「K3로 Moonshot과 경쟁 MaaS」 계획이면 첫 게이트가 법무 레드라인.

8. API $3/$15 vs 64카드 자체 호스팅

API: OpenAI SDK 호환 Chat Completions(https://api.moonshot.ai/v1, kimi-k3).

Token 유형 가격(백만 token)
입력(캐시 적중)$0.30
입력(캐시 미적중)$3.00
출력(추론 포함)$15.00

자체 호스팅: 공식 64카드 이상 슈퍼노드 권장. 개인·중소 팀은 OpenRouter 등 서드파티(약 7사 상선, 가격 대부분 공식 동일)가 현실적. 《Kimi K3 벤치 가이드》·《OpenRouter 통합 가이드》 참고.

9. 배경: 미중 AI 경쟁·WAIC 2026·3T 클럽

K3 공개는 WAIC 2026 창과 미중 「모델 증류」 분쟁이 겹친 시점. 웨이트 공개 직전 미측 「산업 증류」 비난·제재 압박; 중국 상무부 7월 28일 「AI 패권주의」 반격. Moonshot은 웨이트·기술 보고서·3 Infra 전면 공개로 기술 경로 독립성 자증. 3일 후 Alibaba(투자자) 24T Qwen3.8-Max-Preview——K3에 대한 직접 응답으로 해석, 국산 대모델 「3T 클럽」 진입.

10. 5단계 HowTo 실습

  1. Kimi K3 License 읽기: MaaS 연매출 2000만 달러·MAU 1억 게이트 해당 확인. 매체 「오픈소스」 번역을 법무 결론으로 쓰지 말 것.
  2. 연동 경로 선택: API(공식/OpenRouter) 99% 팀 적합. 자체 호스팅은 64카드 슈퍼노드 예산 기업만. 웨이트 다운로드는 연구·파인튜닝용, 노트북 비대상.
  3. OpenAI 호환 엔드포인트 설정: base URL https://api.moonshot.ai/v1, 모델 ID kimi-k3, OpenAI SDK·OpenClaw 설정 재사용.
  4. 자체 벤치 재검증: 실제 코딩/Agent 프롬프트에서 채택률·오류율·P95 지연 측정. 공개 SWE-bench 93.4%는 시장 신호, SLA 증명 아님.
  5. 상시 온라인 원격 Mac 게이트웨이: OpenClaw 등 Agent 파이프라인 7×24 macOS 노드 배치, openclaw channels status --probe 검수, SFTP/rsync로 설정·로그 동기화.

11. API vs 자체 호스팅 vs OpenRouter 결정 매트릭스

차원 공식 API OpenRouter 자체 호스팅
시작 비용 저(base URL 변경) 저(1 Key 멀티모델) 극고(64카드+1.56TB)
캐시 Mooncake 90%+ 업스트림 의존 자체 KV 구축
데이터 주권 Moonshot 클라우드 중계 1홉 완전 로컬(하드 충분 시)
적합 대상 K3 빠른 제품 통합 멀티모델·fallback 슈퍼컴 예산 연구기관

12. FAQ

Q: Kimi K3는 오픈소스인가? 엄밀히 아님. 오픈웨이트——웨이트·기술 보고서·일부 Infra 공개, 학습 데이터·전체 코드 비공개, OSI 정의 불충족.

Q: 무료 상업 이용 가능? 대부분 제한 없음. MaaS 연매출 2000만 달러 초과·MAU 1억/월매출 2000만 달러 초과 시 특정 조항.

Q: 자체 호스팅 GPU 몇 장? 64카드 이상 슈퍼노드. 개인·대부분 기업은 API·OpenRouter 현실적.

Q: 7월 17일 K3 벤치 글과 차이? 7월 16일 API 첫 출시; 7월 27일 전체 웨이트+MoonEP/AgentEnv 오픈. 본 글은 오픈웨이트 라이선스·Infra·자체 호스팅 문턱에 집중.

Q: 7월 25일 증류 논쟁과 관계? 증류 논쟁과 7월 27일 웨이트 공개 거의 동시 발화. 《Kimi K3 증류 논쟁 가이드》 병행 권장.

13. 결론: 오픈웨이트는 능력 천장, 원격 Mac이 7×24 Agent 브릿지

7월 27일 K3 공개는 「글로벌 최초 완전 공개 3T급」을 약속에서 1.56TB 다운로드 현실로 전환——KDA·AttnRes·MoonEP 공개로 오픈웨이트 진영이 SWE-bench·Artificial Analysis에서 클로즈드 최전선에 근접. 대부분 팀의 정답: API·OpenRouter로 K3 연결, 자체 벤치 검증——노트북 웨이트 다운로드 환상은 버림.

API 연결은 게이트웨이 간헐 오프라인·로컬 슬립·OpenClaw probe 실패 운영 문제를 해결 못 함. 자체 호스팅은 99% 비현실. K3를 OpenClaw/Hermes Agent 파이프라인에 7×24 코딩 보조로 넣으려면 게이트웨이·워크스페이스를 상시 온라인 Apple Silicon 원격 Mac에, launchd 상주·SFTP/rsync 동기화. SFTPMAC 원격 Mac는 Kimi K3 API·OpenRouter 멀티모델 7×24 노드——「가정용 PC 겸 API 게이트웨이」보다 Agent 파이프라인을 인프라로 다루는 팀에 적합.