DeepSeek V4 GA 정식 출시: MoE 아키텍처, 1M 컨텍스트와 피크·오프피크 요금 개념도

2026 DeepSeek V4 GA 정식 출시: 가격·아키텍처·GPT-5.6 비교 의사결정 가이드

3개월의 대기 끝에 DeepSeek V4 정식판(GA)이 2026년 7월 20일 공식 출시되었습니다. 4월 프리뷰 대비 Agent·수학 추론·코드 생성이 집중 강화되었고, 최초의 피크·오프피크 요금이 도입되었습니다. DeepSeek은 「거의 무료」에서 규율 있는 상용 운영으로 전환했음을 보여줍니다. 본문은 공식 문서·기술 보고서를 바탕으로 타임라인, 아키텍처, 벤치마크, GPT-5.6 / Claude Fable 5 비교, 피크·오프피크 가격, 7월 24일 API 마이그레이션을 한 페이지에 압축 정리합니다.

1. 선정 3대 페인포인트: GA 변화, 요금 복잡도, 마이그레이션 긴급성

  1. 프리뷰 ≠ 프로덕션 최종형: 4월 아키텍처는 이미 강력했지만, GA는 Agent 오케스트레이션·수학·코드에 집중 튜닝이 들어갔습니다. 구 모델명 deepseek-chat / deepseek-reasoner7월 24일 23:59(베이징 시간)에 영구 중단되므로, 마이그레이션을 미루면 의도적 장애를 자초합니다.
  2. 피크·오프피크 요금이 운영 복잡도를 높임: 평일 09:00–12:00, 14:00–18:00(베이징 시간) 요금 2배. 배치 추론·코드 리뷰·데이터 어노테이션을 오프피크로 돌리지 않으면 청구가 예상 밖으로 2배가 될 수 있습니다.
  3. 「오픈소스 최강」≠「폐쇄형 최강」: V4-Pro는 SWE-bench Verified 80.6% 오픈소스 기록이지만, Claude Fable 5는 Verified(96.0%)·Pro(80.3%)에서 여전히 리드. 선정은 단일 랭킹이 아니라 「능력 ÷ 가격」으로 봐야 합니다.

2. 타임라인: 프리뷰에서 정식판까지

일자 이벤트
2026-04-24 V4 프리뷰 출시·오픈소스(MIT), V4-Pro(1.6T)와 V4-Flash(284B) 포함
2026-05 V4-Flash·V4-Pro 프로덕션 튜닝 버전 출시, API 정식 이용 가능
2026-06 V4-Pro 가격 영구 75% 인하(출력 $0.87/M tokens), 역대 최고 가성비 구간 확정
2026-06-29 DeepSeek이 전체 API 사용자에 이메일: 7월 중순 GA 예정, 최초 피크·오프피크 요금안 공개
2026-07-19 다수 개발자 GA 그레이 내부 테스트 자격 획득, 언론 「정식판 내일 출시」 보도
2026-07-20 GA 정식판 출시(본문 게시일)
2026-07-24 구 인터페이스명 deepseek-chat·deepseek-reasoner 영구 중단

한 줄 요약: V4 프리뷰는 이미 강력했고, 정식판은 Agent·수학 추론·코드 생성을 집중 강화하며 공식 상용 요금 체계를 갖췄습니다.

3. 기술 아키텍처 심층 분석: 100만 토큰 컨텍스트를 지탱하는 이유

3.1 모델 패밀리 사양 일람

사양 V4-Pro V4-Flash
총 파라미터 1.6조(1.6T) 2840억(284B)
토큰당 활성화 파라미터 490억(49B) 130억(13B)
Transformer 레이어 61층 43층
컨텍스트 윈도우 1,000,000 tokens 1,000,000 tokens
최대 출력 384K tokens 384K tokens
정밀도 FP4(전문가 가중치) + FP8(기타) FP4 + FP8 혼합
사전학습 데이터량 33T+ tokens 32T+ tokens
오픈소스 라이선스 MIT MIT

3.2 하이브리드 어텐션(CSA + HCA)

DeepSeek V4는 V2/V3 시대 MLA(다중 잠재 어텐션)를 폐기하고 두 가지 신규 어텐션 메커니즘의 하이브리드를 채택했습니다.

  • 압축 희소 어텐션(CSA): KV 시퀀스를 Softmax 게이트 풀링으로 4배 압축한 뒤 FP4 정밀도 「라이트닝 인덱서」로 top-k 희소 선택(V4-Pro top-1024, V4-Flash top-512). 최근 128 토큰 슬라이딩 윈도우도 유지. 1M 컨텍스트에서 V3.2 대비 27% 추론 FLOPs만 필요합니다.
  • 고밀도 압축 어텐션(HCA): 토큰을 128배 압축 후 글로벌 밀집 어텐션으로 장거리 의존성 포착. CSA와 상호 보완. V4-Flash는 처음 2층 HCA, 이후 CSA/HCA 교차; V4-Pro도 유사 구조입니다.

종합 효과: 1M 토큰 시나리오에서 KV Cache 메모리는 V3.2의 10%(V4-Flash 7%)로 줄어, 동일 하드웨어로 더 긴 컨텍스트를 처리해 비용이 크게 낮아집니다.

3.3 다양체 제약 하이퍼커넥션(mHC)과 Muon 옵티마이저

mHC는 기존 잔차 연결을 확장: 4채널 잔차 스트림을 도입하고, 이중확률 행렬 제약(Birkhoff 다면체)을 만족하는 혼합 행렬로 61층 깊은 네트워크에서도 신호가 안정 전파됩니다.

Muon 옵티마이저(표준 AdamW 대체)는 뉴턴–슐츠 직교화로 기울기를 처리해 더 근거 있는 스텝 크기로 수렴을 빠르게 하고 학습을 안정화합니다.

3.4 세 가지 추론 모드와 공식 샘플링 파라미터

모드 특징 적용 시나리오
Non-think 사고 체인 없음, 초고속 응답 간단 Q&A, 라우팅 분기
Think High 명시적 추론(<redacted_thinking> 태그) 중간 복잡도 작업, 코드 디버깅
Think Max 최대 추론 강도, 384K+ 컨텍스트 필요 복잡 수학, 장체인 Agent

공식 권장 샘플링 파라미터(전 모드 공통): temperature=1.0, top_p=1.0

4. 벤치마크: 오픈소스 1위의 성적표

4.1 V4-Pro 핵심 평가 데이터

벤치마크 DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified 80.6%(오픈소스 최고) 96.0% 별도 미공개 ~69%
SWE-bench Pro 55.4% 80.3% 78.1% 69.2%
LiveCodeBench (Pass@1) 93.5% 88.1% 87.4% 83.2%
Codeforces Elo 3,206
Terminal-Bench 2.1 83.9% 88.0% 85.1% 82.7%

SWE-bench Verified는 「실제 GitHub 저장소 버그 수정」을 측정합니다. 80.6%는 현재 오픈소스 모델 최고로 Gemini 3.1 Pro와 동률입니다. SWE-bench Pro는 더 엄격하며 Claude Fable 5의 80.3%가 현재 리드합니다.

4.2 가성비 횡단 비교(Artificial Analysis)

  • Claude Fable 5: Strategy & Ops 지수 작업당 $3.48, 점수 50
  • DeepSeek V4-Pro: 동종 작업당 $0.03, 점수 38
  • DeepSeek V4-Flash: 6류 지수 작업 모두 1회당 $0.04 미만

Fable 5 비용은 V4-Pro의 116배인데 점수는 약 12점(31%)만 높습니다. 대부분 프로덕션 시나리오에서 V4-Pro 가성비가 압도적입니다.

5. GPT-5.6 / Claude Fable 5 전면 비교

차원 DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
오픈소스 MIT, 셀프호스팅 가능 폐쇄형 폐쇄형
컨텍스트 윈도우 1M tokens 미공개 1M tokens
코드 능력 매우 강함(Fable 5에 근접) 매우 강함 최강
API 출력 단가(평시) $0.87/M tokens ~$15/M $50/M
피크 출력 단가 $1.74/M tokens
Agent 능력 강함, 멀티 Agent 오케스트레이션 지원 강함 최강
데이터 프라이버시 프라이빗 배포 가능 클라우드 클라우드

시나리오별 선정 가이드:

  • 예산 제약 / 고빈도 호출 / 프라이빗 배포: V4-Pro 또는 V4-Flash 1순위
  • 극한 코드 능력, 비용 무관: Claude Fable 5(SWE-bench Pro 최고 점수)
  • 복잡 알고리즘 + 수학 추론: GPT-5.6 Sol / Ultra
  • 초대규모 로그·문서 처리(저비용): V4-Flash(캐시 적중 입력 $0.0028/M)

6. 피크·오프피크 요금 상세: 어떻게 절약할까

GA판에서 가장 주목받은 변화는 DeepSeek이 최초로 피크·오프피크 차등 요금을 도입한 것입니다. 전력 시간대별 요금과 유사합니다. 피크 시간대(베이징 시간): 평일 09:00–12:00과 14:00–18:00에 요금 2배.

모델 과금 항목 평시(Off-Peak) 피크(Peak)
V4-Pro 입력(캐시 적중) ¥0.025 / $0.0035 / 1M 2배
V4-Pro 입력(캐시 미적중) ¥3.00 / $0.435 / 1M ¥6.00 / $0.87 / 1M
V4-Pro 출력 ¥6.00 / $0.87 / 1M ¥12.00 / $1.74 / 1M
V4-Flash 입력(캐시 적중) ¥0.02 / $0.0028 / 1M 2배
V4-Flash 입력(캐시 미적중) ¥1.00 / $0.14 / 1M ¥2.00 / $0.28 / 1M
V4-Flash 출력 ¥2.00 / $0.28 / 1M ¥4.00 / $0.56 / 1M

네 가지 절약 전략:

  1. 비실시간 작업을 오프피크로: 배치 문서 처리, 데이터 어노테이션, 코드 리뷰는 18:00 이후 또는 09:00 이전에 배치.
  2. 캐시 적중 활용: 반복 System Prompt로 Prompt Cache 구축. V4-Flash 캐시 적중 비용 $0.0028/M으로 거의 무료 수준.
  3. Flash로 분기: 간단한 의도 인식·라우팅 판단은 V4-Flash, 복잡 추론은 V4-Pro로 에스컬레이션.
  4. 청구 알림 이메일 주시: DeepSeek은 요금 변경 24시간 전 이메일 통지를 약속합니다.

피크 시에도 V4-Pro 출력($1.74/M)은 Claude Opus 4.8($15/M)보다 8.6배 저렴하고 GPT-5.6 Sol(약 $15/M)과 비슷한 배수 차이입니다.

7. 개발자 필독: API 마이그레이션 가이드 (7월 24일 마감)

중요 경고: 구 모델명 deepseek-chat·deepseek-reasoner2026년 7월 24일 15:59 UTC(베이징 시간 7월 24일 23:59)에 영구 접근이 중단됩니다.

구 모델명 신 모델명 비고
deepseek-chat deepseek-v4-flash(비사고 모드) 고속, 경량 작업용
deepseek-reasoner deepseek-v4-flash(사고 모드) 또는 deepseek-v4-pro로 업그레이드해 더 강한 추론 확보

7.1 5단계 마이그레이션 실습

  1. 전체 검색: 코드, CI, 환경 변수에서 deepseek-chat·deepseek-reasoner 검색.
  2. 시나리오별 매핑: 경량 대화 → deepseek-v4-flash; 구 reasoner → flash 사고 모드 또는 deepseek-v4-pro.
  3. OpenAI SDK 업데이트: model 파라미터만 변경; 사고 모드는 extra_body 추가 가능.
  4. 피크·오프피크 스케줄 설정: cron으로 배치를 오프피크에 배치하고 System Prompt를 고정해 캐시 적중률 향상.
  5. 스테이징 인수: 7월 24일 전 staging 통과, 구 모델명 잔존 없음 확인.

7.2 Python 코드 예시(OpenAI SDK)

# 구写法 (7월 24일 이후 무효)
client.chat.completions.create(
    model="deepseek-chat",
    messages=[...]
)

# 신写法
client.chat.completions.create(
    model="deepseek-v4-pro",          # 또는 deepseek-v4-flash
    messages=[...],
    # 사고 모드 제어:
    # extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

7.3 Anthropic SDK 호환 작성법

V4는 OpenAI ChatCompletions와 Anthropic Messages 형식을 모두 지원합니다. base_url은 그대로 두고 model만 업데이트하세요.

client = anthropic.Anthropic(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com"
)
message = client.messages.create(
    model="deepseek-v4-pro",
    max_tokens=4096,
    messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)

8. 자주 묻는 질문

Q: 정식판이 기대할 만한가요?
가치는 지금 당장 Claude Fable 5나 GPT-5.6을 이기는 것이 아니라, 폐쇄형 플래그십의 1/10~1/100 비용으로 오픈소스 모델 중 최강 성능을 제공한다는 점에 있습니다.

Q: 피크·오프피크 요금은 후퇴인가요?
비용 설계가 복잡해지지만 오프피크 요금은 여전히 매우 경쟁력 있습니다. 「가격 파괴」에서 「규칙 있는 상용 플랫폼」으로의 성숙 신호로 봐야 합니다.

Q: 아직 deepseek-chat을 쓰고 있다면?
7월 24일 전에 마이그레이션을 완료하세요. 그렇지 않으면 서비스가 중단됩니다.

9. 결론: GA는 2026 오픈소스 대모델의 가장 중요한 이정표 중 하나

DeepSeek V4 GA 정식판은 데이터 해외 반출을 원치 않는 기업, 예산 제약이 있는 개인 개발자, 1M 토큰 컨텍스트가 필요한 Agent 엔지니어, 극한 가성비를 추구하는 AI 제품 팀에게 V4-Pro는 현재 거의 빈틈없는 선택입니다.

로컬이나 VPS에서 V4 가중치로 Agent 연동 테스트를 할 때 Windows/Linux 교차 환경은 Apple 생태계의 Xcode·Metal·통합 메모리 이점을 누리기 어렵고, 노트북 뚜껑을 닫으면 연결이 끊기며 7×24 cron 배치 추론·SFTP/rsync 워크스페이스 동기화도 어렵습니다. 상시 온라인 Apple Silicon 원격 Mac은 피크·오프피크 스케줄, cron 배치와 로컬 추론 평가를 안정 운영하기에 적합합니다. SFTPMAC 원격 Mac 임대는 네이티브 macOS 노드와 저지연 파일 전송을 제공해 7월 24일 마이그레이션 윈도우 안에 API 전환과 Agent 파이프라인 인수를 한 번에 마칠 수 있습니다.

출처: DeepSeek 공식 문서 · arXiv:2606.19348 · HuggingFace 모델 페이지 · LLMReference · Artificial Analysis · MangoMind Blog