상태 LED가 켜진 서버 랙 — 피크 시간대 LLM 요금 뒤에 있는 연산 용량

2026 DeepSeek 최대 1,100% 인상: Qwen 2.4T 개방·GLM-5.3, 피크 라우팅 의사결정

닷새 사이 중국 3대 랩이 서로 다른 방향으로 움직였다. DeepSeek는 일부 티어를 최대 1,100% 올렸고, 같은 주 Alibaba는 한 번도 풀지 않았던 2.4조 파라미터 플래그십을 오픈웨이트로 풀었으며, Zhipu는 GLM-5.3에서 베이스를 다시 학습하지 않고 코딩 벤치를 약 6배 끌어올렸다. 세 수는 「누가 더 싼가」가 아니라 「누가 가격 결정권을 쥐는가」로 전장이 이동했음을 보여 준다.

1. 세 가지 판단 실패: 헤드라인·최저가 가정·절전 노트북

  1. 「11배」「1,100%」「350%」를 같은 인상으로 묶는 것: 세 숫자 모두 맞지만 가리키는 청구 라인이 다르다 — 캐시적중 입력, 출력, 캐시미스 입력. 섞으면 인보이스 규모가 한 자릿수 틀린다.
  2. 공식 DeepSeek API가 언제나 최저가라고 가정하는 것: 피크 시간에는 DeepSeek 공식 정가가 일부 리셀러(GMI Cloud, Novita 등, 현재 V4 Pro를 신규 공식 피크보다 낮게 게시)보다 높다. 「중국 모델 = 최저가」는 더 이상 안전한 기본값이 아니다.
  3. 피크에 민감한 에이전트 평가를 절전하는 노트북에서 돌리는 것: 공식 공지는 더 유연한 워크로드 스케줄링을 명시적으로 요구한다. 베이징 오프피크에 덮개를 닫으면, 비싼 시간을 실수로 사는 셈이다.

2. 2026년 8월 중국 오픈웨이트 타임라인

날짜 사건
2026년 7월 16일 Moonshot AI, Kimi K3(2.8T 파라미터) 오픈웨이트 — 미국 안보 당국 주시
2026년 8월 2–3일 Alibaba, Qwen3.8-Max를 프리뷰한 뒤 호스티드 API로 출시
2026년 8월 10일 Meta, Muse Glimmer(30B, Apache 2.0) 공개, 플래그십 Muse Spark 1.2 오픈웨이트 예고
2026년 8월 12일 Alibaba, Qwen3.8-2.4T-A95B 오픈웨이트를 Hugging Face/ModelScope에 게시; xAI, Grok 4.6 출시
2026년 8월 13일 DeepSeek-V4-Pro GA, 8월 17일 발효 인상 발표; Google, 할인 Gemini 3.7 Flash 출시
2026년 8월 14일 Zhipu, GLM-5.3 출시 — GLM-5.2의 743B 베이스 재사용
2026년 8월 17일 00:00 베이징 시간 DeepSeek 신규 요금 발효

한 달 더 넓히면 그림이 선명해진다. 7월 30일 OpenAI는 최저 티어(GPT-5.6 Luna, 80% 인하)를 깎았고, 8월 6–7일에는 Luna를 무제한 텍스트 채팅의 무료 기본값으로 올렸다. 중국 랩이 가격을 올리고 플래그십 가중치를 푸는 바로 그 순간, 미국 랩은 소비자 층에서 깎고 무료로 갔다. 우연이 아니라 같은 가격 전쟁의 양면이다. 제품 단위 선행 정리: Qwen3.8-Max 출시, V4-Flash 공식 벤치, GPT-5.6 Luna 80% 인하.

3. DeepSeek·Qwen·GLM-5.3, 실제로 바뀐 숫자

DeepSeek 인상, 티어별 (2026년 8월 17일 00:00 베이징 시간 발효; 피크는 베이징 시간 오전 9시–12시, 오후 2시–6시)

청구 항목 (100만 토큰당) 기존 신규 오프피크 신규 피크 피크 증가
V4-Flash 캐시적중 (입력) ¥0.02 ¥0.05 ¥0.10 ~400%
V4-Flash 캐시미스 (입력) ¥1.0 ¥1.5 ¥3.0 200%
V4-Flash 출력 ¥2.0 ¥4.5 ¥9.0 350%
V4-Pro 캐시적중 (입력) ¥0.025 ¥0.15 ¥0.30 ~1,100%
V4-Pro 캐시미스 (입력) ¥3.0 ¥4.5 ¥9.0 200%
V4-Pro 출력 ¥6.0 ¥13.5 ¥27.0 350%

모두가 인용한 「1,100%」는 피크 시간 캐시적중 입력 — 원래 공짜에 가장 가깝던 티어 — 에만 해당한다. 실제 청구를 지배하는 출력은 350% 올랐다. 제3자 분석의 독립 비용 모델링은, 현실적인 헤비 워크로드(대략 월 8,400만 토큰, 대부분 오프피크, 절반 캐시적중)에서 청구 증가가 약 1.8배에 가깝다고 본다. 체감은 있으나, 가장 자극적인 헤드라인보다는 훨씬 낮다.

Qwen3.8-2.4T-A95B (Qwen3.8-Max 오픈웨이트): 핵심 스펙

항목 내용
파라미터 총 2.4T, 토큰당 활성 95B (MoE, 전문가 512, 라우팅 10 + 공유 1)
컨텍스트 창 오픈 체크포인트 네이티브 262,144 토큰, ~1.01M까지 확장; 호스티드 Max 기본 1M
출시 리듬 8월 2일 프리뷰 → 8월 3일 API 가동 → 8월 12일 오픈웨이트
API 가격 (국제) 입력 $2/M, 출력 $6/M
라이선스 Apache 2.0 아님 — 커스텀 「Qwen3.8-Max License」
왜 중요한가 Alibaba가 Max급(플래그십)을 오픈웨이트로 푼 최초; Qwen3.5/3.6/3.7 Max는 API 전용으로 남았다

GLM-5.3 vs GLM-5.2: 동일 베이스, 후훈련만

벤치마크 GLM-5.2 GLM-5.3 변화
Terminal-Bench 3.0 4.6% 28.3% +23.7 pts
DeepSWE v1.1 46.2% 66.9% +20.7 pts
Agents' Last Exam (CLI) 23.8% 28.5% +4.7 pts
CyberGym 77.2% 84.5% +7.3 pts
AutomationBench 26.2% 48.2% +22.0 pts

Zhipu 자체 공시 수치이며, 제3자 독립 재실행은 아직 없다. GLM-5.3은 Terminal-Bench 3.0에서 여전히 GPT-5.6 Sol(34.6%)과 Claude Fable 5(33.7%)에 뒤진다. 오픈웨이트 상위권이지, 프론티어 단독 승리는 아니다.

4. 세 랩 전략: 피크 요금·커스텀 라이선스·후훈련

DeepSeek: 정액에서 시간대 요금으로 — 전략 선회가 아니라 용량 문제

가장 흔한 오독은 「중국 최저가가 마진 압박에 굴복했다」는 한 줄이다. 요금표 구조를 보면 반대에 가깝다. 연산 제약을 가격표에 처음으로 드러낸 회사에 가깝다. 예전처럼 언제나 싼 정액은, GPU 용량이 수요를 따라잡는 동안 고객 획득 도구로 작동했다. 사용량이 지수적으로 늘고 용량이 따라가지 못하면 뭔가는 명시적이 되어야 한다. 공식 공지의 「더 유연한 워크로드 스케줄링 장려」는 기업 언어로 「피크 시간 연산이 이제 희소하니, 부하를 직접 옮겨 달라」는 뜻이다.

해외 보도가 거의 놓친 한 줄: 피크 시간에는 DeepSeek 공식 API 가격이 여러 제3자 리셀러(GMI Cloud, Novita 등, 현재 V4 Pro를 DeepSeek 신규 피크보다 낮게 게시)보다 높다. 「공식 API가 DeepSeek를 돌리는 언제나 가장 싼 길」이라는 평판의 핵심이 처음으로 깨졌다.

Alibaba: 오픈웨이트로 생태계 호의를 사고, 커스텀 라이선스로 매출 천장을 지킨다

Qwen3.8-Max 오픈웨이트는 단순한 시혜가 아니다. Alibaba는 동시에 두 가지를 했다. 2.4T 파라미터 체크포인트 전체를 무료 다운로드로 풀었고, 작은 Qwen에 쓰던 관대한 Apache 2.0이 아닌 커스텀 라이선스를 붙였다. 연속 12개월 매출 5,000만 달러를 넘는 「Model-as-a-Service」 또는 「AI Work Assistant」 사업은 별도 상업 라이선스를 협상해야 하고, 월간 활성 1억 명 이상 또는 월 매출 2,000만 달러 이상 제품은 모델명을 눈에 띄게 표시해야 한다.

논리: 가중치를 풀어 개발자 마인드셰어를 가져가되(특히 「중국산 모델」을 엔터프라이즈 구매자가 아직 주저하는 해외), 그 위에 경쟁 추론 사업을 실제로 세울 수 있는 소수에게는 가격 레버리지를 남긴다. Meta Muse Glimmer가 제한 없는 Apache 2.0으로 나가는 것과는 다른 베팅이다. 「오픈웨이트」가 두 공개에서 같은 뜻이 아니다.

죽일 가치가 있는 루머 하나: Alibaba 라이선스가 미국·EU·영국·한국 다운로드를 금지한다는 주장이 온라인에 돌았다. 거짓이다. 공개 라이선스 본문에 지리적·영토 조항은 없다. 공개 주기가 이처럼 빠를 때, 1차 자료(공지 스레드가 아니라 LICENSE 파일)를 확인하는 데 몇 초면 충분하고, 이미 깨진 주장을 반복하지 않게 해 준다.

GLM-5.3: 새 베이스가 아니라 더 큰 후훈련 베팅 — 그게 본편이다

GLM-5.3에서 가장 흥미로운 사실은 점수가 아니라 방법이다. GLM-5.2와 같은 743B 파라미터 베이스, 재학습 없음, Terminal-Bench 3.0에서 약 6배 점프(4.6% → 28.3%)는 후훈련 강화학습 환경 스케일업만으로 나왔다. 업계가 수개월째 쌓아 온 추세를 확인한다 — 사전학습 스케일링 로가 수확체감에 들어가면, 후훈련 RL 스케일이 독립 성능 레버가 되고, 새 파운데이션을 다시 학습하는 것보다 비용 바닥이 훨씬 낮다. 진입 장벽이 의미 있게 내려가고, OpenAI급 연산 예산이 없는 중위 랩도 에이전틱·코딩 벤치 격차를 좁힐 수 있는 이유다.

5. DeepSeek는 아직 최저가 프론티어 모델인가

모델 입력 (100만 토큰당) 출력 (100만 토큰당) 오픈웨이트?
DeepSeek V4-Pro (피크) ¥9.0 (~$1.26) ¥27.0 (~$3.78) 아니오
DeepSeek V4-Pro (오프피크) ¥4.5 (~$0.63) ¥13.5 (~$1.89) 아니오
Qwen3.8-Max (국제 API) $2.00 $6.00 예 (커스텀 라이선스)
OpenAI GPT-5.6 Luna $0.20 $1.20 아니오
Claude Opus 5 (Alibaba 자체 비교 비율로 환산) ~$5.00 ~$25.00 아니오

위안–달러 환산은 약 ¥7.15/$1, 근사치. 짧은 답: 아니다. 인상을 반영해도 DeepSeek V4-Pro 오프피크는 Claude Opus 5보다 훨씬 낮지만, 테이블 위 절대 최저가는 아니다. Qwen3.8-Max 국제 가격과 OpenAI Luna 모두 DeepSeek 오프피크를 밑돈다. 「중국 모델 = 최저가」는 2025년과 2026년 초 대부분 맞았다. 이제 안전한 가정이 아니다.

6. 1,100% 헤드라인과 미확인 주장

  • 「1,100%」 헤드라인은 기술적으로 맞지만, 맥락 없이는 오도한다. 해당 구간은 피크 시간 캐시적중 입력, 원래 0에 가장 가깝던 티어다. 실제 청구를 지배하는 출력은 350% 올랐다. 매체마다 다른 티어를 전체 이야기처럼 인용했다.
  • Qwen3.8-Max가 Alibaba 자체 Zhenwu M890 칩에서 돈다는 주장(여러 중국 금융 매체가 완전 국산 실리콘 추론 스택의 증거로 보도)은 Alibaba 자체 기술 문서나 제3자 벤치로 독립 확인되지 않았다. 확인 전까지 벤더 인접, 미검증 보도로 보라.
  • GLM-5.3이 Cursor에서 「심각한 취약점」을 발견했다는 보고는 VentureBeat 보도와 Zhipu 자체 공시에 근거한다. 취약점의 구체 기술 세부사항은 공개되지 않았으므로, 벤더 출처이며 독립 감사되지 않은 보안 발견으로 읽어야 한다.
  • 중국 상무부가 AI/반도체 기술에 대한 보복 수출 통제를 준비 중일 수 있다는 보도는 추측이며, 공식 발표가 아닌 미확인 미디어에 근거한다. 확정 사실이 아니라 배경 맥락으로 보라.

7. 중국 오픈웨이트와 미국 무료화, 두 가격 전쟁

프레임을 넓히면 패턴이 나온다. 대략 한 달, 중국 상위 랩은 국내 금융 미디어가 「一周三更」(일주일에 모델 업데이트 세 번)이라 부르기 시작한 속도로 메이저 릴리스를 쏟았다 — DeepSeek, Alibaba, Zhipu, 그 앞의 Moonshot Kimi K3(7월 16일 오픈웨이트, 2.8T 파라미터)와 MiniMax H3. 중국 보도는 대체로 중국 오픈웨이트 공개가 「글로벌 AI 산업의 재가격을 강제한다」고 읽는다. 같은 사건을 다루는 영문 보도보다 공세적인 프레이밍이다.

한편 미국 랩은 소비자 층에서 반대 수를 둔다. OpenAI는 최저 티어를 80% 깎고(7월 30일) 일주일 뒤 그 모델을 전원에게 무료·무제한으로 올렸다(8월 6–7일). Google은 세 주 된 전작의 절반 가격으로 코딩 특화 모델을 냈다(8월 13일). 중국 랩이 플래그십을 오픈웨이트로 풀고 연산이 막힌 상단에 계층형·더 높은 가격을 넣는 동안, 미국 랩은 소비자 끝에서 무료와 저가로 달린다. 둘 다 실제 전략이다. 퍼널의 다른 구간을 최적화할 뿐이다.

조심스럽게 이름을 붙여야 할 지정학 층도 있다. 7월 Moonshot Kimi K3 오픈웨이트는 이미 미국 안보 주시를 샀고, Alibaba가 이 창에 2.4T 플래그십을 푼 것을 일부 분석가는 규제 강화 전에 해외 마인드셰어와 「기술 동등」 서사를 고정하려는 수로 읽는다. 확인된 사실이 아니라 정보에 기반한 해석이다. 다만 영문 테크 언론만 읽으면 놓치기 쉬운 맥락이다. 그쪽은 이 공개들을 국가 단위 패턴이 아니라 고립된 제품 뉴스로 다뤄 왔다.

8. DeepSeek 인상 후 API 청구를 다시 계산하는 5단계

  1. 헤드라인 티어를 분리한다: 1,100%는 V4-Pro 피크 캐시적중 입력이다. 출력은 350%. 캐시미스 입력은 200%. 라우팅을 바꾸기 전에 공식 라인 항목과 맞춘다.
  2. 최근 30일을 베이징 시간으로 자른다: 피크는 오전 9시–12시, 오후 2시–6시. 피크 비중이 ~1.8배를 볼지, 헤드라인 배수를 볼지를 가른다.
  3. 캐시적중률을 추정한다: 헤비·대부분 오프피크·절반 적중 워크로드는 약 1.8배로 모델링됐다. 피크에 적중률까지 낮으면 헤드라인이 현실이 된다.
  4. 출시 전 Qwen 라이선스를 읽는다: 개인·사내 사용은 문제없다. 연속 12개월 창에서 $50M를 넘는 MaaS / AI Work Assistant는 별도 상업 라이선스가 필요하다. 100M+ MAU 또는 월 매출 $20M+는 모델명을 표시해야 한다. 지리적 금지는 없다.
  5. 미룰 수 있는 작업은 상시 온라인 원격 Mac에 둔다: 배치와 야간 에이전트 평가는 베이징 피크를 피해야 한다. 절전하는 노트북은 그 창을 지키지 못한다.

9. 베이징 오프피크 평가 호스트 의사결정 매트릭스

옵션 적합 주요 한계 피크/오프피크 적합
개인 노트북 공지 읽기, 라우트 편집, 짧은 스모크 테스트 절전이 오프피크 창을 끊음; 베이징 피크 대비 시간대 드리프트 초안만 — 야간 배치 부적합
일반 클라우드 Linux VM API 전용 배치, 헤드리스 회귀 네이티브 macOS / Cursor / Xcode 스택 없음 서버 측 오프피크는 가능, Apple 툴링 평가에는 약함
SFTPMAC 원격 Apple Silicon Mac 베이징 스케줄 에이전트 평가, Cursor / OpenClaw, 오픈웨이트 시험 플랜과 대역폭을 미리 짤 것 상시 온라인 + SFTP 동기화, 오프피크 요금을 먹도록 설계

10. FAQ

인상 후에도 DeepSeek는 여전히 GPT-5.6이나 Claude보다 싼가?
오프피크 요금은 여전히 Claude Opus 5보다 싸다. 다만 전체에서 단 하나의 최저가는 아니다. OpenAI GPT-5.6 Luna(백만 토큰당 $0.20/$1.20)와 Alibaba 국제 Qwen3.8-Max 가격($2/$6)이 DeepSeek의 새 오프피크를 최소 한 차원에서 밑돈다. DeepSeek는 프론티어급으로는 여전히 상대적 저가이나, 이제 절대 최저가는 아니다.

Alibaba Qwen3.8-Max 오픈웨이트를 상업 제품에 무료로 쓸 수 있나?
대부분의 용도에서는 가능하다. 개인 프로젝트와 사내 엔터프라이즈 사용은 영향이 없다. 제약은 연속 12개월 매출이 5,000만 달러를 넘는 Model-as-a-Service 또는 AI Work Assistant 사업을 운영할 때만 적용되며, 그 구간은 Alibaba와 별도 상업 라이선스가 필요하다.

Qwen3.8-Max는 미국·EU·영국 사용자에게 금지되거나 제한되나?
아니다. 온라인에 퍼진 그 주장은 거짓이다. 공개된 라이선스에는 어떤 지리적 제한도 없다. 제한은 매출 기준(서비스가 얼마나 버느냐)이며, 본인이나 사용자가 어디에 있는지가 아니다.

GLM-5.3과 GLM-5.2의 실제 차이는 무엇인가?
베이스 모델 수준에서는 차이가 없다. 둘 다 동일한 7,430억 파라미터 파운데이션 모델을 쓴다. 성능 향상(Terminal-Bench 3.0에서 약 6배)은 전부 후훈련 강화학습 스케일업에서 나오며, 베이스 모델 재학습은 없다.

Meta는 작은 Muse Glimmer가 아니라 플래그십을 실제로 오픈소스할까?
아직 아니다. Muse Glimmer는 300억 증류 모델이지 Meta의 실제 플래그십이 아니다. CEO Mark Zuckerberg는 더 큰 비공개 Muse Spark 1.2의 오픈웨이트가 「곧」 온다고 말했다. 실현되면 미국 플래그십급 모델의 최초 공개가 된다. 집필 시점 기준 그 공개는 일어나지 않았다. 확인된 사실이 아니라 표명된 의도로 보라.

출처: DeepSeek 공식 요금 공지, Wall Street CN·IT Home·AIGC.cn·V2EX 커뮤니티 교차 확인; Alibaba 공식 Qwen 모델 저장소(Hugging Face / ModelScope)와 South China Morning Post의 라이선스 보도; Zhipu(Z.ai) 공식 GLM-5.3 기술 페이지, VentureBeat·StableLearn 커버리지; Meta AI Research 공식 블로그와 Muse Glimmer VentureBeat 보도; 중국 오픈웨이트 공개 주기·프레이밍에 관한 중국 금융 매체(Yicai/第一财经, Sohu Finance). 가격·라이선스·벤치 수치는 발행 시점 공개 정보를 반영한다. 재발행 전 최신 공식 요금과 라이선스를 확인하고, 위에서 미검증으로 표시한 항목(국산 칩 주장, Cursor 취약점 보고, 수출 통제 루머)은 독립 확인되지 않았음을 명시하라.

11. 재가격의 가치 — 그리고 노트북이 여전히 실패하는 지점

타임라인, 세 데이터 표, 정면 비교 요금이면 한 가지 결정은 가능하다. 헤드라인을 청구 라인으로 쪼갠 뒤, 베이징 피크 비중과 캐시적중률로 다시 계산한다. 오픈웨이트는 라이선스를 읽기 전까지 무제한 공짜가 아니다.

한계도 같다. GLM-5.3 점수는 벤더 공시다. Zhenwu M890, Cursor 취약점 주장, 수출 통제 루머는 미검증이다. 환율은 약 ¥7.15/$1 추정치다. 커버리지는 자체 트래픽 슬라이스와 라이선스 검토를 대체하지 않는다.

다음 단계가 야간 배치 평가, 베이징 스케줄 에이전트 런, 또는 Cursor / OpenClaw 안에서 Qwen 오픈웨이트 시험이라면, 절전하는 노트북은 싼 시간을 놓치는 길이다. 스케줄러를 상시 온라인 Apple Silicon 원격 Mac에 두고 평가 저장소를 SFTP/rsync로 동기화하라. SFTPMAC 원격 Mac 임대는 네이티브 macOS, 저지연 협업, 24/7 가동을 준다 — 이번 가격 이동을 재현 가능한 라우팅 변경으로 바꿀 더 나은 자리이다.