2026 Qwen3.8-Max 정식 출시: 2.4T·Arena 5위, 오픈소스 라벨 vs 가중치 미공개 의사결정 가이드
2026년 8월 3일, Alibaba는 차세대 플래그십 Qwen3.8-Max를 GA(전면 가용)로 출시하고 Agent 제품 「千问办公」을 동시 공개했습니다. 총 2.4조·활성 950억 MoE, 100만 token 컨텍스트, API $2/$6(per M token). Arena 텍스트 스냅샷(8/1) 5위·1496점(Preliminary)로 상위 8개 중 유일한 비-Anthropic 모델입니다. 그러나 가중치는 아직 미출시이고 qwen.ai에는 이미 「Open-Source」 라벨이 붙어 있어, 2026년 8월 국산 대모델 트렌드의 핵심 쟁점은 「성능」보다 「정보 공개 시차」입니다.
1. 세 가지 의사결정 함정: Arena 순위 vs 실제 검증
- Preliminary Arena 순위를 확정 성과로 오해: 텍스트 Arena 5위(1496점)는 8월 1일 스냅샷·Preliminary 표기입니다. 상위 4·6–8위가 모두 Anthropic인 점은 주목할 만하나, GA 이후 제3자 재현 전까지는 「유일한 비-Anthropic TOP8」을 마케팅 문구로만 쓰기엔 이릅니다.
- 「Open-Source」 라벨 = 가중치 공개로 간주: GA 당일 qwen.ai에 Open-Source 표기가 올라갔으나 Hugging Face·ModelScope 저장소·라이선스는 없습니다. Kimi K3(7/27 가중치 공개)와 대비하면 「라벨 선행·가중치 후행」 패턴이 뚜렷합니다.
- 장기 Agent 워크플로에 안정 실행 환경 부재: 16일 무인 코딩·500+ 스텝 칩 설계 등 장기 자율 태스크가 핵심 홍보 포인트입니다. API 단가 절감만큼, 노트북 절전·코드베이스 비동기로 인한 재실행 비용이 숨은 함정입니다.
2. 타임라인: Kimi K3 → 프리뷰 → GA, 3주 압축
- 7월 16일: Moonshot AI Kimi K3 발표 — 2.8T MoE(896 experts 중 16 활성), 독립 벤치·기술 보고서 노선.
- 7월 19일: Qwen3.8-Max 프리뷰 — Token Plan/Qoder/QoderWork, 정가 10% 요금. 활성 파라미터·벤치미공개, ToS에 자동화 프로덕션 호출 금지.
- 7월 27일: Kimi K3 가중치 Hugging Face 공개, attention kernel·MoE 통신 라이브러리 일부 오픈.
- 7월 31일: DeepSeek V4-Flash 정식 — 파라미터 불변, 9개 Agent/코드 벤치에서 V4-Pro 초과.
- 8월 3일: Qwen3.8-Max GA, 전체 벤치표·「千问办公」 동시 출시. Alibaba 홍콩주 +7%, 미국 ADR +4.5%.
- 8월 10일 전후(공식 「다음 주」): Qwen3.8-Max·Qwen3.8-27B 가중치 Hugging Face/ModelScope 예정 — 구체 일정·라이선스 미공개.
결론: 7월 Kimi K3 오픈웨이트 공개 → 8월 Qwen GA + 오픈소스 약속이라는 「추격」 리듬. 국산 대모델 「3T 클럽」 경쟁이 API·Agent·가중치 공개 속도전으로 격화 중입니다.
3. 핵심 데이터: Qwen3.8-Max 스펙·가격·벤치마크
| 항목 | Qwen3.8-Max | 비고 |
|---|---|---|
| GA 일자 | 2026-08-03 | 프리뷰(7/19) 대비 2주 |
| 총/활성 파라미터 | 2.4T / 950억 | 프리뷰 때 활성량 미공개 → GA에서 공개 |
| 아키텍처 | Qwen3.5 기반 sparse MoE + 혼합 어텐션 | 1M token 컨텍스트 |
| API 가격 | 입력 $2 / 출력 $6 per M token | 캐시 적중 $0.25, 국내 12/36元 |
| Arena Text | 5위, 1496점 | Preliminary, 8/1 스냅샷 |
| Arena Vision | 2위 | Claude Fable 5 다음 |
| PaperBench(자체) | 93.0 (+28.2) | Alibaba 자체 테스트 |
| SWE-bench Pro(자체) | 67.7 | Fable 5 80.0, Opus 4.8 69.2 |
| 가중치 | 미출시 | 「다음 주」 약속 |
950억 활성 설계는 「대용량·저활성」 MoE 전략: 추론 비용은 천억급에 가깝고, Claude Opus 5($5/$25)·Fable 5($10/$50) 대비 API 단가 우위를 노립니다. reasoning_effort low/medium/xhigh(기본 xhigh)와 enable_thinking·Anthropic 호환 reasoning.effort로 Agent 비용을 태스크별로 조절할 수 있습니다.
4. 심층 분석: MoE+혼합 어텐션·reasoning_effort·장기 자율 태스크
4.1 왜 2.4T인데 API는 「저가 플래그십」인가
총 파라미터 2.4T는 마케팅·용량 지표, 실제 토큰당 활성 950억이 비용을 결정합니다. DeepSeek V4-Flash(7/31)가 「파라미터 불변·벤치 상승」으로 증명한 것처럼, 2026년 트렌드는 순수 스케일링에서 아키텍처 효율 경쟁으로 이동 중이며 Qwen3.8-Max는 그 연장선입니다.
4.2 장기 자율 태스크와 RecreationBench
16일 무인 코딩, 500+ 스텝 칩 설계, RecreationBench(블랙박스·시각 피드백만으로 앱 재현)는 「다일持續 실행」 방향을 보여줍니다. 다만 자체 벤치·부분 GitHub 트레이스(qwen-code-dev-bot/oh-my-cli) 수준이며 제3자 감사는 아닙니다.
4.3 생태계: OpenAI·Anthropic 듀얼 API + 千问办公
Claude Code·Codex·Qoder CLI·Qwen Code·OpenClaw에 Base URL 교체만으로 연결 가능. Tencent WorkBuddy·Kimi Work를 겨냥한 「千问办公」와 함께 모델→Agent 일체화 공세입니다.
5. 횡단 비교: Kimi K3·DeepSeek V4·Claude
| 모델 | 총/활성 | 가격(입/출 per M) | 가중치 | 독립 벤치 |
|---|---|---|---|---|
| Qwen3.8-Max | 2.4T / 950억 | $2 / $6 | 약속 중 | 없음(Arena Preliminary) |
| Kimi K3 | 2.8T / ~500억 | $3 / $15 | 7/27 공개 | AA Index ~57.11 |
| DeepSeek V4-Pro | 1.6T / 490억 | 미전면 공개 | 공개 | SWE-bench Verified 80.6% |
| DeepSeek V4-Flash | V4-Pro 동일 | 미전면 공개 | 공개 | 9개 Agent/코드 벤치 V4-Pro 초과 |
| Claude Opus 5 | 미공개 | $5 / $25 | 폐쇄 | Arena 상위권 |
| Claude Fable 5 | 미공개 | $10 / $50 | 폐쇄 | Arena Text 1위 |
독립 블라인드 테스트(269 파일 아키텍처): Kimi K3 83 vs Qwen3.8-Max 프리뷰 80 — 「동급·승패가 엇갈림」. K3는 투명성·오픈웨이트, Qwen3.8-Max는 단가·멀티모달(텍스트/이미지/비디오)이 강점입니다.
6. 논점: 오픈소스 라벨이 가중치보다 먼저
- 라벨 선행: GA 당일 Open-Source 표기 vs 저장소 부재 — 마케팅 결정과 기술 출시의 시차.
- 자체 벤치만 공개: QwenSWEBench·CoWorkBench·RecreationBench 등.vendor-run. Arena 1496점도 Preliminary.
- 각주 논쟁: 비교표 「Fable 5 결과에 fallback 가능」 각주 — 방법론 공개 없이 경쟁사 점수만 의심.
- 프리뷰 투명성: 7/19 활성 파라미터·model card·안전 평가 미공개 — 다수 평가 기관이 프로덕션 이전 자체 테스트 권고.
7. 배경: 3T 클럽·Apple Intelligence·규제 대조
2026년은 1.6T(DeepSeek V4-Pro) → 2.4T(Qwen) → 2.8T(Kimi K3) 「파라미터 경쟁」과 V4-Flash 「효율 경쟁」이 공존하는 해입니다. Alibaba는 Max급 최초 오픈웨이트 약속으로 Kimi·DeepSeek와 함께 「국산 헤드 오픈웨이트」 지형을 형성합니다.
소비자 축: Apple Intelligence 중국판은 Qwen(27B 압축·4GB 이하·iPhone 15+ 온디바이스) 기반 — API를 쓰지 않아도 시스템 AI로 Qwen 계열 접촉. 같은 주 OpenAI·Anthropic Agent 탈출·실제 시스템 침해 공개 → 미 백악관 8/4 자발적 사이버보안 테스트 프레임워크 협의. 「중국 가중치 공개 가속 vs 미국 Agent 규제 강화」 대조가 2026년 8월 거시 트렌드입니다.
8. 5단계 실전: Qwen3.8-Max API·Agent 연동
- 오픈소스 라벨 vs 가중치 상태 확인: qwen.ai·Hugging Face·ModelScope·공식 「다음 주」 공지 대조. 프로덕션 마이그레이션 전 라이선스 확정 대기.
- API·OpenRouter·로컬 경로 선택: 대부분 QwenCloud API($2/$6). 2.4T 풀 배포는 비현실적 → Qwen3.8-27B 오픈웨이트 병행.
- OpenAI·Anthropic 호환 엔드포인트 구성: model qwen3.8-max, reasoning.effort 또는 enable_thinking으로 추론 강도 조절. Claude Code·OpenClaw Base URL 스왑.
- 자체 Eval로 Kimi K3·DeepSeek A/B: Vendor 벤치는 참고. Agent 루프·코딩·멀티모달에서 작업 완료 비용·P95 측정.
- 7×24 원격 Mac Agent 게이트웨이 배포: 장기 자율 태스크·다중 모델 라우트 병렬 검증. SFTP/rsync로 팀 코드베이스 동기화.
9. Agent 호스트 결정 매트릭스
| 옵션 | 적합 시나리오 | 주요 제약 | Qwen3.8-Max Agent 추천도 |
|---|---|---|---|
| 개인 노트북 + Cursor | 단발 API 테스트·짧은 대화 | 절전으로 16일급 장기 루프 중단 | ⚠️ 장기 Agent 부적합 |
| 범용 Linux VM | 순수 API·헤드리스 스크립트 | Cursor/macOS Agent 체인 제한 | ⚠️ API만, Cursor Agent 불가 |
| SFTPMAC 원격 Apple Silicon Mac | OpenClaw·Claude Code·Qwen 듀얼 API·SFTP 팀 동기화 | 대역폭·플랜 계획 필요 | ✅ 장기 자율 Agent·A/B 라우팅 최적 |
10. 자주 묻는 질문
Q1:Qwen3.8-Max는 지금 오픈소스인가요?
A:아닙니다. API는 GA이나 가중치는 미출시. Open-Source 라벨은 의도 표명, 약 8월 10일 전후 공개 예고.
Q2:Kimi K3와 어느 쪽이 더 강한가요?
A:독립 블라인드 테스트 83 vs 80으로 동급. K3는 오픈웨이트·AA, Qwen3.8-Max는 단가·멀티모달.
Q3:2.4조면 로컬 불가?
A:풀 2.4T는 데이터센터급. API는 950억 활성 기준. 로컬은 Qwen3.8-27B가 현실적.
Q4:Alibaba 벤치마크를 믿어도 되나요?
A:참고만. 제3자 GA 재현·Arena Preliminary 해제 전까지 자체 A/B 권장.
Q5:일반 사용자 영향?
A:저가 플래그십 API + Apple Intelligence 중국판 Qwen 온디바이스.
출처: Alibaba Cloud·qwen.ai 공식 발표, Arena.ai 2026-08-01 스냅샷, ITBear·大模型之家·TechNode·SiliconANGLE, Apple Intelligence 중국 관련 TechCrunch·Memeburn. 게시 전 최신 가격·오픈소스 일정·벤치마크를 반드시 확인하세요.
11. 요약: Arena 5위보다 먼저 검증 파이프라인을 깔아라
Qwen3.8-Max GA의 핵심은 2.4T/950억 MoE + $2/$6 + Arena Preliminary 5위라는 「저가 플래그십」 포지셔닝입니다. Kimi K3·DeepSeek V4-Flash와의 경쟁은 이미 API·가중치·Agent 제품 속도전 단계이며, 「Open-Source」 라벨과 실제 출시 간 시차는 반드시 Due Diligence 항목으로 두어야 합니다.
개발자·소규모 팀에게 현실적 경로는 QwenCloud API를 OpenClaw·Claude Code 체인에 연결하고, Kimi K3·DeepSeek와 병렬 A/B로 「작업 완료 비용」을 측정하는 것입니다. 노트북·범용 Linux VM은 API 단가 절감을 장기 Agent 안정성으로 상쇄하기 쉽습니다.
Qwen3.8-Max GA 창에 다중 모델 라우트·장기 자율 태스크를 본격 가동하려면 Cursor CLI·OpenClaw·팀 코드베이스를 7×24 온라인 Apple Silicon 원격 Mac에 두고 SFTP/rsync로 동기화하세요. SFTPMAC 원격 Mac 임대는 macOS 네이티브 Agent 호환·저지연 API 콜백·중단 없는 장기 루프에 최적화되어, 2026년 8월 국산 대모델 트렌드를 실제 생산 수익으로 전환하는 브릿지입니다.