AI Agent 千問 플래그십 2026.08.04

Alibaba Qwen3.8-Max 출시: 2.4T 파라미터 Arena 세계 상위 5위, 다음 주 오픈소스

Alibaba2026년 8월 3일 신세대 플래그십 대규모 언어 모델 Qwen3.8-Max(GA 전량 이용 가능)를 정식 공개했습니다. 총 파라미터 2.4조, 활성 9500억, 100만 token 컨텍스트이며, Agent 제품 「千問 오피스」도 동시 출시되었습니다. Arena 텍스트 아레나(8월 1일 스냅샷) 5위(1496점, Preliminary 표기), 상위 8위 중 유일한 비-Anthropic 모델입니다.

모델 선정자와 AI 개발자를 위해 본 글은 세 가지 질문에 답합니다. ① 7월 19일 프리뷰에서 8월 3일 GA까지의 2주 타임라인과 투명성 과제;② 핵심 벤치마크Kimi K3, DeepSeek V4와의 비교;③ 「Open-Source」라벨이 게시되었지만 웨이트 미공개라는 논점과 6단계 안전 연결 체크리스트. 데이터는 2026-08-04 기준입니다.

01 프리뷰에서 정식 출시까지: 2주 타임라인과 핵심 과제

  • 7월 16일: Moonshot AI가 Kimi K3 공개(2.8T 파라미터, 896 전문가 중 16 활성화), 독립 벤치마크와 투명한 기술 보고서를 강조했습니다.
  • 7월 19일: Qwen3.8-Max 프리뷰 공개, Token Plan / Qoder / QoderWork 연결, 가격은 정식 예상가의 10%;활성 파라미터 미공개, 벤치마크표 없음, 이용약관으로 자동화 프로덕션 호출 금지.
  • 7월 27일: Kimi K3가 약속대로 웨이트 오픈소스화, Hugging Face 공개, 일부 기반 인프라도 공개했습니다.
  • 7월 31일: DeepSeek V4-Flash 정식판 출시, 파라미터 규모 불변 상태에서 에이전트·코드 벤치마크가 V4-Pro 프리뷰를 크게 상회했습니다.
  • 8월 3일: Qwen3.8-Max 정식 GA, 전체 벤치마크표 공개, 「千問 오피스」동시 출시;Alibaba 홍콩 주식 당일 약 7% 상승, 미국 주식 약 4.5% 상승.
  • 8월 10일 전후 예상(공식 「다음 주」): Qwen3.8-Max 및 경량 Qwen3.8-27B 웨이트가 Hugging Face와 ModelScope에 등장 예정, 구체적 날짜와 오픈소스 라이선스는 작성 시점 미공개.

개발자와 기업 사용자가 직면한 핵심 과제:

  • 라벨 선행: 공식 사이트에 「Open-Source」표기 완료, Hugging Face / ModelScope에 대응 저장소와 라이선스 없음.
  • 벤더 자체 측정: PaperBench, OSWorld, SWE-bench Pro 등 Alibaba 자체 프레임워크 데이터, 제3자 권위 플랫폼의 GA판 재현 없음.
  • 프리뷰 기간 투명성 부족: 7월 프리뷰는 활성 파라미터 비공개, 다수 독립 평가 기관이 프로덕션 시스템 이전을 권하지 않았습니다.
  • 경쟁사는 이미 오픈: Kimi K3와 DeepSeek V4 시리즈 웨이트 공개 완료, Qwen3.8-Max 풀 플래그십은 여전히 API만 가능.

Arena 텍스트 아레나 상위 8위 중 Qwen3.8-Max는 유일한 비-Anthropic 모델입니다——하지만 항목은 Preliminary 표기이고, 나머지 점수는 주로 벤더 자체 측정입니다. 「세계 1티어」는 독립 검증이 필요합니다.

02 Qwen3.8-Max 핵심 데이터 요약

Qwen3.8-Max 공식 핵심 파라미터(2026-08-03 GA)
항목 수치
출시일2026년 8월 3일(GA)
총/활성 파라미터2.4조 / 9500억
아키텍처Qwen3.5 기반 sparse MoE + 하이브리드 어텐션
컨텍스트 윈도우100만 token(사고 모드 약 98.3만, 출력 상한 13.1만)
입력 모달리티텍스트 / 이미지 / 동영상
API 가격(국제)입력 $2/M, 출력 $6/M;암시적 캐시 히트 $0.25, 명시적 캐시 쓰기 $2.5, 읽기 $0.17
국내 가격(공식)입력 12원/M, 출력 36원/M, 캐시 히트 최저 1.5원
Arena 텍스트(8/1 스냅샷)5위, 1496점(Preliminary);상위 4위와 6–8위 모두 Anthropic
Arena 비주얼2위, Claude Fable 5에 다음
PaperBench(Alibaba 자체)93.0(전세대 대비 +28.2)
OSWorld-Verified(Alibaba 자체)86.1
SWE-bench Pro(Alibaba 자체)67.7(Fable 5 80.0, Opus 4.8 69.2 미달)
HLE(Alibaba 자체)43.6(플래그십 중 최저, Fable 5 53.3)
웨이트 공개「다음 주」약속, 작성 시점 미공개

「Alibaba 자체」표기 데이터는 공식 발표 자료 출처이며, Artificial Analysis, Arena.ai 공식 팀의 GA판 독립 재현은 아직 없습니다.

03 2.4T 파라미터 이면: MoE 아키텍처와 Agent 강점 분석

왜 MoE + 하이브리드 어텐션인가? Qwen3.8-Max는 Qwen3.5 노선을 계승하여 총 파라미터 2.4조에 토큰당 약 9500억만 활성화, 추론 비용은 문자 그대로 2.4T보다 1000억급 모델에 가깝습니다. 이것이 API 가격을 $2/$6으로 낮출 수 있는(Claude Opus 5 $5/$25, Fable 5 $10/$50보다 낮음) 핵심 이유——아키텍처 효율로 가격 경쟁력을 확보합니다.

reasoning_effort 3단계: low / medium / xhigh(기본 xhigh)를 제공하고, 네이티브 API의 enable_thinking 또는 Anthropic 호환 인터페이스의 reasoning.effort로 속도와 깊이를 조절할 수 있으며, Agent 시나리오의 표준 비용 다이얼입니다.

장기 자율 태스크가 이번 헤드라인입니다: Alibaba 사례에는 16일 무인 개입 코딩, 500+ 단계 칩 설계 최적화, 자체 RecreationBench(블랙박스 상호작용 + 시각 피드백으로 실제 앱 재현)가 포함됩니다. 일부 과정은 GitHub qwen-code-dev-bot/oh-my-cli에 기록되었지만, 완전한 제3자 감사는 아닙니다.

에코시스템 포지셔닝: 「千問 오피스」Agent 플랫폼에 동시 연결;API는 OpenAI와 Anthropic 프로토콜 호환으로 Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw 등 툴체인에 연결 가능, 이전 마찰을 줄입니다.

  • 멀티모달 입력: 텍스트 / 이미지 / 동영상 통합 인터페이스, 비주얼 Arena 2위.
  • Agent 비교: 千問 오피스는 Tencent WorkBuddy, Moonshot Kimi Work와 견준합니다.
  • 소비자 침투: 千問은 중국판 Apple Intelligence 핵심 생성 엔진으로 채택, 압축판은 iPhone 15+에서 로컬 실행.

04 비교: Qwen3.8-Max vs Kimi K3 vs DeepSeek V4 vs Claude

플래그십 대규모 모델 비교(2026년 8월 초)
모델 총/활성 컨텍스트 가격(입/출 $/M) 웨이트 공개 독립 평가
Qwen3.8-Max2.4T / 950B1M$2 / $6미공개(약속 중)GA 재현 없음
Kimi K32.8T / ~500B~1.05M$3 / $15공개(7/27)AA 지수 약 57.11
DeepSeek V4-Pro1.6T / 490B1M공식표 참조공개SWE-bench Verified 80.6%
DeepSeek V4-FlashV4-Pro 동일1M공식표 참조공개9항목 Agent/코드 V4-Pro 초과
Claude Opus 5비공개1M$5 / $25클로즈드Arena 상위
Claude Fable 5비공개1M$10 / $50클로즈드Arena 텍스트 1위

놓치기 쉬운 점: Kimi K3는 약 500B 활성을 공개, DeepSeek는 490B 공개, Alibaba는 프리뷰 기간 활성량을 전혀 비공개, GA에서야 「9500억」을 보충——7월 「투명성 부족」 지적의 원인 중 하나입니다.

비교 가능한 유일한 독립 맹측(269개 파일의 실제 아키텍처 설계 태스크): Kimi K3 83점, Qwen3.8-Max 프리뷰 80점, 동급 상호 승패, 전면 우위는 아닙니다.

Alibaba 비교표 각주는 「Fable 5 결과에 fallback 포함 가능」이라며 경쟁사 점수를 은근히 의심——하지만 자사 테스트 방법론도 제3자 재현 가능 수준으로 공개되지 않았습니다.

05 「오픈소스」라벨 논란, 6단계 연결과 인용 가능 데이터

이번 출시에서 가장 경계해야 할 것은 정보 공개 시차이며, 단일 점수의 높낮이가 아닙니다:

  • 라벨이 웨이트에 선행: qwen.ai가 GA 당일 「Open-Source」표기, 저장소와 라이선스 미공개.
  • 점수는 모두 vendor-run: QwenSWEBench, RecreationBench 등 내부 벤치마크 포함;Arena 1496점도 Preliminary.
  • 프리뷰 기간 금지: 7월 프리뷰는 자동화 프로덕션 호출 금지, model card와 안전 평가 미공개.
  • 웨이트 배포 미정: 풀 2.4T는 데이터센터급 하드웨어 필요;현실적 경로는 API 또는 Qwen3.8-27B 오픈판 대기.

6단계로 Qwen3.8-Max 안전 연결:

  1. QwenCloud 개통: Alibaba Cloud Model Studio / Qwen 공식 콘솔에서 API Key 생성, GA 모델 ID와 리전 엔드포인트 확인합니다.
  2. 호환 프로토콜 선택: 기존 툴체인에 맞춰 OpenAI 또는 Anthropic 호환 base_url 선택, 클라이언트 재작성을 피합니다.
  3. 추론 단계 설정: medium부터 시작하여 지연 검증, 복잡한 Agent 태스크에서 xhigh / enable_thinking로 상향합니다.
  4. 샌드박스 A/B 비교: 자사 비즈니스 prompt로 Kimi K3 / DeepSeek V4와 맹측, 벤더표만으로 프로덕션 이전하지 마세요.
  5. 웨이트 경로 계획: Hugging Face / ModelScope 「다음 주」공지 주시;로컬 풀버전 비현실적이면 Qwen3.8-27B에 집중합니다.
  6. Agent 툴체인 연결: OpenClaw, Qoder, Claude Code 등 호스트에서 base URL 교체, 장기 태스크 안정성 검증합니다.
qwen3_8_max_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_qwen_api_key",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "Review this Agent workflow..."}],
    extra_body={"enable_thinking": True}
)

인용 가능한 핵심 데이터(출처: Alibaba 공식, Arena.ai 공개 랭킹, 2026-08-04):

  • 총/활성 파라미터: 2.4T / 950B, MoE + 하이브리드 어텐션
  • 컨텍스트: 1M token;사고 모드 입력 약 983K, 출력 상한 131K
  • API 가격: $2/$6 per M token;캐시 히트 $0.25/M
  • Arena 텍스트: #5, 1496점(Preliminary, 8/1 스냅샷)
  • Arena 비주얼: #2, Fable 5에 다음
  • 독립 맹측: 아키텍처 태스크 K3 83 vs Qwen 프리뷰 80(동급)
  • 자본 시장: 출시일 홍콩 주식 +7%, 미국 주식 +4.5%
  • 웨이트 상태: 8/10 전후 공개 약속, 작성 시점 미공개

06 FAQ, 업계 배경과 프로덕션 환경 정리

Q: Qwen3.8-Max 지금 바로 쓸 수 있나요? 오픈소스되었나요?
A: API는 QwenCloud로 호출 가능, OpenAI / Anthropic 프로토콜 호환입니다. 웨이트는 미공개;공식 사이트 「Open-Source」라벨은 의도를 나타내는 것이지 공개된 artifact가 아니며, 8월 10일 전후 저장소와 라이선스 공표 예상입니다.

Q: Kimi K3와 누가 더 강한가요?
A: 통일된 권위 있는 직접 대결은 없습니다. 독립 맹측은 접근(83 vs 80);K3 강점은 공개 웨이트 + AA 지수, Qwen3.8-Max 강점은 낮은 API 가격과 더 강한 멀티모달입니다.

Q: 2.4조는 로컬 실행 불가를 의미하나요?
A: 풀 checkpoint는 멀티노드 데이터센터가 필요합니다. API 비용은 950B 활성으로 과금;개인 개발자는 Qwen3.8-27B 오픈판을 기다려야 합니다.

Q: Alibaba 점수를 믿을 수 있나요?
A: 참고용으로만 활용하고 결론으로 내리지 마세요. Artificial Analysis 등 재측정을 기다리거나 자사 시나리오에서 A/B하세요.

Q: 일반 사용자에게 영향은?
A: 중국판 Apple Intelligence 생성 능력은 千問 압축 모델 기반, iPhone 사용자는 시스템 계층에서 간접적으로 千問 능력을 이용합니다.

2026년은 조 파라미터 「확산년」입니다: DeepSeek V4-Pro(1.6T), Qwen3.8-Max(2.4T), Kimi K3(2.8T)가 잇따라 등장하고, DeepSeek V4-Flash는 파라미터를 쌓지 않고도 Agent 능력을 크게 향상시킬 수 있음을 증명했습니다. Alibaba가 Max급 웨이트 오픈소스를 약속하는 것은 이례적이며, Kimi, DeepSeek와 함께 중국 상위 「오픈 웨이트」 판도를 형성합니다;동시에 미국 백악관은 8월 4일 OpenAI, Anthropic, Google, Meta를 소집하여 Agent 사이버보안 테스트 프레임워크를 논의했습니다——오픈소스 생태계 경쟁과 규제 강화가 뚜렷한 대비를 이룹니다.

순수 API 호출은 문턱이 낮지만, 장기 Agent는 공유 VPS에서 메모리 지터와 장시간 연결 단절에 쉽게 직면하고, 다중 툴체인 병렬 실행에 7×24 안정 호스트가 부족하며, 2.4T 웨이트 자체 배포에는 슈퍼컴퓨터 클러스터가 필요합니다. OpenClaw, Qoder, Claude Code 원격 게이트웨이를 지속 운영하는 프로덕션 환경에는 JEXCLOUD 멀티리전 베어메탈 Mac이 최적입니다: Apple Silicon 통합 메모리 독점, 오버셀 대역폭 지터 없음, launchd 상주 Agent, 120초 배포. 노드와 가격은 JEXCLOUD 요금 페이지를 참고하세요.