Kimi K3 전면 오픈웨이트: 2.8T 모델 해설
2026년 7월 27일 자정(베이징 시간), Moonshot AI가 약속했던 Kimi K3 완전 가중치를 Hugging Face에 공개했습니다. 총 2.8조(2.8T) 파라미터로, 역대 최대 규모의 다운로드 가능 오픈웨이트 모델이 됩니다. 7월 16일 API 출시 이후 11일간 백악관 증류 혐의, Ryan Greenblatt의 Claude 자칭 분석, Claude Opus 5 출시가 겹쳤지만 Moonshot은 일정을 유지했습니다.
본 글은 K3 오픈웨이트 공개 이후 개발자와 Tech Lead가 필요로 하는 내용을 정리합니다. ① 사양과 KDA/AttnRes/LatentMoE 아키텍처;② Hugging Face 배포물, 하드웨어 요구사항, Modified MIT 라이선스;③ 공식 benchmark와 초기 독립 재현;④ API 연동과 6단계 로컬 배포;⑤ 미·중 AI 경쟁과 증류 논란 맥락. 출시 전 아키텍처 심층 분석은 Kimi K3 심층 리뷰, 증류 논쟁 배경은 Claude Opus 5와 K3 증류 논란 글을 참고하세요.
01 7월 27일 오픈웨이트 출시: 무엇이 공개되었는가
Moonshot AI는 7월 16일 Kimi K3 API를 출시할 때 2026년 7월 27일 완전 가중치 공개를 약속했습니다. 7월 27일 00:00 CST, Hugging Face 조직 moonshotai에 다음 리포지토리가 동시에 올라왔습니다.
- Kimi-K3-Instruct: 대화·코딩·에이전트용 instruction-tuned 가중치(BF16)
- Kimi-K3-Base: 사전학습 base 가중치, 연구·미세조정용
- Kimi-K3-Instruct-MXFP4: MXFP4 4-bit 양자화판(약 1.4TB)
- Kimi-K3-Instruct-NVFP4: NVIDIA Blackwell NVFP4 양자화판
- Tokenizer / Config: 128K vocab, RoPE 확장 1M token 지원 설정 파일
동시에 vLLM 0.8.2+, SGLang 0.4.8+, llama.cpp nightly 브랜치에서 K3 추론을 지원한다고 발표했습니다. Moonshot은 공식 WeChat 공지에서 「역대 최대 다운로드 가능 오픈 모델」「최초 2조 초과 파라미터급 오픈 가중치」라고 표현했습니다.
| 리포지토리 | 용량(대략) | 용도 |
|---|---|---|
| Kimi-K3-Instruct (BF16) | ~5.6 TB | 프로덕션 추론, 미세조정 베이스 |
| Kimi-K3-Base (BF16) | ~5.6 TB | 연구, 커스텀 SFT/RL |
| Kimi-K3-Instruct-MXFP4 | ~1.4 TB | 단일 8×H200 노드 추론 |
| Kimi-K3-Instruct-NVFP4 | ~1.2 TB | Blackwell B200 최적화 |
| Model Card + LICENSE | — | Modified MIT, 사용 제한 명시 |
7월 27일 공개는 단순 파일 업로드가 아닙니다. 7월 22–23일 백악관 증류 혐의, Anthropic 2월 API 남용 지적, Greenblatt의 Claude 자칭 분석이 겹친 가운데 Moonshot이 약속을 지킨 것은 중국 AI 오픈웨이트 생태계의 「공개 일정 = 기술 신뢰」 선언으로 읽힙니다.
02 2.8T 사양과 KDA 아키텍처: 가중치로 확인된 구조
가중치 공개 전까지 K3 아키텍처는 Moonshot 기술 블로그와 API 문서에만 존재했습니다. 7월 27일 이후 외부 연구자가 config.json과 weight shard를 분석해 다음 사양을 확인했습니다.
| 항목 | 값 | 비고 |
|---|---|---|
| 총 파라미터 | 2.84T (공식 2.8T) | 역대 최대 오픈웨이트 |
| 활성 파라미터(추론) | ~52B / token | 896 experts 중 16 활성 |
| 레이어 수 | 64 | KDA 3:1 선형/전체 교차 |
| 히든 차원 | 10,240 | Gated MLA 적용 |
| MoE 전문가 | 896 routed + 1 shared | 희소도 1.8% |
| 컨텍스트 | 1,048,576 tokens | RoPE YaRN 확장 |
| 비전 | 네이티브 ViT 인코더 | MMMU-Pro 81.6% |
| 학습 데이터 | ~18T tokens | 다국어 + 코드 + 수학 |
Kimi Delta Attention(KDA)
KDA는 선형 어텐션층과 전체 어텐션층을 3:1로 교차 배치하는 하이브리드 구조입니다. 3개 선형층이 국소 패턴을, 1개 전체층이 글로벌 의존성을 처리합니다. KV 캐시 메모리를 최대 75% 절감하고, 100만 token 디코딩에서 순수 전체 어텐션 대비 최대 6.3배 가속을 달성합니다. 가중치 shard 분석에서 64개 레이어 중 48개가 linear-attn, 16개가 full-attn임을 확인했습니다.
Attention Residuals(AttnRes)
AttnRes는 잔차 연결에 선택적 검색을 도입해 깊은 층이 초기 층의 고가치 표현을 직접 참조합니다. Moonshot은 학습 효율 25% 향상, 연산 오버헤드 2% 미만을 보고합니다. K2 대비 전체 확장 효율 2.5배 향상의 핵심 요소입니다.
Stable LatentMoE
| 기술 | 역할 |
|---|---|
| Quantile Balancing | 라우터 점수 분위수 기반 전문가 할당, 휴리스틱 하이퍼파라미터 제거 |
| Per-Head Muon | 어텐션 헤드별 독립 최적화 |
| Sigmoid Tanh Unit(SiTU) | 활성화 함수 안정화 |
| Gated MLA | Multi-head Latent Attention, KV 압축 |
위 세 가지 혁신이 결합되어 K3는 DeepSeek V4 Pro(1.6T) 대비 파라미터 75% 상회, K2 대비 학습·추론 효율 모두 개선된 것으로 확인됩니다.
03 가중치 배포, 인프라 요구사항, 라이선스
K3 완전 가중치는 Hugging Face에서 git lfs 또는 huggingface-cli download로 받을 수 있습니다. Moonshot은 중국 내 Alibaba Cloud OSS 미러도 제공합니다. 다운로드 완료만으로는 추론이 불가하며, 아래 인프라 스택이 필요합니다.
| 배포 형태 | 최소 GPU | VRAM / 디스크 | 프레임워크 |
|---|---|---|---|
| BF16 전체 (tensor parallel) | 64× H200 141GB | ~5.6 TB NVMe | vLLM TP=64 |
| MXFP4 8-bit | 8× H200 | ~1.4 TB NVMe | vLLM / SGLang |
| NVFP4 Blackwell | 8× B200 192GB | ~1.2 TB NVMe | vLLM 0.8.2+ |
| 1M 컨텍스트 디코딩 | 위 + KV offload | 추가 200–400 GB | KDA KV 압축 활용 |
| 소비자 하드웨어 | 부적합 | — | API 또는 OpenRouter 권장 |
Moonshot은 공식 배포 가이드에서 64 GPU 슈퍼노드를 BF16 프로덕션 기준으로 제시합니다. MXFP4판은 8×H200 단일 노드에서 32K–128K 컨텍스트 추론이 가능하며, 1M 컨텍스트는 KV offload 또는 다중 노드 파이프라인이 필요합니다. Apple Silicon Mac 단독 로컬 배포는 메모리·대역폭 한계로 현실적이지 않습니다.
Moonshot Modified MIT License
7월 27일 Model Card에 명시된 라이선스는 Kimi K2와 동일한 Modified MIT입니다. 핵심 조항은 다음과 같습니다.
- 허용: 연구, 미세조정(SFT/RLHF/DPO), 자체 호스팅, 파생 모델 배포(동일 라이선스 상속)
- 제한: 월 1억 token 초과 상용 API 재판매는 Moonshot과 별도 계약 필요
- 금지: 미국 Entity List 등록 기업 사용, 군사·대량 감시·생물무기 개발 목적
- 면책: Moonshot은 모델 출력에 대한 책임을 부인하며, 사용자는 현지법 준수 책임
엄밀한 의미의 「완전 오픈소스(OSI)」는 아니지만, 가중치 다운로드·미세조정·자체 배포가 가능한 오픈웨이트 모델입니다. Llama 3 Community License나 DeepSeek V4 License와 유사한 상용 제한 구조입니다.
라이선스 조항은 미·중 지정학적 맥락을 반영합니다. 미국 Entity List 기업과 미국 정부 계약업체는 K3 가중치 사용 전 법무 검토가 필요합니다.
04 벤치마크 비교표와 7월 27일 이후 독립 검증
가중치 공개 직후 Artificial Analysis, LMSYS Org, EleutherAI 등이 K3-Instruct를 독립 harness로 재평가하기 시작했습니다. 초기 48시간 결과는 Moonshot 자체 보고와 대체로 일치하며, 일부 항목에서 ±1–2%p 편차가 관측되었습니다.
| Benchmark | Moonshot 공식 | 독립 재현(초기) | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| GPQA-Diamond | 93.5% | 92.8–93.2% | 92.6% | 94.1% |
| Terminal-Bench 2.1 | 88.3% | 87.6–88.1% | 84.6% | 88.8% |
| Program Bench | 77.8% | 76.9–77.4% | 76.8% | 77.6% |
| SWE Marathon | 42.0% | 40.5–41.8% | 35.0% | 39.0% |
| FrontierSWE | 81.2% | 79.8–80.6% | 86.6% | 71.3% |
| BrowseComp | 91.2% | 90.1–90.8% | 88.0% | 90.4% |
| DeepSearchQA (F1) | 95.0% | 93.8–94.5% | — | — |
| OmniDocBench | 91.1% | 90.3–90.9% | 89.8% | 85.8% |
| AA Intelligence Index v4.1 | 57.1 | 56.4–56.8 | 59.9 | 58.9 |
해석 포인트:
- SWE Marathon(42.0%): 장시간 지속 코딩 태스크에서 여전히 1위. 가중치 공개 후에도 독립 재현이 40%+를 확인했습니다.
- FrontierSWE: Fable 5(86.6%)가 여전히 리드. K3(81.2%)는 GPT-5.6 Sol(71.3%)을 크게 상회합니다.
- GPQA-Diamond: GPT-5.6 Sol(94.1%)이 1위, K3(93.5%)는 Fable 5(92.6%)를 소폭 상회합니다.
- 독립 재현 편차: harness 차이(Kimi Code vs 표준 OpenAI chat template)로 ±1–2%p는 정상 범위입니다.
| 모델 | 입력($/M) | 출력($/M) | 캐시 히트 | 컨텍스트 |
|---|---|---|---|---|
| Kimi K3 | $3.00 | $15.00 | $0.30 | 1M |
| Claude Opus 5 | $5.00 | $25.00 | — | 1M |
| Claude Fable 5 | ~$10.00 | ~$50.00 | — | 1M |
| GPT-5.6 Sol | $8.00 | $40.00 | — | 400K |
| DeepSeek V4 Pro | $1.74 | $3.48 | $0.145 | 128K |
K3 API는 Claude Sonnet 5와 동일 표준가($3/$15)이지만 컨텍스트는 5배입니다. 코딩 워크로드에서 캐시 히트율 90% 초과 시 실효 입력 비용은 $0.30/M 수준입니다.
05 미·중 AI 경쟁 맥락: 증류 논란과 오픈웨이트 공개
K3 가중치 공개는 순수 기술 이벤트가 아닙니다. 7월 16일–28일 타임라인을 정리하면 다음과 같습니다.
- 7/16: Kimi K3 API 출시, 7/27 가중치 공개 약속
- 7/22–23: 백악관 OSTP 국장 Michael Kratsios, Moonshot의 Claude 대규모 증류 및 GB300 무허가 수입 혐의 공개 비난
- 7/24: Ryan Greenblatt 분석 공개 — K3가 Claude라 자칭하며
claude-opus-4-5-20250929등 내부 배포 ID 노출 - 7/24: Anthropic Claude Opus 5 출시 — Fable 5 대비 절반 가격
- 7/27: K3 완전 가중치 Hugging Face 공개 — 약속 이행
백악관 혐의에는 공개 증거가 없었습니다. TechCrunch가 인터뷰한 독립 연구자들은 Fable 5 공개(7/1)와 K3 출시(7/16) 사이 2주로 깊은 증류는 타임라인상 비현실적이라고 반박했습니다.
「Fable 5는 7월 1일부터 공개됐습니다. 2주 만에 그만큼의 데이터를 증류하고 학습해 출시하는 것은 불가능합니다.」—— Braden Hancock, Laude Institute
Greenblatt 분석은 K3가 Claude 4.5 시대 배포 메타데이터를 재현한다는 간접 증거를 제시했지만, 증류를 직접 증명하지는 않았습니다. 데이터 오염, 유출된 시스템 프롬프트, 공개 소스 합성 데이터도 가능한 설명입니다.
| 차원 | 미국(Anthropic/OpenAI) | 중국(Moonshot/DeepSeek) |
|---|---|---|
| 플래그십 접근 | API 전용, Fable 5/Mythos 5 제한 배포 | API + 완전 가중치 공개 |
| 가격 전략 | Opus 5로 절반 가격화(7/24) | K3 $3/$15, DeepSeek 더 저가 |
| 컨텍스트 | 1M(Opus 5/Fable 5) | 1M(K3), 128K(DeepSeek V4) |
| 규제 리스크 | 증류 혐의, API 남용 제재 | 칩 수출 규제, Entity List |
| 오픈웨이트 규모 | 없음(클로즈드) | K3 2.8T 역대 최대 |
| 커뮤니티 신뢰 | 벤치마크 + API | 가중치 + 독립 검증 가능 |
7월 27일 가중치 공개는 Moonshot이 「투명성」 카드로 대응한 것으로 읽힙니다. 외부 연구자가 아키텍처·가중치·추론 결과를 직접 검증할 수 있게 되면서, 증류 논란은 「증거 기반 논쟁」 단계로 이동합니다. Anthropic은 2월 Moonshot의 340만 회 이상 비정상 API 상호작용을 지적한 바 있으나, K3 가중치 공개 이후 독립 감사 결과는 아직 나오지 않았습니다.
06 6단계 배포 가이드, FAQ, 프로덕션 환경 제언
K3 오픈웨이트 공개 이후 개발자가 취할 수 있는 경로는 API 연동(즉시)과 로컬 배포(대규모 GPU 필요) 두 가지입니다. 아래 6단계는 대부분 팀에 적용 가능한 실무 순서입니다.
- 워크로드 유형 결정: 일상 코딩 agent·장문서 분석은 K3 API($3/$15, 1M 컨텍스트)가 가장 빠릅니다. 극한 FrontierSWE는 Fable 5, 비용 최우선은 DeepSeek V4 Pro를 검토하세요.
- API Key 발급 및 연결 테스트: platform.kimi.ai에서 키 생성. OpenAI 호환
base_url="https://api.moonshot.ai/v1", 모델 IDkimi-k3로 연결성 확인. - OpenRouter 또는 공식 API 선택: OpenRouter
moonshotai/kimi-k3는 공식 가격에 마크업 없음. 엔터프라이즈 SLA가 필요하면 Moonshot 직접 계약. - 가중치 다운로드(선택): Hugging Face
moonshotai/Kimi-K3-Instruct-MXFP4— 8×H200 이상 환경에서만. BF16 전체는 64 GPU 슈퍼노드 필수. - 추론 스택 구성: vLLM 0.8.2+ 또는 SGLang 0.4.8+ 설치. tensor parallel, KV offload, KDA 캐시 압축 설정 적용.
- 컴플라이언스·라이선스 검토: Modified MIT의 Entity List·군사 사용 금지 조항 확인. 미국 정부 계약·크로스보더 고객이 있으면 provenance 리스크를 선정 문서에 기록하세요.
pip install vllm>=0.8.2
python -m vllm.entrypoints.openai.api_server \
--model moonshotai/Kimi-K3-Instruct-MXFP4 \
--tensor-parallel-size 8 \
--max-model-len 131072 \
--enable-chunked-prefill
Q: Kimi K3 완전 가중치는 어디에서 다운로드할 수 있습니까?
A: 2026년 7월 27일 Hugging Face moonshotai 조직에 Kimi-K3-Instruct, Kimi-K3-Base, MXFP4/NVFP4 양자화판이 공개되었습니다. vLLM 0.8.2+와 SGLang 0.4.8+에서 추론을 지원합니다.
Q: Kimi K3를 로컬에서 실행하려면 어떤 하드웨어가 필요합니까?
A: BF16 전체 가중치 기준 약 5.6TB 디스크와 64장 이상 H200/B200급 GPU 슈퍼노드가 필요합니다. MXFP4 양자화판은 약 1.4TB로 8×H200에서 단일 노드 추론이 가능합니다. 소비자 노트북이나 Mac mini 단독 배포에는 부적합합니다.
Q: Kimi K3 라이선스는 무엇입니까?
A: Moonshot Modified MIT License입니다. 연구, 미세조정, 자체 호스팅이 허용되며, 월 1억 token 초과 상용 API 재판매는 별도 계약이 필요합니다. 미국 Entity List 등록 기업과 군사·감시 목적 사용은 금지됩니다.
Q: Kimi K3 API 가격은 얼마입니까?
A: 입력 $3.00/백만 token, 출력 $15.00/백만 token입니다. 캐시 히트 입력은 $0.30/백만 token이며, 100만 token 컨텍스트에 길이 추가 요금이 없습니다.
Q: 백악관 증류 혐의 이후에도 K3 가중치가 공개된 이유는 무엇입니까?
A: Moonshot은 7월 16일 출시 당시 7월 27일 공개를 약속했고 일정을 유지했습니다. 독립 연구자들은 2주 타임라인으로 깊은 증류는 비현실적이라고 반박했습니다. Greenblatt 분석은 간접 증거를 제시했으나 증류를 직접 증명하지는 않았습니다.
Kimi K3 오픈웨이트 공개는 중국 AI가 「저가 시장 확보」에서 「지능 프론티어 + 투명성」으로 이동한 이정표입니다. API만으로 K3에 빠르게 접속할 수 있지만, Kimi Code형 agent, MCP Server, 전체 레포 분석 파이프라인을 7×24 가동하는 프로덕션 환경에는 장컨텍스트 Agent를 공유 VPS에서 돌릴 때 메모리 부족, 다중 모델 A/B 테스트에 안정 호스트 부재, 컴플라이언스 감사가 전용 인프라를 요구하는 숨은 비용이 남습니다. Kimi Code agent와 MCP 게이트웨이를 지속 가동하는 팀에는 JEXCLOUD 멀티 리전 베어메탈 Mac이 더 나은 선택입니다. Apple Silicon 통합 메모리 독점, 오버셀 지터 없음, launchd 상주 Agent 게이트웨이, 120초 프로비저닝. 노드와 가격은 JEXCLOUD 가격 페이지에서 확인하세요.