DeepSeek V4 풀스펙 GA 정식 출시: 가격·아키텍처·GPT-5.6 성능 격차 완전 분석
3개월을 기다린 끝에 DeepSeek V4 풀스펙(GA 정식판)이 2026년 7월 20일 정식 출시되었습니다. 4월 프리뷰 대비 Agent 능력·수학 추론·코드 생성이 강화되었고, 최초 피크·오프피크 과금이 도입되었습니다. DeepSeek이 「거의 무료」에서 규율 있는 상용 운영으로 전환한 신호입니다.
AI 개발자·인디 개발자·엔터프라이즈 엔지니어를 위해 본 글은 세 가지를 답합니다. ① 프리뷰→GA 타임라인과 아키텍처 혁신(CSA+HCA, mHC, Muon);② SWE-bench Verified 80.6% 포함 전량 benchmark와 GPT-5.6, Claude Fable 5 횡단 비교;③ 피크·오프피크 과금 절약법과 7월 24일 deepseek-chat / deepseek-reasoner 영구 중단 전 API 마이그레이션 가이드입니다.
01 DeepSeek V4 풀스펙 타임라인: 프리뷰에서 GA까지 무엇이 바뀌었나
개발자가 직면하는 핵심 과제는 다음과 같습니다.
- 구 API명 곧 폐기:
deepseek-chat,deepseek-reasoner는 7월 24일 영구 중단. 프로덕션 코드 미이전 시 즉시 서비스 중단. - 피크·오프피크 과금 복잡도: GA판 최초 시간대별 요금. 평일 피크 시 요금 2배, 배치 작업 미스케줄 시 숨은 비용 증가.
- 클로즈드 소스 플래그십 비용 압박: Claude Fable 5 출력 $50/M, GPT-5.6 Sol 약 $15/M. 고빈도 Agent 호출 청구 부담.
- 장컨텍스트 실운영 난이도: 다수 모델이 1M token을 표방하나 KV Cache 메모리로 실배포 비용 극대.
| 시점 | 이벤트 |
|---|---|
| 2026-04-24 | V4 프리뷰 출시·오픈소스(MIT), V4-Pro(1.6T)·V4-Flash(284B) 포함 |
| 2026-05 | V4-Flash·V4-Pro 프로덕션 튜닝판 출시, API 정식 가용 |
| 2026-06 | V4-Pro 가격 영구 75% 인하(출력 $0.87/M tokens) |
| 2026-06-29 | 전체 API 사용자에 이메일, 7월 중순 GA·피크·오프피크 과금 최초 공개 |
| 2026-07-19 | 다수 개발자 GA 그레이 테스트 자격, 언론 「풀스펙 내일 출시」 보도 |
| 2026-07-20 | GA 정식판 출시(본문 게시일) |
| 2026-07-24 | 구 API명 deepseek-chat, deepseek-reasoner 영구 중단 |
한 줄 요약: V4 프리뷰는 이미 강력했고, 풀스펙은 Agent·수학 추론·코드 생성을 추가 강화하며 정식 상용 과금 체계를 갖췄습니다.
02 DeepSeek V4 기술 아키텍처: 1M 컨텍스트를 어떻게 실현하나
| 사양 | V4-Pro | V4-Flash |
|---|---|---|
| 총 파라미터 | 1.6조(1.6T) | 2840억(284B) |
| 토큰당 활성 파라미터 | 490억(49B) | 130억(13B) |
| Transformer 레이어 | 61층 | 43층 |
| 컨텍스트 윈도우 | 1,000,000 tokens | 1,000,000 tokens |
| 최대 출력 | 384K tokens | 384K tokens |
| 정밀도 | FP4(전문가 가중치)+FP8(기타) | FP4+FP8 혼합 |
| 사전학습 데이터 | 33T+ tokens | 32T+ tokens |
| 오픈소스 라이선스 | MIT | MIT |
하이브리드 어텐션(CSA + HCA)
DeepSeek V4는 V2/V3 시대 MLA(Multi-head Latent Attention)를 폐기하고 두 가지 신규 어텐션의 하이브리드를 채택했습니다.
- Compressed Sparse Attention(CSA): KV 시퀀스를 Softmax 게이트 풀링으로 4배 압축. FP4 「라이트닝 인덱서」로 top-k 희소 선택(Pro top-1024, Flash top-512). 최근 128 token 슬라이딩 윈도우 유지. 1M 컨텍스트 추론 FLOPs는 V3.2의 27%.
- Heavily Compressed Attention(HCA): 토큰 128배 압축 후 글로벌 밀집 어텐션으로 장거리 의존 포착. Flash는 초기 2층 HCA, 이후 CSA/HCA 교차. Pro도 유사 구조.
종합 효과: 1M token 시나리오 KV Cache 메모리는 V3.2의 10%(V4-Flash 7%).
Manifold-Constrained Hyper-Connections(mHC)
기존 잔차 연결을 업그레이드해 4채널 잔차 스트림 도입. 이중확률 행렬 제약(Birkhoff 다면체)을 만족하는 혼합 행렬로 61층 심층 네트워크에서 신호 안정 전파를 보장합니다.
Muon 옵티마이저
학습에 Muon 옵티마이저(AdamW 아님) 채택. 뉴턴-슐츠 직교화로 기울기 처리, 수렴 가속·학습 안정화.
| 모드 | 특징 | 적용 시나리오 |
|---|---|---|
| Non-think | 사고 체인 없음, 초고속 응답 | 단순 Q&A, 라우팅 |
| Think High | 명시적 추론(<redacted_thinking> 태그) | 중간 복잡도 태스크, 코드 디버깅 |
| Think Max | 최대 추론 강도, 384K+ 컨텍스트 필요 | 복잡 수학, 장체인 Agent |
공식 권장 샘플링 파라미터: temperature=1.0, top_p=1.0(전 모드 공통). 로컬 배포는 ds4 고메모리 Mac 추론 가이드 참고.
03 DeepSeek V4 Benchmark: 오픈소스 최강 성적표
| 벤치마크 | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% | 96.0% | 개별 미공개 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
SWE-bench Verified는 실제 GitHub 저장소 버그 수정을 측정합니다. 80.6%는 현재 오픈소스 모델 최고점으로 Gemini 3.1 Pro와 동률입니다. SWE-bench Pro는 더 엄격하며 Claude Fable 5가 80.3%로 선두입니다.
가성비 횡단 비교(Artificial Analysis):
- Claude Fable 5: Strategy & Ops 지수 태스크당 $3.48, 50점
- DeepSeek V4-Pro: 동급 태스크당 $0.03, 38점
- DeepSeek V4-Flash: 6류 지수 태스크 모두 $0.04 미만
Fable 5 비용은 V4-Pro의 116배이나 점수는 약 12점(31%)만 높습니다. 대다수 프로덕션 시나리오에서 V4-Pro 가성비가 압도적입니다.
04 DeepSeek V4 vs GPT-5.6: 포지셔닝 차이와 피크·오프피크 과금 계산
| 차원 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| 오픈소스/셀프호스팅 | MIT, 지원 | 클로즈드 | 클로즈드 |
| 컨텍스트 윈도우 | 1M tokens | 미공개 | 1M tokens |
| 코드 능력 | 극강(Fable 5 근접) | 극강 | 최강 |
| API 출력가(오프피크) | $0.87/M | ~$15/M | $50/M |
| 피크 출력가 | $1.74/M | — | — |
| 데이터 프라이버시 | 프라이빗 배포 가능 | — | — |
시나리오 선정: 예산 제한/고빈도 호출/프라이빗 배포 → V4-Pro 또는 V4-Flash;극한 코드 능력 → Claude Fable 5;복잡 알고리즘+수학 추론 → GPT-5.6 Sol/Ultra;초대규모 로그 처리 → V4-Flash(캐시 히트 입력 $0.0028/M).
| 모델 | 과금 항목 | 오프피크(Off-Peak) | 피크(Peak) |
|---|---|---|---|
| V4-Pro | 입력(캐시 히트) | ¥0.025 / $0.0035 / 1M | 2배 |
| 입력(캐시 미스) | ¥3.00 / $0.435 / 1M | ¥6.00 / $0.87 | |
| 출력 | ¥6.00 / $0.87 / 1M | ¥12.00 / $1.74 | |
| V4-Flash | 입력(캐시 히트) | ¥0.02 / $0.0028 / 1M | 2배 |
| 입력(캐시 미스) | ¥1.00 / $0.14 / 1M | ¥2.00 / $0.28 | |
| 출력 | ¥2.00 / $0.28 / 1M | ¥4.00 / $0.56 |
피크 시간대(베이징 시간): 평일 09:00–12:00, 14:00–18:00. 절약 전략: 비실시간 태스크 오프피크 스케줄;Prompt Cache 활용;단순 태스크 V4-Flash 분산;DeepSeek은 과금 변경 24시간 전 이메일 통지 약속. 피크에도 V4-Pro 출력 $1.74/M은 Claude Opus 4.8($15/M) 대비 8.6배 저렴.
05 deepseek-chat 중단: 7월 24일 전 API 마이그레이션 6단계 가이드
중요 경고: 구 모델명 deepseek-chat, deepseek-reasoner는 2026년 7월 24일 15:59 UTC(베이징 시간 7월 24일 23:59)에 영구 중단됩니다.
| 구 모델명 | 신 모델명 | 비고 |
|---|---|---|
deepseek-chat | deepseek-v4-flash(비사고 모드) | 고속, 경량 태스크 |
deepseek-reasoner | deepseek-v4-flash(사고 모드) | 또는 deepseek-v4-pro 업그레이드 |
6단계 마이그레이션:
- 전체 코드베이스 검색:
deepseek-chat,deepseek-reasoner모든 참조 검색. - 교체 전략 결정: 경량 대화 →
deepseek-v4-flash;복잡 추론 →deepseek-v4-pro+Think High/Max. - OpenAI SDK 호출 업데이트:
model만 변경,base_url은https://api.deepseek.com유지. - 사고 모드 설정: 기존 reasoner 사용자는
extra_body로 thinking 활성화. Think Max는 384K+ 컨텍스트 필요. - 스테이징 환경 검증: 7월 24일 전 프리프로덕션에서 핵심 유스케이스 통과, 지연·비용 확인.
- 피크·오프피크 청구 모니터링: 이전 후 베이징 시간 기준 배치 스케줄, 캐시 히트로 입력 비용 절감.
client.chat.completions.create(model="deepseek-chat", messages=[...])
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
V4는 OpenAI ChatCompletions·Anthropic Messages 형식 모두 지원. Anthropic SDK도 model만 업데이트, base_url="https://api.deepseek.com" 불변.
인용 가능 핵심 데이터(DeepSeek 공식, 2026-07-20):
- SWE-bench Verified: 80.6%, 오픈소스 최고, Gemini 3.1 Pro 동률
- KV Cache 효율: 1M 컨텍스트 V3.2의 10%(Flash 7%)
- 가성비: V4-Pro 단건 $0.03 vs Fable 5 $3.48, 비용차 116배
- 피크 출력: V4-Pro $1.74/M, Opus 4.8 대비 8.6배 저렴
- 마이그레이션 마감: 2026-07-24 23:59(베이징 시간) 구 API 영구 중단
- 데이터 출처: DeepSeek 공식 문서, arXiv:2606.19348, HuggingFace, Artificial Analysis
06 풀스펙이 기대할 만한가? 요약과 프로덕션 환경 정리
DeepSeek V4 GA 정식판은 2026년 오픈소스 LLM 분야 최중요 마일스톤 중 하나입니다. 가치는 Claude Fable 5·GPT-5.6을 이기는 것(아직은 아님)이 아니라, 클로즈드 플래그십 1/10~1/100 비용으로 오픈소스 최강 성능을 제공하는 데 있습니다.
적합 대상: 데이터 반출 우려 기업, 예산 제한 인디 개발자, 1M token 컨텍스트 Agent 엔지니어, 극한 가성비 AI 제품팀. 피크·오프피크 과금은 비용 복잡도를 높이나 본질적으로 여전히 경쟁력 극대. DeepSeek의 「가격 파괴자」→「규칙 있는 상용 플랫폼」 전환은 성숙 신호이지 후퇴가 아닙니다.
아직 deepseek-chat을 쓰고 있다면 7월 24일 전 API 마이그레이션을 완료하세요. 그렇지 않으면 서비스가 중단됩니다.
순수 API 호출로 V4에 빠르게 접속할 수 있으나, 1M 컨텍스트 Agent를 공유 VPS에서 돌리면 메모리 부족, 피크 시간대 배치 추론에 안정 스케줄 호스트 부재, 로컬 MIT 가중치 추론에 고통합 메모리 하드웨어 필요라는 세 가지 숨은 비용이 있습니다. 7×24 DeepSeek Agent 파이프라인, ds4 로컬 추론, 장컨텍스트 MCP Server 프로덕션 환경에서는 JEXCLOUD 다리전 베어메탈 Mac이 더 나은 선택입니다. Apple Silicon 통합 메모리 독점, 오버셀 지터 없음, launchd 상주 게이트웨이, 120초 배포. 노드·가격은 JEXCLOUD 가격 페이지 참고.