AI Agent 오픈소스 LLM 2026.08.05

DeepSeek V4 Flash 정식 출시: 벤치마크 Opus 4.8 근접, 가격은 수십 분의 일, Pro 버전은 아직 대기

7월 31일 DeepSeek는 V4-Flash를 정식 버전 DeepSeek-V4-Flash-0731로 업그레이드했습니다. 파라미터 규모는 그대로 두고 재후학습만 진행했지만, Agent 벤치마크에서는 더 큰 V4-Pro 프리뷰를 넘어섰고, 가격은 Claude Opus 4.8의 수십 분의 일입니다. 플래그십 V4-Pro 정식 버전과 자체 Agent 프레임워크 Harness는 아직 공개되지 않았습니다.

AI 개발자와 모델 선정 담당자를 위해 본 글에서는 다음 세 가지를 다룹니다. ① 4월 프리뷰부터 7월 31일 「정식 버전」까지의 전체 타임라인, ② 가격·아키텍처·Harness 핵심 데이터와 Kimi K3, Qwen3.8-Max 횡단 비교, ③ 점수 논쟁·「斩杀线」가격전·6단계 안전 도입 체크리스트. 데이터 기준일은 2026-08-05입니다.

01 4월 프리뷰에서 7월 「정식 버전」까지: 타임라인과 핵심 과제

이번 출시는 새 모델 공개가 아니라, 동일한 284B 총 파라미터 / 13B 활성 모델에 대한 재후학습입니다. 진정한 플래그십 V4-Pro 정식 버전과 DeepSeek 최초 자체 Agent 프레임워크 Harness는 현재 「곧 공개」 상태이며 확정 일정은 없습니다.

  • 2026년 4월 24일: DeepSeek-V4 프리뷰 최초 공개 및 오픈소스. V4-Pro(1.6T/49B)와 V4-Flash(284B/13B) 포함, 100만 token 컨텍스트, MIT 라이선스.
  • 2026년 7월 24일: 구 API deepseek-chat, deepseek-reasoner 공식 중단, 전 트래픽 V4 시리즈 명명으로 전환.
  • 2026년 7월 27일: Kimi K3(2.8T 총 파라미터) 오픈 웨이트 Hugging Face 공개, DeepSeek에 경쟁 압력.
  • 2026년 7월 31일: V4-Flash-0731 정식 버전 API 공개 베타, 오픈 웨이트 Hugging Face 동기 공개. changelog에서 자체 Agent 프레임워크 Harness 최초 명시. 이번 베타는 API만 해당, App·웹 미동기.
  • 2026년 8월 5일 기준: V4-Pro 정식 버전은 여전히 「가능한 한 빨리 공개」. 국내 언론이 익명 소스를 인용해 GA 창이 8월 10–20일일 수 있다고 보도했으나, DeepSeek 공식 미확인 참고 정보입니다.

개발자가 직면하는 핵심 과제는 다음과 같습니다.

  • 플래그십 미이행: V4-Pro 정식과 Harness 공개일 없음. Pro 능력에 의존하는 프로덕션은 프리뷰 계속 사용 필요.
  • 점수 방법 민감성: Agent 벤치마크는 미공개 Harness 「미니멀 모드」로 측정, 공식도 단순 능력 향상과 동일시하지 말라고 경고.
  • API와 소비자 단 분리: 0731 정식은 API만, App/웹은 구버전으로 경험 불일치.
  • 경쟁사 집중 출시: Qwen3.8-Max(8/2 GA), Kimi K3(7/27 웨이트), GPT-5.6 가격 인하가 동시기 선정 창 압박.

284B 파라미터 Flash 버전이 여러 Agent 벤치마크에서 수 배 큰 V4-Pro 프리뷰를 넘어섰습니다. 2026년 하반기 대규모 모델 경쟁에서 후학습 품질의 중요성이 단순 파라미터 적층에 근접하거나 이를 넘어서고 있습니다.

02 DeepSeek V4-Flash-0731 핵심 데이터 요약

주요 오픈소스 LLM 가격·파라미터 비교 (2026-08-05)
모델 상태 총/활성 파라미터 컨텍스트 입력 단가 (미적중/적중 $/M) 출력 단가 $/M 라이선스
DeepSeek-V4-Flash-0731공식 정식(7/31)284B / 13B1M$0.14 / $0.0028$0.28MIT
DeepSeek-V4-Pro프리뷰(정식 미출시)1.6T / 49B1M$0.435 / $0.003625$0.87MIT
Kimi K3웨이트 오픈(7/27)2.8T / ~104B~1.05M$3.00 / $0.30$15.00Modified MIT
GLM-5.2오픈소스(2026년 6월)~744B / ~40B1M미확인미확인MIT
Qwen3.8-MaxAPI GA(8/2), 웨이트 대기2.4T / 95B1M$2.00 / ~$0.17–0.25$6.00오픈소스 약속

위 가격은 모두 각사 공개 데이터입니다. DeepSeek는 향후 API에 「피크 시간 2배 요금」(베이징 시간 9–12시, 14–18시)을 도입 예고했으며, 작성 시점 기준 구체 시행일은 미발표입니다.

03 아키텍처는 동일, 변한 것은 후학습: CSA+HCA와 Harness 최초 공개

V4-Flash-0731은 파라미터 규모·모델 구조 모두 4월 프리뷰와 완전히 동일하며, 성능 향상은 「재후학습」에서만 발생합니다. 기술 보고서 『DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence』에 따르면 V4 시리즈 아키텍처 핵심 변경 3가지는 다음과 같습니다.

  • 하이브리드 어텐션: 압축 희소 어텐션(CSA)과 고도 압축 어텐션(HCA) 결합, 외부에는 DSA 희소 어텐션으로 통일. 장컨텍스트 연산·VRAM 부담 감소.
  • 다양체 제약 하이퍼커넥션(mHC): 기존 잔차 연결 구조 개선.
  • Muon 옵티마이저: 기존 옵티마이저 교체, 수렴 속도·안정성 향상.

공식 지표: 100만 token 컨텍스트에서 V4-Pro는 전대 V3.2 대비 1 token 추론 FLOPs 27%, KV Cache 점유 10%. 독립 제3자 재현은 아직 확인되지 않았습니다.

DeepSeek Harness는 7월 31일 changelog에서 최초 공식 명칭이 붙은 자체 Agent 실행 프레임워크로, 파일 읽기/쓰기·도구 호출·명령 실행·엔드투엔드 엔지니어링 작업을 담당하며 Claude Code에 대응합니다. 그동안 DeepSeek 모델은 주로 Claude Code, OpenCode 등 제3자 Agent 도구에 의존했습니다.

공식 Agent 점수(Terminal Bench 2.0 82.7점, V4-Pro 프리뷰 67.9점 상회)는 모두 Harness 「미니멀 모드」 측정. 파라미터는 max, top_p=0.95, temperature=1.0입니다. DeepSeek는 changelog에서 「점수는 harness 선택에 매우 민감하며 모델 능력 향상과 단순 동일시할 수 없다」고 명시했습니다.

DeepSeek 공식 Agent 벤치마크 비교 (자사 공표, Harness minimal mode)
벤치마크 Flash-0731 Flash 프리뷰 V4-Pro 프리뷰 Opus 4.8
Terminal Bench 2.182.761.872.185.0
NL2Repo54.239.438.569.7
DeepSWE54.47.312.858.0
Toolathlon-Verified70.349.755.976.2

04 중국 오픈소스 LLM 「육각 혼전」: 주전장은 가성비

Artificial Analysis 독립 평가와 태스크당 비용 (제3자 데이터)
모델 총 파라미터 Intelligence Index 태스크 평균 비용
DeepSeek-V4-Flash-0731DeepSeek284B50$0.03
Kimi K3月之暗面2.8T57$0.86
GLM-5.2智谱/Z.ai~744BV4-Flash보다 약 1점 높음미확인
GPT-5.6 SolOpenAI비공개V4-Flash보다 9점 이상 높음$1.86
Claude Fable 5Anthropic비공개V4-Flash보다 9점 이상 높음$3.15

데이터 출처: Intelligence Index와 태스크 비용은 Artificial Analysis(제3자 독립 평가)를 경제 매체가 인용. DeepSeek 공식 점수는 자사 공표로 평가 방법·가중치가 일치하지 않아 본문에서 분리 기재합니다.

흥미로운 대비: Artificial Analysis 종합 지수에서 V4-Flash 지능 점수는 최고가 아니며 Kimi K3, GLM-5.2에 뒤집니다. 그러나 태스크당 비용은 Kimi K3의 약 1/29, GPT-5.6 Sol의 약 1/62, Claude Fable 5의 약 1/105입니다. DeepSeek가 노리는 것은 「점수 1위」가 아니라 「충분한 지능 + 극한 가격」이며, V4-Flash 프리뷰가 OpenRouter에서 7주 연속 호출량 1위였던 이유도 여기에 있습니다.

중국어 개발자 커뮤니티에는 「斩杀线」(kill line)이라는 말이 유통됩니다. DeepSeek가 「충분한 성능 + 극단적 저가」로 동종에 진입 장벽을 세우고, 성능으로 명확히 넘서지 못하면서 더 낮은 가격도 제시 못 하는 모델은 시장에서 사라진다는 뜻입니다.

05 점수 논쟁, 6단계 도입, 인용 가능 데이터

과대 해석을 피하기 위해 명확히 표기해야 할 사항은 다음과 같습니다.

  • 점수는 Harness 의존: Agent 점수는 미공개 Harness 미니멀 모드 기반. 독립 커뮤니티 재현 전까지 「자사 공표 + 특정 프레임워크」 결과로 봐야 합니다.
  • 가용성 이슈: 21세기 경제 보도가 해외 개발자 피드백을 인용해, 정식 버전에서 입력 캐시 적중률 낮음, 안전 분류기 간헐적 타임아웃 등을 보도했습니다.
  • V4-Pro 출시 시기 미확인: 「8월 10–20일 GA」 등은 익명 소스 유래. DeepSeek 공식 changelog 원문은 「가능한 한 빨리 공개」뿐입니다.
  • 투자 유치 보도는 신중히: 약 74억 달러 투자, 487억 달러 밸류에이션 등은 주로 「보도에 따르면」「소식통」 단계이며 공식·규제 신고 확인 없음.

V4-Flash-0731 안전 도입 6단계:

  1. API 명명 확인: deepseek-v4-flash 모델 ID 사용. 이 별칭은 0731 정식을 자동 가리킵니다. 중단된 deepseek-chat/deepseek-reasoner 사용 시 즉시 전환하세요.
  2. API Key 발급: DeepSeek 오픈 플랫폼에서 키 생성, 잔액·과금 방식(향후 피크 2배 요금 예고 포함) 확인.
  3. 호환 프로토콜 선택: OpenAI ChatCompletions·Anthropic 형식 지원. 기존 툴체인에 맞게 base_url 선택, 클라이언트 코드 변경 불필요.
  4. 샌드박스 A/B 비교: 자사 업무 prompt로 Kimi K3 / Qwen3.8-Max 블라인드 테스트. 벤더 점수표만으로 프로덕션 이전 금지.
  5. Harness 공개 주시: Agent 작업은 Harness 공개 후 공식 벤치마크 재현, Claude Code / Cursor 등 제3자 프레임워크 교차 검증.
  6. 로컬 배포 계획: MIT 웨이트 Hugging Face 공개(deepseek-ai/DeepSeek-V4-Flash-0731). 284B MoE는 대용량 Apple Silicon 또는 데이터센터급 GPU 클러스터 필요.
deepseek_v4_flash_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_deepseek_api_key",
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Review this Agent workflow..."}],
    temperature=1.0,
    top_p=0.95
)

인용 가능 핵심 데이터 (출처: DeepSeek 공식, Artificial Analysis, 2026-08-05):

  • 파라미터: 284B 총 / 13B 활성, 아키텍처 4월 프리뷰와 완전 동일
  • 가격: 입력 $0.14/M(캐시 미적중), $0.0028/M(적중); 출력 $0.28/M
  • Terminal Bench 2.1: 82.7(자사 공표, Harness minimal mode)
  • Artificial Analysis 독립 평가: Terminal-Bench 2.1 약 78.65%, 공식 82.7과 차 4.05점
  • 가성비: 태스크당 $0.03, Kimi K3의 약 1/29, Claude Fable 5의 약 1/105
  • 장컨텍스트 효율: 100만 token에서 FLOPs V3.2의 27%, KV Cache 10%(공식)
  • 가격 비교: Claude Opus 4.8 대비 캐시 미적중 입력 약 36배 저렴, 적중 약 179배, 출력 약 89배(각사 공표가)
  • 오픈소스: MIT, 웨이트 Hugging Face 동기화

06 FAQ, 업계 배경, 프로덕션 정리

Q: DeepSeek V4와 V3.2의 가장 큰 차이는?
A: 100만 token 컨텍스트 네이티브 지원, 장컨텍스트 연산·VRAM 부담 대폭 감소(공식: V4-Pro 100만 token에서 FLOPs V3.2의 27%, KV Cache 10%). V4 시리즈는 Agent 능력 특화 최적화.

Q: 일상적으로 V4 Flash vs V4 Pro?
A: 일반 대화·배치·대규모 저비용 Agent 파이프라인은 V4-Flash-0731 가성비 우수, Agent 점수도 V4-Pro 프리뷰 상회. 더 깊은 세계 지식·복잡 추론에 예산 여유 있으면 당분간 V4-Pro 프리뷰, 정식 출시 후 재평가.

Q: V4 Pro 정식 지금 쓸 수 있나?
A: 작성 시점 기준 아직 불가. 정식은 V4-Flash-0731만 API 한정. V4-Pro 정식·Harness는 공식 「가능한 한 빨리 공개」. 「8월 10–20일」은 미확인 루머.

Q: DeepSeek 공표 점수 그대로 믿어도 되나?
A: SWE-bench Verified 등 제3자 벤치마크는 신뢰도 높음. Terminal Bench 2.0 등 Agent 점수는 미공개 Harness 측정. Claude Code, Cursor 등 독립 재현 후 결론 권장.

Q: 일반 개발자 실무 영향?
A: OpenAI / Anthropic 형식 API면 코드 변경 불필요. deepseek-v4-flash가 신버전 자동 지정. 구 명명은 조속히 전환.

V4 정식 출시 전 중국어 AI 커뮤니티는 梁文锋를 「梁白开」(기다림의 언어유희)로 놀렸습니다. V4-Flash-0731 출시 후 기대를 넘는 성능으로 「梁圣」 호칭이 되돌아오고 있습니다. 더 주목할 것은 「斩杀线」 효과로, 동시기 GPT-5.6 Luna 80% 인하 등 밀집 가격 조정을 설명합니다. 7월 31일 당일 NVIDIA·Broadcom·AMD 등 연산 칩 주가에 뚜렷한 변동 없었고, 시장은 「DeepSeek식 효율 돌파」 내러티브에 익숙해지고 있습니다.

순수 API 호출은 진입 장벽이 낮지만, 장시간 Agent는 공유 VPS에서 메모리 지터·장연결 끊김에 취약하고, 284B 웨이트 로컬 배포에는 96GB+ 통합 메모리가 필요하며, 다중 툴체인 병렬에는 7×24 안정 호스트가 부족합니다. OpenClaw, Claude Code, Cursor Agent 원격 게이트웨이를 지속 가동하는 프로덕션에는 JEXCLOUD 다리전 베어메탈 Mac이 적합합니다. Apple Silicon 통합 메모리 전용, 대역 초과 판매 지터 없음, launchd 상주 Agent, 120초 배포. 노드와 가격은 JEXCLOUD 요금 페이지를 참고하세요.