DeepSeek V4 Pro 0813

DeepSeek V4 Pro의 2026년 8월 13일 정식판과 에이전트 기능, 추론 모드, API 호환성과 이용 시 주의점을 설명합니다.

문서 기준

이 문서는 2026년 8월 14일 DeepSeek 공식 변경 기록, 모델 가격표, 추론 모드 문서와 공식 모델 카드를 확인해 작성했습니다. Jiminbox 운영자는 deepseek-v4-pro가 이름을 바꾸지 않은 채 DeepSeek-V4-Pro-0813로 갱신됐다고 확인했습니다. 출시 직후라 독립된 재현 평가는 충분히 쌓이지 않았으며, 아래 성능 수치는 별도로 표시하지 않은 경우 DeepSeek 자체 평가입니다.

현재 버전과 Jiminbox 연결

항목내용
DeepSeek 공식 버전DeepSeek-V4-Pro-0813
Jiminbox 모델 IDdeepseek-v4-pro
Jiminbox 이용 플랜MAX
출시 상태GA, 앱·웹·API 배포
컨텍스트100만 토큰
최대 출력38.4만 토큰
공식 API 기본 추론 모드사고 모드, high

호출 이름에 0813을 붙이지 않습니다. Jiminbox 앱이나 OpenAI 호환 프로그램에는 기존과 같은 deepseek-v4-pro를 입력합니다. DeepSeek 변경 기록 · DeepSeek 모델과 가격

Preview에서 달라진 점

DeepSeek가 0813 정식판에서 발표한 변화는 다음 네 가지입니다.

  1. 정식 GA 전환: V4 Pro를 앱, 웹과 API에 함께 배포했습니다.
  2. 에이전트 능력 강화: 코드 저장소, 터미널, 도구 호출과 실제 운영 환경을 겨냥한 후처리 성능을 높였다고 설명합니다.
  3. Responses API와 Codex 지원: OpenAI Responses API 형식을 공식 지원하고 Codex용 연결 구성을 제공합니다.
  4. 추론 강도 조절: low, high와 max를 작업 난이도에 따라 선택할 수 있습니다.

0813 변경 기록은 모델 구조가 바뀌었다고 설명하지 않습니다. 따라서 아키텍처가 새로 설계됐다고 단정할 근거는 없습니다. 공식 V4 Pro 모델 카드는 계열 구조를 1.6조 전체 매개변수와 490억 활성 매개변수를 사용하는 MoE로 설명합니다. DeepSeek V4 Pro 공식 모델 카드

V4 Pro 계열의 구조

공식 모델 카드와 기술 보고서는 V4 Pro 계열을 다음과 같이 설명합니다.

  • 전체 매개변수 1.6조, 요청당 활성 매개변수 490억의 MoE 구조입니다.
  • Compressed Sparse Attention과 Heavily Compressed Attention을 결합한 하이브리드 어텐션을 사용합니다.
  • Manifold-Constrained Hyper-Connections로 신호 전달 안정성을 보완합니다.
  • Muon 옵티마이저를 사용하고 32조 개가 넘는 토큰으로 사전 학습했습니다.
  • 100만 토큰 컨텍스트를 지원합니다.
  • 공개 모델 저장소와 가중치는 MIT 라이선스로 표시됩니다.

이 내용은 V4 Pro 계열의 공개 모델 카드에 관한 설명입니다. API의 0813 버전이 별도의 아키텍처 변경을 포함했다는 뜻은 아닙니다. 또한 공식 저장소는 모델 이름을 DeepSeek-V4-Pro로 제공하며, 검토 시점에는 다운로드 파일에 0813을 별도 체크포인트 이름으로 표시하지 않았습니다. DeepSeek V4 Pro 공식 모델 카드 · DeepSeek V4 기술 보고서

에이전트 평가를 읽는 방법

DeepSeek는 0813 출시 공지에서 Pro Preview, Flash 계열과 네 개의 동시대 프론티어 모델을 같은 표에 비교했습니다. 아래 수치는 모두 DeepSeek가 공개한 공급사 자체 평가이며 독립 평가가 아닙니다. 같은 벤치마크의 행 안에서 모델 간 차이를 살피는 용도로만 사용합니다. 서로 다른 벤치마크의 점수 크기를 직접 비교하면 안 됩니다. DeepSeek V4 Pro 0813 출시 공지 · DeepSeek 변경 기록

에이전트 평가는 모델만의 시험이 아닌 경우가 많습니다. 예를 들어 Agents’ Last Exam은 모델, 실행 도구, 메모리, 컨텍스트 관리와 행동 반복 구조를 합친 전체 에이전트 구성을 평가합니다. 같은 모델도 실행 환경과 추론 강도에 따라 결과가 달라질 수 있습니다. Agents’ Last Exam 설명

비교표의 범위

DeepSeek의 표에서 -는 점수가 공개되지 않은 항목입니다. Fable 5 (w/fallback)은 폴백을 포함한 실행 구성이므로 순수한 단일 모델과 완전히 같은 조건이라고 보기 어렵습니다. DSBench-FullStack과 DSBench-Hard는 DeepSeek 내부 데이터셋이라 외부에서 문제 구성과 채점 조건을 독립적으로 확인할 수 없습니다.

Pro Preview에서 얼마나 향상됐는가

0813 정식판과 이전 Pro Preview의 공개 수치를 직접 비교하면 다음과 같습니다. 차이는 백분율이 아니라 표에 표시된 점수의 단순 차이입니다.

평가Pro PreviewPro 0813점수 차이
HLE, 도구 없음37.742.7+5.0
HLE, 도구 사용48.260.0+11.8
Terminal Bench 2.172.187.9+15.8
NL2Repo38.561.5+23.0
CyberGym52.783.3+30.6
DeepSWE12.862.7+49.9
Toolathlon-Verified55.974.1+18.2
Agents’ Last Exam16.525.7+9.2
AutomationBench Public12.831.8+19.0
DSBench-FullStack41.871.1+29.3
DSBench-Hard31.167.2+36.1

DeepSeek가 공개한 모든 항목에서 0813 점수가 Preview보다 높습니다. 가장 큰 상승은 장기 저장소 수정 능력을 보는 DeepSWE, 내부 고난도 에이전트 평가인 DSBench-Hard, 보안 취약점 재현을 보는 CyberGym에서 나타났습니다. 도구를 사용한 HLE는 11.8점 올랐고 도구가 없는 HLE는 5.0점 올랐습니다. 이 차이는 0813 개선이 지식 문제 풀이뿐 아니라 도구를 이용하는 작업에도 집중됐다는 정황으로 읽을 수 있지만, 학습 방식의 인과관계를 증명하지는 않습니다.

4월 Preview는 당시 Claude·GPT·Gemini와 어땠는가

DeepSeek는 2026년 4월 Preview 발표에서 당시 비교 대상인 Claude Opus 4.6 Max, GPT-5.4 xHigh와 Gemini 3.1 Pro High를 별도 표에 함께 실었습니다. 에이전트 작업과 관련된 항목을 옮기면 다음과 같습니다.

평가Pro Preview MaxOpus 4.6 MaxGPT-5.4 xHighGemini 3.1 Pro High
HLE37.740.039.844.4
SWE-bench Verified80.680.880.880.6
Terminal Bench 2.067.965.475.168.5
Toolathlon51.847.254.648.8

Preview는 SWE-bench Verified에서 비교 모델들과 거의 같았고, Toolathlon에서는 Opus 4.6과 Gemini 3.1 Pro보다 높았지만 GPT-5.4보다 낮았습니다. Terminal Bench 2.0에서도 Opus 4.6보다 높고 Gemini 3.1 Pro와 비슷했지만 GPT-5.4보다 낮았습니다. HLE는 세 비교 모델보다 낮았습니다. 즉 Preview도 일부 에이전트 과제에서 경쟁력을 보였지만 분야를 가리지 않고 앞선 모델은 아니었습니다. DeepSeek V4 Pro Preview 발표

이 표는 4월 당시의 모델과 평가 버전을 보여 주는 역사적 비교입니다. 0813 출시표에는 GPT와 Gemini가 포함되지 않았고 Terminal Bench와 Toolathlon의 버전도 바뀌었습니다. 따라서 이 표를 이용해 0813이 현재 GPT나 Gemini보다 높다고 연결해서 판단하면 안 됩니다.

동시대 프론티어 모델과 비교

다음 표는 DeepSeek의 0813 출시표에서 Pro 0813과 비교 모델만 옮긴 것입니다. 이 표 역시 DeepSeek 자체 실행 결과입니다.

평가Pro 0813GLM-5.2Kimi K3Opus 4.8Fable 5, 폴백 포함
HLE, 도구 없음 / 사용42.7 / 60.040.5 / 54.743.5 / 56.049.8 / 57.953.3 / 63.0
Terminal Bench 2.187.981.088.385.088.0
NL2Repo61.548.9-69.7-
CyberGym83.3-80.078.383.1
DeepSWE62.746.267.558.070.0
Toolathlon-Verified74.159.976.576.277.9
Agents’ Last Exam25.723.827.625.7-
AutomationBench Public31.812.930.827.229.1
DSBench-FullStack71.161.873.771.677.2
DSBench-Hard67.254.563.071.768.3

이 표가 보여 주는 위치는 다음처럼 해석하는 편이 정확합니다.

  • 터미널 작업은 최상위권에 가깝습니다. 87.9점은 Kimi K3보다 0.4점, Fable 5 폴백 구성보다 0.1점 낮고 Opus 4.8보다 2.9점 높습니다.
  • 업무 자동화와 보안 재현이 강점으로 나타납니다. AutomationBench Public은 비교표에서 가장 높고, CyberGym도 점수가 공개된 비교 대상 가운데 가장 높습니다.
  • 저장소 작업은 과업에 따라 순위가 달라집니다. NL2Repo는 Opus 4.8보다 낮지만 GLM-5.2보다 높습니다. DeepSWE는 Opus 4.8보다 높고 Kimi K3와 Fable 5보다 낮습니다.
  • 범용 지식에서는 단독 선두가 아닙니다. 도구 없는 HLE는 Kimi K3, Opus 4.8과 Fable 5보다 낮습니다. 도구를 사용한 HLE는 Fable 5 다음이며 나머지 세 비교 모델보다 높습니다.
  • 여러 앱을 오가는 도구 작업은 프론티어권이지만 최고점은 아닙니다. Toolathlon-Verified에서는 Kimi K3, Opus 4.8과 Fable 5보다 2.1~3.8점 낮습니다.

따라서 0813을 모든 분야에서 가장 높은 모델이라고 설명할 수는 없습니다. 다만 Preview에서 모든 공개 항목이 상승했고, 터미널, 업무 자동화, 보안과 장기 소프트웨어 작업에서 비교 대상과 경쟁할 수 있는 범위에 들어왔다는 해석은 가능합니다. 이는 DeepSeek의 자체 표를 바탕으로 한 문서의 종합 판단입니다.

각 벤치마크가 측정하는 능력

벤치마크실제로 시키는 일0813 점수를 읽는 의미
Humanity’s Last Exam, HLE수학, 과학, 인문학 등 여러 분야의 전문가 수준 폐쇄형 문제를 풉니다. 도구 없음과 도구 사용 결과를 따로 제시합니다.42.7은 모델 자체의 고난도 지식·추론 성능을, 60.0은 외부 도구를 활용했을 때의 결과를 보여 줍니다. 실제 업무 자동화 점수와 같은 뜻은 아닙니다. HLE 논문
Terminal Bench 2.189개의 현실적인 명령줄 과제에서 설치, 빌드, 디버깅과 시스템 작업을 수행합니다.87.9는 주어진 실행 환경에서 터미널 과제를 높은 비율로 완료했다는 뜻입니다. 모델과 에이전트 실행 도구의 조합에 민감합니다. Terminal Bench 2.1 설명
NL2Repo빈 작업공간과 자연어 요구사항만 받고 설치 가능한 Python 라이브러리 전체를 구성합니다.61.5는 파일 하나의 코드 생성보다 구조 설계, 의존성 연결과 여러 모듈 구현에 관한 신호입니다. NL2Repo 논문
CyberGym188개 실제 프로젝트에서 수집한 취약점을 분석하고, 취약점을 재현하는 입력이나 테스트를 만듭니다.83.3은 보안 결함의 원인을 찾아 재현하는 능력에 관한 점수입니다. 생성한 코드가 전반적으로 안전하다는 보증은 아닙니다. CyberGym
DeepSWE91개 오픈소스 저장소의 113개 장기 소프트웨어 과제를 해결합니다. 다섯 개 언어와 여러 파일에 걸친 변경을 포함합니다.Preview의 12.8에서 62.7로 오른 변화는 0813에서 가장 큰 공개 상승폭입니다. 실제 저장소의 복잡한 수정 능력이 크게 개선됐다는 공급사 평가 신호입니다. DeepSWE 논문
Toolathlon-Verified32개 앱과 604개 도구를 사용해 여러 앱을 오가는 108개 장기 작업을 수행합니다. 과제는 평균 약 20회의 상호작용이 필요하며 실행 결과로 검증합니다.74.1은 도구 선택, 순서 계획과 오류 복구를 포함한 교차 앱 작업 능력을 나타냅니다. Verified는 2026년 6월 과제와 평가 인프라를 수정·검증한 현재 버전입니다. Toolathlon
Agents’ Last Exam, ALE55개 산업 분야의 장기 전문 업무에서 실제 소프트웨어를 사용하고 검증 가능한 결과물을 만듭니다.25.7은 완성된 전문 업무의 요구사항을 충족한 정도에 관한 신호입니다. 모델, 하네스, 도구와 메모리를 합친 전체 시스템 평가라 모델 단독 점수로 보면 안 됩니다. Agents’ Last Exam
AutomationBench Public영업, 마케팅, 운영, 지원, 재무와 인사의 600개 공개 과제를 47개 모의 SaaS 도구에서 처리합니다.31.8은 최종 앱 상태의 모든 검증 조건을 만족한 엄격한 완료율에 가깝습니다. 공개 과제 점수이며 별도의 비공개 공식 리더보드와 같지 않습니다. AutomationBench
DSBench-FullStack / HardDeepSeek가 에이전트 평가에 사용한 내부 데이터셋입니다. 공개 공지에는 세부 과제와 채점기가 공개되지 않았습니다.71.1과 67.2는 같은 DeepSeek 표 안의 상대 비교에만 사용합니다. 공개 자료만으로 실제 과업 범위나 재현성을 판단할 수 없습니다. DeepSeek 변경 기록

Preview의 다른 공개표와 섞지 않습니다

4월 Preview 발표에는 Terminal Bench 2.0과 기존 Toolathlon 점수가 실렸습니다. 0813 출시표는 수정된 Terminal Bench 2.1과 Toolathlon-Verified를 사용하므로, 두 발표의 숫자를 그대로 빼서 향상폭으로 계산하지 않습니다. 위 Preview 비교표는 DeepSeek가 0813 출시표 안에서 같은 평가 버전으로 다시 제시한 값만 사용했습니다. DeepSeek V4 Pro Preview 발표

어떤 작업에 적합한가

공개 평가와 모델 구조를 바탕으로 보면 Pro 0813은 다음 작업에서 우선 비교할 가치가 있습니다.

  • 여러 파일을 읽고 수정하며 테스트까지 이어 가는 저장소 작업
  • 터미널과 함수 도구를 여러 차례 호출하는 장기 에이전트 작업
  • 긴 문서와 코드베이스에서 서로 떨어진 정보를 연결하는 분석
  • 세계 지식과 복잡한 추론이 함께 필요한 기술 조사
  • Flash에서 실패하거나 수정 횟수가 많았던 고난도 작업의 재시도

이 목록은 DeepSeek의 설명과 공급사 평가를 바탕으로 한 활용 제안입니다. 실제 Jiminbox 작업에서의 결과는 프롬프트, 도구, 입력 길이와 앱의 요청 방식에 따라 달라집니다. 같은 작업을 Flash와 Pro에 각각 실행하고 정확도, 수정 횟수와 Usage Logs의 차감량을 비교하는 편이 안전합니다.

추론 강도 선택

DeepSeek 공식 API는 low, high와 max를 지원하며 사고 모드의 기본값은 high입니다.

추론 강도먼저 적용할 작업고려할 점
low간단한 수정, 빠른 확인과 반복 작업응답과 추론 비용을 줄이는 데 유리합니다.
high일반적인 코딩 에이전트, 계획과 복잡한 질의기본값이며 대부분의 일상 에이전트 작업에 적합합니다.
max가장 어려운 디버깅, 장기 계획과 고난도 추론더 많은 시간과 토큰을 사용할 수 있으므로 작은 범위에서 먼저 비교합니다.

사고 모드에서는 temperature, top_p, presence_penaltyfrequency_penalty를 보내도 적용되지 않습니다. 함수 도구를 호출한 뒤 다음 요청을 보낼 때는 이전 응답의 reasoning_content를 함께 전달해야 하며, 누락하면 공식 DeepSeek API에서 400 오류가 발생할 수 있습니다. DeepSeek Thinking Mode

Jiminbox에서 먼저 확인할 항목

Jiminbox New API가 reasoning_effortthinking 매개변수를 상류와 같은 방식으로 전달하는지는 확인되지 않았습니다. 앱에서 선택지가 보이더라도 짧은 요청과 Usage Logs로 실제 동작을 먼저 확인합니다.

API 형식과 도구 지원

DeepSeek 공식 가격표에서 Pro 0813은 다음 기능을 지원합니다.

  • OpenAI Chat Completions 형식
  • OpenAI Responses API 형식
  • Anthropic API 형식
  • JSON 출력
  • 함수 도구 호출
  • Chat Prefix Completion Beta
  • 비사고 모드의 FIM Completion Beta

Responses API는 DeepSeek 직접 API에서 Codex와 연결하기 위해 추가된 기능입니다. Jiminbox에서는 함수 호출과 MCP 도구 연동을 사용할 수 있지만 JSON, FIM, Responses API의 세부 호환성은 확인되지 않았습니다. 상류 기능과 Jiminbox 제공 범위를 구분합니다. DeepSeek 모델과 가격 · DeepSeek Codex 연결 안내

Jiminbox에서 사용하기

  1. jiminbox.com에 로그인하고 서비스 → New API를 엽니다.
  2. MAX 계정의 모델 목록deepseek-v4-pro가 표시되는지 확인합니다.
  3. New API Key와 사용량 가이드에 따라 앱별 New API Key를 만듭니다.
  4. 앱의 모델 ID에 deepseek-v4-pro를 입력합니다.
  5. 짧은 요청을 보낸 뒤 Usage Logs에서 모델 ID와 차감량을 확인합니다.

OpenAI 호환 Chat Completions를 직접 확인할 때는 다음처럼 요청합니다.

curl https://api.jiminbox.com/v1/chat/completions \
  -H "Authorization: Bearer ${JIMINBOX_API_KEY}" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-pro",
    "messages": [
      {"role": "user", "content": "이 저장소를 검토할 때 먼저 확인할 항목을 세 가지로 정리해 줘."}
    ]
  }'

API 키를 명령 기록, 화면 캡처나 공개 저장소에 남기지 않습니다. 안전한 입력 방법과 첫 요청 확인 절차는 New API Key와 사용량 가이드에서 설명합니다.

DeepSeek 직접 API 가격 변경

다음 가격은 Jiminbox 크레딧이 아니라 DeepSeek가 직접 판매하는 API의 100만 토큰당 가격입니다.

적용 시점구간캐시 입력일반 입력출력
2026년 8월 16일 16:00 UTC 전단일 가격$0.003625$0.435$0.87
이후비혼잡 시간$0.022$0.66$1.98
이후혼잡 시간$0.044$1.32$3.96

새 가격은 한국 시간으로 2026년 8월 17일 오전 1시에 적용될 예정입니다. 혼잡 시간은 한국 시간 오전 10시부터 오후 1시, 오후 3시부터 오후 7시까지이며 나머지는 비혼잡 시간입니다. 가격은 바뀔 수 있으므로 DeepSeek 직접 API를 사용하는 경우 공식 가격표를 다시 확인합니다.

Jiminbox 차감과 구분합니다

Jiminbox는 자체 New API 표시 단가와 플랜 크레딧을 사용합니다. DeepSeek 직접 API 가격이 바뀌었다고 해서 같은 금액이 Jiminbox에 자동으로 적용된다고 단정할 수 없습니다. Jiminbox에서 실제로 차감되는 값은 New API 모델 목록과 Usage Logs를 기준으로 확인합니다.

확인된 한계와 남은 검증

  • 출시 직후라 0813 정식판의 독립된 재현 평가가 충분하지 않습니다.
  • DeepSeek 자체 평가에는 내부 데이터셋과 별도 에이전트 실행 환경이 포함됩니다.
  • 공식 모델 저장소는 V4 Pro 가중치를 제공하지만, 검토 시점에는 파일 이름에 0813 체크포인트를 별도로 표시하지 않았습니다.
  • DeepSeek 직접 API의 Responses, JSON, FIM과 추론 강도 기능이 Jiminbox New API에서 모두 같은 방식으로 동작하는지는 확인되지 않았습니다.
  • 모델 구성, 단가와 라우팅은 바뀔 수 있으므로 중요한 작업 전에는 현재 모델 목록과 Usage Logs를 확인합니다.

출처와 다음 단계

다음 단계: Flash와 Pro 비교로 돌아가기 · Jiminbox 모델 선택 가이드 · New API Key와 사용량 가이드