딥시크 V4-Pro 정식 출시, 이름은 그대로이고 중심은 에이전트입니다 | DAKER 커뮤니티

프리뷰가 끝났습니다. 2026년 8월 13일, 딥시크가 V4-Pro를 앱과 웹, API에 정식으로 올렸습니다. 모델 이름은 여전히 deepseek-v4-pro입니다. 겉으로는 조용한 업데이트처럼 보이지만, 실제로 달라진 지점은 이름이 아니라 이 모델이 겨냥하는 일의 성격입니다.

이번 정식 출시는 채팅 성능을 조금 다듬은 후속작이라기보다, 도구를 쓰고 여러 단계를 거쳐 일을 끝내는 에이전트 중심 제품을 본격적으로 내놓은 일에 가깝습니다. 공식 공지는 DeepSeek API Docs의 V4-Pro GA 공지에서 확인할 수 있고, 배경 설명은 환구시보 영문판, 사고 강도 설정은 Thinking Mode 가이드에 나와 있습니다. 아래에 나오는 벤치마크 점수와 위안 단가는 회사와 언론이 전한 숫자라는 점도 함께 봐야 합니다.

프리뷰가 끝났다. 딥시크 V4-Pro 정식

이번 정식 출시에서 실제로 바뀐 것

앱과 웹에서는 Expert Mode로 고를 수 있고, API에서는 모델 이름을 그대로 씁니다. 프리뷰에서 쓰던 호출을 바꿔 새 별칭을 외울 필요는 없습니다. 모델 이름은 같고, 내부적으로는 0813 빌드가 반영된 형태입니다. 환구시보는 전날 밤 API 문서가 프리뷰를 DeepSeek V4 Pro 0813으로 교체했다고 전했습니다.

퀵스타트도 deepseek-v4-flash와 deepseek-v4-pro를 유지한 채 각각 0731, 0813 빌드를 가리킵니다. 그래서 이번 업데이트를 볼 때 먼저 확인할 것은 모델 이름보다 설정과 연결 방식입니다. 특히 패스백, 사고 강도, 피크 시각이 핵심입니다.

이번 출시의 중심은 모델 이름이 아니라 에이전트 업그레이드입니다.

공식 공지는 실제 업무에 이득이 있는 큰 에이전트 업그레이드를 첫머리에 두고 있습니다. 환구시보가 인용한 분석도 같은 방향을 가리킵니다. 최전선 모델의 기준이 단순한 대화 실력보다 도구 사용, 코드 실행, 다단계 작업 완료 능력으로 옮겨가고 있다는 뜻입니다. V4-Pro 정식은 그 흐름을 제품으로 내놓은 사례로 읽는 편이 맞습니다.

연결 방식도 넓어졌습니다. 네이티브 OpenAI Responses API가 추가됐고, Codex 원클릭 설정도 공식 문장에 포함됐습니다. Chat Completions를 쓰던 팀은 이름을 유지하면 되고, Codex처럼 여러 번 도구를 부르는 루프를 돌리던 팀은 중간 변환 코드를 줄일 수 있습니다. Anthropic 형식 엔드포인트도 문서에 남아 있습니다. 다만 연결 방법이 늘어난 것과 실행 환경이 자동으로 좋아지는 것은 다른 이야기입니다. Claude Code, GitHub Copilot, OpenCode 같은 도구에서 백엔드로 붙일 수 있다는 안내는 퀵스타트에 있지만, 실제 오류 지점은 대개 연결 설정에서 나옵니다.

공식 문서가 발표한 범위는 앱, 웹, API 정식 출시입니다. 가중치 파일 공개나 라이선스 이야기는 이 범위 밖입니다.

사고 강도는 기본값에 맡기기보다 직접 고르는 편이 좋습니다

사고 강도는 Pro와 Flash 모두 low / high / max입니다. 공식 안내는 단순합니다. 단순 작업은 low, 매일 쓰는 에이전트는 high, 복잡한 일은 max입니다. thinking은 기본으로 켜져 있고, 기본 강도는 high입니다. Responses API에서는 none이 thinking off에 해당합니다. medium과 xhigh는 각각 high와 같게 처리됩니다.

이 설정이 중요한 이유는 비용과 지연 시간 때문입니다. 생각하는 데 쓴 토큰은 출력 토큰으로 청구됩니다. 겉으로 보이는 토큰 단가만 보고 계산하면, 도구를 여러 번 부르는 에이전트 루프에서는 실제 비용과 차이가 커질 수 있습니다. 같은 프롬프트라도 low, high, max에 따라 지연 시간과 출력 토큰이 달라집니다.

기본값이 high라는 사실만으로도 간단한 작업이 예상보다 비싸질 수 있습니다.

공식 기본값이 high인 이유는 매일 쓰는 에이전트를 염두에 뒀기 때문입니다. 하지만 모든 작업이 여기에 해당하는 것은 아닙니다. 분류나 추출처럼 짧은 작업은 low 또는 thinking off가 더 맞을 수 있고, 일상적인 에이전트 작업은 high, 긴 디버깅이나 여러 단계 작업은 max로 나누어 보는 편이 좋습니다.

여기에는 한 가지 실무상 함정도 있습니다. 도구를 쓰는 호출에서는 이후 요청마다 reasoning 내용을 그대로 되넘겨야 합니다. 공식 가이드가 이 점을 분명히 적고 있고, 빠지면 400 오류가 납니다. 프리뷰에서 reasoning을 버리고 다음 요청을 보내던 코드는 정식 출시 이후 먼저 여기서 실패할 가능성이 큽니다.

에이전트 루프를 이미 짜 둔 팀이라면 모델 비교보다 패스백 점검이 먼저입니다.

Codex를 붙일 경우에도 공식 원클릭 설정이 실제로 어느 정도까지 바로 동작하는지 확인이 필요합니다. 베이스 URL과 모델명만 바꾸면 되는지, 이미지와 파일 호출이 호환 표에 포함되는지, 텍스트 에이전트 루프인지부터 나눠 보는 편이 안전합니다.

긴 컨텍스트와 요금 체계는 따로 봐야 합니다

환구시보가 전한 스펙은 컨텍스트 100만 토큰, 최대 출력 38만 4천 토큰, thinking과 non-thinking 모두 지원입니다. 긴 에이전트 세션을 염두에 둔 숫자입니다. 다만 컨텍스트가 길다고 해서 비용이 저절로 낮아지는 것은 아닙니다. 실제로는 thinking과 도구 호출이 출력 토큰을 먼저 늘릴 수 있습니다.

그래서 컨텍스트 100만 토큰을 기본값처럼 쓰기보다, 작업에 필요한 만큼만 넣는 편이 맞습니다. 긴 문맥을 다룰 수 있다는 점과, 그만큼 넣는 것이 항상 경제적이라는 점은 다릅니다.

요금이 바뀌는 시각도 따로 있습니다. 공식 공지는 2026년 8월 16일 16:00 UTC부터 피크·오프피크를 적용한다고 밝혔습니다. 한국 시각으로는 8월 17일 오전 1시입니다. 오프피크는 피크의 50%입니다. 따라서 배치 평가, 야간 리팩터, 대량 문서 변환처럼 시간을 옮길 수 있는 작업은 단가를 크게 줄일 수 있지만, 실시간 서비스는 피크 단가를 기준으로 계산해야 합니다.

같은 모델이라도 시각이 다르면 청구서가 달라집니다.

위안 단가는 공식 공지 본문에 직접 적혀 있지 않습니다. 환구시보가 전한 값은 입력 100만 토큰 3위안, 출력 100만 토큰 6위안, 캐시 입력 100만 토큰 0.025위안입니다. 이 수치는 언론이 옮긴 값으로만 읽는 것이 맞습니다. 공식 문장의 오프피크 50%와 언론이 전한 위안 단가를 한 줄로 섞어 곧바로 자체 단가표처럼 쓰면 계산이 어긋날 수 있습니다.

캐시 입력 0.025위안 역시 반복 컨텍스트가 많은 에이전트 루프를 염두에 둔 숫자로 읽을 수 있습니다. 캐시를 쓰지 못하는 호출은 그 혜택을 그대로 받지 못합니다.

벤치마크 점수는 방향을 보여주지만, 곧바로 현장 성과를 뜻하지는 않습니다

딥시크가 올린 에이전트 표에서 Terminal-Bench 2.1은 87.9입니다. 환구시보는 같은 항목에서 Anthropic Claude Fable 5가 88이라고 적었습니다. DeepSWE는 62.7, NL2Repo는 61.5입니다. 이 숫자들이 가리키는 대상은 채팅 능력보다 터미널, 코드, 저장소를 다루며 일을 끝내는 능력입니다.

다만 이 점수는 공식 평가 환경에서 나온 회사 수치입니다. 프리뷰 대비 크게 올랐다는 정리도 여러 매체에 반복되지만, 독립 재현이 끝난 결과라고 보기는 어렵습니다. 환구시보에는 SemiAnalysis가 에이전트 작업에서 Nemotron 3 Ultra를 크게 앞선다고 평가했다는 언급도 있습니다. 이 역시 외부 평가의 헤드라인이지, 곧바로 각 팀의 완료율을 뜻하는 것은 아닙니다.

회사 점수표는 공식 평가 환경의 결과이지, 곧바로 당신 작업의 완료율은 아닙니다.

에이전트 성능은 도구, 권한, 재시도 방식, 평가 환경이 바뀌면 먼저 달라집니다. 그래서 87.9, 62.7, 61.5 같은 숫자는 방향을 읽는 데는 유용하지만, 실제 선정 기준은 각자의 저장소와 워크플로에서 다시 재본 결과여야 합니다.

이번 출시를 무엇으로 보면 안 되는가

이번 정식 출시는 채팅 모델의 작은 수정으로 보기 어렵습니다. 첫 줄부터 에이전트 업그레이드를 내세우고 있기 때문입니다. 동시에 이름 변경 공지도 아닙니다. 호출은 계속 deepseek-v4-pro로 남고, 퀵스타트도 그 이름을 유지한 채 0813 빌드를 가리킵니다.

또한 가중치 파일 공개 발표나 라이선스 발표로 읽을 일도 아닙니다. 공식 문서가 발표한 것은 앱, 웹, API 정식 출시입니다. 피크 시각 역시 모델을 바꾸는 요소가 아니라 요금이 달라지는 기준 시각입니다. 같은 0813이라도 언제 돌리느냐에 따라 비용이 달라집니다.

이번 주에 확인할 일

에이전트나 Codex처럼 여러 번 도구를 부르는 루프를 돌리는 팀이라면, 지금 쓰는 모델과 V4-Pro-0813을 같은 작업으로 다시 재보는 것이 좋습니다. 회사 점수표를 그대로 가져오기보다, 자신의 저장소와 도구 호출, 시간 제한 안에서 비교하는 편이 더 정확합니다. 승패를 가르는 기준도 순위 점수보다 완료율, 재시도 횟수, 작업당 토큰이어야 합니다.

정식 출시는 미리보기 종료이기도 합니다. 프리뷰 때 맞춰 둔 프롬프트와 타임아웃을 그대로 두면, 더 길어진 thinking이 먼저 예산을 넘길 수 있습니다. 그래서 이번 변화는 단순히 새 모델이 나왔다는 소식으로 끝내기보다, 자신의 작업으로 다시 재고, 요금이 바뀌는 시각을 확인하고, 사고 강도를 직접 고르는 일로 이어져야 합니다.

이번 업데이트의 핵심은 이름 확인이 아니라, 당신 작업으로 다시 재보는 데 있습니다.

세션 로그를 짧게 남긴다면 다섯 줄이면 충분합니다. 목표 한 문장, 지금 모델과 0813을 같은 작업으로 잰 건수, 사고 강도를 무엇으로 정했는지, 패스백이 400을 냈는지, 배치를 오프피크로 옮겼는지입니다. 이 정도만 있어도 소식 소비와 실제 운영 변경을 구분할 수 있습니다.

원문: DeepSeek API Docs — V4-Pro GA(2026-08-13) · Global Times · Thinking Mode · Quick Start

참고 자료

https://api-docs.deepseek.com/updates/
https://api-docs.deepseek.com/guides/thinking_mode
https://api-docs.deepseek.com/
https://www.globaltimes.cn/page/202608/1368125.shtml

여러분은 이번 V4-Pro 정식 출시에서 모델 성능보다 연결 방식과 운영 설정 중 무엇을 먼저 점검해 보실 생각인가요?