작성 : Shai | AI Harness Developer
지난 글에서는 GPT·Claude·Gemini·DeepSeek의 대표 모델을 같은 기준으로 놓고 전체적인 API 비용을 비교해봤어요. 네 회사의 가격 차이를 먼저 보고 싶다면 아래 글을 참고해보세요.
→ 2026년 하반기 AI API 가격 비교 : GPT·Claude·Gemini·DeepSeek 100만 토큰 비용 총정리
2026년 하반기 AI API 가격 비교 : GPT·Claude·Gemini·DeepSeek 100만 토큰 비용 총정리
Shai | AI Harness Developer AI 서비스를 처음 만들 때는 아무래도 모델 성능부터 보게 돼요. 저도 새로운 모델이 나오면 벤치마크나 코딩 성능, 추론 능력부터 확인하는 편인데요. 그런데 실제 서비스
shai-devit.tistory.com
DeepSeek는 정말 “압도적으로 싸다”고만 보면 될까요?
AI API 가격을 비교하다 보면 DeepSeek는 유독 눈에 들어와요.
입력 100만 토큰에 몇십 센트라는 숫자를 처음 보면
“이 정도면 그냥 DeepSeek를 쓰는 게 낫지 않나?”
라는 생각이 들 수 있죠.
저도 API 가격표를 확인할 때 가장 먼저 보는 건 100만 토큰당 단가예요. 그런데 실제 서비스 운영비를 계산할 때는 거기서 끝내지 않습니다.
DeepSeek는 같은 모델이라도 피크와 오프피크 시간대에 따라 가격이 달라지고, 입력 토큰도 캐시에 적중했는지 여부에 따라 비용 차이가 꽤 커요.
여기에 Thinking Mode를 사용하면 화면에 보이는 최종 답변뿐 아니라 추론 과정에서도 토큰이 사용될 수 있습니다.
그래서 단순히
“DeepSeek는 싸다.”
라고 기억하는 것만으로는 실제 비용을 제대로 계산하기 어려워요.
이번 글에서는 2026년 10월 1일 기준 DeepSeek API 가격을 공식 개발자 문서를 기준으로 정리해볼게요.
현재 API에서 확인되는 DeepSeek-V4.1-Flash와 DeepSeek-V4-Pro-0813의 100만 토큰 가격부터 한국시간 기준 피크·오프피크 시간, Context Caching, 실제 서비스 사용량에 따른 비용까지 같이 살펴보겠습니다.
앞선 글에서는 GPT·Claude·Gemini·DeepSeek 전체 가격을 비교하고 OpenAI, Claude, Gemini를 각각 따로 살펴봤는데요.
이번 DeepSeek 편까지 보면 주요 AI API 네 곳의 가격 구조가 어느 정도 연결될 거예요.
현재 DeepSeek API는 어떤 모델을 제공할까요?
현재 DeepSeek 공식 가격 페이지에는 deepseek-flash와 deepseek-v4-pro가 표시되어 있어요.
deepseek-flash를 호출하면 실제 제공되는 모델은 DeepSeek-V4.1-Flash입니다.
예전 deepseek-v4-flash와 deepseek-v4-flash-vision-exp라는 이름도 당분간 호환되지만, 기존 모델 자체는 종료됐고 요청은 V4.1 Flash로 처리됩니다.
V4.1 Flash와 V4 Pro 모두 최대 100만 토큰의 컨텍스트 길이와 최대 384K 출력을 지원합니다. V4.1 Flash는 이미지 이해도 지원하지만 현재 V4 Pro는 Vision을 지원하지 않아요.
한 가지 헷갈릴 만한 부분도 있습니다.
V4.1 Flash 발표 당시에는 V4 Pro를 단계적으로 종료할 계획이라는 안내가 있었지만, 이후 DeepSeek는 사용자 요청을 반영해 V4 Pro API 제공을 계속하기로 변경했습니다. 현재 공식 Models & Pricing 페이지에도 V4 Pro가 별도 모델과 가격으로 표시되어 있어요. DeepSeek API Docs
AI 모델은 이런 식으로 제공 정책이 빠르게 바뀔 수 있기 때문에 과거 기사보다 현재 공식 가격 페이지를 기준으로 보는 게 가장 안전해요.
DeepSeek 모델별 100만 토큰 가격은 얼마일까요?
DeepSeek의 가격표는 다른 AI 회사보다 조금 더 자세히 봐야 합니다.
같은 입력 토큰이라도 캐시에 적중했는지에 따라 가격이 달라지고, 여기에 피크와 오프피크 가격도 별도로 존재하기 때문이에요.
| V4.1 Flash | 피크·캐시 미적중 | $0.30 | $1.20 |
| V4.1 Flash | 오프피크·캐시 미적중 | $0.15 | $0.60 |
| V4.1 Flash | 피크·캐시 적중 | $0.006 | - |
| V4.1 Flash | 오프피크·캐시 적중 | $0.003 | - |
| V4 Pro | 피크·캐시 미적중 | $1.32 | $3.96 |
| V4 Pro | 오프피크·캐시 미적중 | $0.66 | $1.98 |
| V4 Pro | 피크·캐시 적중 | $0.044 | - |
| V4 Pro | 오프피크·캐시 적중 | $0.022 | - |
모두 100만 토큰 기준이에요. DeepSeek는 현재 오프피크 가격을 피크 가격의 절반으로 책정하고 있습니다. DeepSeek API Docs
그래서 DeepSeek API 가격을 설명하면서
“V4.1 Flash 입력 가격은 0.15달러다.”
라고만 적어도 정확하지 않고,
“입력은 0.30달러다.”
라고만 적어도 부족해요.
둘 다 맞는 가격이지만 사용하는 시간대가 다르기 때문입니다.
여기에 캐시까지 들어가면 차이가 더 커집니다.
V4.1 Flash의 피크 시간 캐시 미적중 입력은 100만 토큰당 0.30달러인데, 캐시 적중 입력은 0.006달러예요.
단순 단가만 놓고 보면 무려 50배 차이입니다.
한국에서는 몇 시에 사용해야 저렴할까요?
DeepSeek 공식 문서에서 정한 피크 시간은 월요일부터 금요일까지 UTC 기준
01:00~04:00, 06:00~10:00
입니다.
한국은 UTC보다 9시간 빠르기 때문에 한국시간으로 바꾸면 평일 기준
오전 10시~오후 1시
그리고
오후 3시~오후 7시
가 피크 시간이에요.
그 외 시간은 오프피크입니다.
주말은 전체 시간이 오프피크이고 중국 공휴일 역시 피크 시간에서 제외된다고 공식 가격표에 안내되어 있어요. DeepSeek API Docs
이 가격 구조는 실시간 챗봇보다 작업 시간을 조정할 수 있는 서비스에서 특히 의미가 있습니다.
고객이 지금 질문하는데
“API 가격이 비싸니까 밤에 답변드릴게요.”
라고 할 수는 없겠죠.
반면 수만 건의 문서를 요약하거나, 데이터를 분류하거나, 다음 날 사용할 보고서를 새벽에 만들어두는 작업이라면 이야기가 달라져요.
굳이 피크 시간에 처리할 이유가 없습니다.
제가 DeepSeek API 가격을 계산한다면 실시간 요청과 예약 가능한 작업을 처음부터 분리해서 볼 것 같아요.
같은 모델과 같은 토큰 사용량이라도 처리 시간만 조정할 수 있다면 비용이 절반까지 달라지기 때문입니다.
입력 1,000만 토큰을 사용하면 실제로 얼마가 나올까요?
이번에는 실제 사용량을 넣어볼게요.
한 달 동안
입력 1,000만 토큰,
출력 500만 토큰
을 사용한다고 가정하겠습니다.
우선 캐시는 전혀 적중하지 않는다는 보수적인 조건이에요.
V4.1 Flash를 모두 피크 시간에 사용하면 입력 비용은 3달러, 출력 비용은 6달러로 총 9달러가 됩니다.
같은 작업을 모두 오프피크에 처리한다면 입력은 1.50달러, 출력은 3달러로 총 4.50달러까지 내려가요.
V4 Pro는 같은 사용량에서 피크 기준 입력 13.20달러와 출력 19.80달러를 합쳐 33달러입니다.
오프피크라면 입력 6.60달러와 출력 9.90달러로 총 16.50달러예요.
같은 DeepSeek API를 사용하는데도 모델과 시간대에 따라 4.50달러에서 33달러까지 차이가 납니다.
그래서
“DeepSeek 1,000만 토큰 쓰면 얼마예요?”
라는 질문에도 모델과 시간대를 먼저 확인해야 정확하게 답할 수 있어요.
사용자가 1,000명이라면 비용 차이는 더 커져요
지난 OpenAI, Claude, Gemini 글과 같은 조건으로 계산해볼게요.
사용자 1,000명이 하루에 AI를 10번 사용하고, 요청 한 번에 입력 1,000토큰과 출력 1,000토큰이 발생한다고 가정하겠습니다.
30일 동안 입력과 출력이 각각 약 3억 토큰 발생해요.
V4.1 Flash를 모두 피크 시간에 사용한다고 가정하면 입력은 90달러, 출력은 360달러로 월 450달러입니다.
전부 오프피크에서 처리할 수 있다면 입력 45달러와 출력 180달러로 총 225달러예요.
V4 Pro는 같은 조건에서 피크 기준 약 1,584달러, 오프피크에서는 약 792달러가 됩니다.
실제 서비스에서는 요청이 하루 종일 분산되기 때문에 전부 피크 또는 전부 오프피크가 되는 경우는 많지 않겠죠.
그래도 이 계산을 해보면 서비스가 커졌을 때 발생할 수 있는 비용의 범위를 쉽게 파악할 수 있습니다.
DeepSeek API 가격의 특징은 기본 단가가 낮다는 것뿐 아니라, 처리 시간을 조정할 수 있는 서비스라면 추가적인 비용 절감이 가능하다는 점이에요.
Context Caching은 직접 설정해야 할까요?
DeepSeek의 Context Caching은 다른 서비스와 비교했을 때 꽤 편리한 구조예요.
공식 문서에 따르면 디스크 기반 Context Caching은 모든 사용자에게 기본으로 활성화되어 있습니다.
따라서 별도의 캐시 API를 직접 구현하지 않아도 조건이 맞으면 캐시가 적용돼요. DeepSeek API Docs
예를 들어 AI에게 매번 같은 회사 규정이나 제품 매뉴얼을 보여주고 마지막 질문만 바뀌는 서비스를 생각해볼게요.
이전 요청과 새로운 요청의 앞부분이 저장된 캐시 단위와 정확하게 일치한다면 해당 부분이 캐시 적중으로 처리될 수 있습니다.
실제 API 응답에서는 prompt_cache_hit_tokens와 prompt_cache_miss_tokens를 통해 얼마나 많은 입력이 캐시에서 처리됐는지도 확인할 수 있어요. DeepSeek API Docs
V4.1 Flash의 오프피크 가격을 보면 캐시 미적중은 100만 토큰당 0.15달러인데 캐시 적중은 0.003달러입니다.
차이가 상당하죠.
하지만 여기서
“한 번 요청한 프롬프트는 앞으로 무조건 캐시되겠네.”
라고 생각하면 안 돼요.
DeepSeek는 Context Caching을 best-effort 방식으로 제공하며 100% 캐시 적중을 보장하지 않습니다. 사용하지 않는 캐시는 보통 몇 시간에서 며칠 사이에 자동으로 제거돼요. DeepSeek API Docs
따라서 DeepSeek API 가격을 예상할 때 모든 입력을 캐시 적중 단가로 계산하기보다는 실제 운영 후 캐시 적중률을 확인해서 반영하는 편이 안전합니다.
Thinking Mode를 켜면 가격도 올라갈까요?
현재 V4.1 Flash와 V4 Pro는 모두 Thinking Mode와 Non-thinking Mode를 지원합니다.
기본 설정은 Thinking Mode이고 reasoning effort를 low, high, max로 조절할 수도 있어요. DeepSeek API Docs
그런데 공식 가격표에는
“Thinking 사용 시 토큰당 가격 추가”
같은 별도 단가는 없습니다.
그렇다고 Thinking을 많이 사용해도 실제 비용이 항상 같다는 뜻은 아니에요.
DeepSeek Responses API에서는 출력 사용량과 함께 추론에 사용된 reasoning_tokens도 별도로 확인할 수 있고, 최대 출력 토큰에는 사용자에게 보이는 답변과 추론 토큰이 함께 포함됩니다. DeepSeek API Docs
즉 별도의 ‘추론 할증’이 붙는다기보다, 복잡한 문제에서 추론 토큰 자체가 많아지면 출력 토큰 사용량이 늘어나면서 최종 비용도 커질 수 있다고 이해하면 됩니다.
간단한 데이터 분류까지 전부 max reasoning으로 처리한다면 낮은 API 단가의 장점을 스스로 줄일 수도 있어요.
예전에 쓰던 DeepSeek 모델명은 어떻게 됐을까요?
DeepSeek는 최근 모델 변경이 많아서 오래된 블로그나 예제 코드를 보면 꽤 헷갈릴 수 있습니다.
현재 Flash 모델의 공식 호출명은 deepseek-flash예요.
예전 deepseek-v4-flash와 deepseek-v4-flash-vision-exp를 사용해도 당분간 호환되지만 실제 요청은 V4.1 Flash로 처리됩니다. DeepSeek API Docs
DeepSeek API는 OpenAI 형식과 Anthropic 형식도 지원하고 있어 기존 SDK와 호환되는 형태로 사용할 수 있습니다. DeepSeek API Docs
과거 모델명과 예전 가격을 그대로 참고하기보다는 실제 서비스 적용 전에는 최신 Models & Pricing과 Change Log를 한 번 확인하는 게 좋아요.
DeepSeek가 가장 싸다면 무조건 선택하면 될까요?
V4.1 Flash 가격은 분명 매력적입니다.
특히 오프피크 캐시 미적중 기준으로 입력 100만 토큰당 0.15달러, 출력 0.60달러라는 숫자는 상당히 낮아요.
하지만 모델 선택을 토큰 가격 하나만으로 끝내기는 어렵습니다.
같은 작업에서 얼마나 자주 재시도해야 하는지, Thinking Token이 얼마나 발생하는지, 원하는 품질이 나오는지, 이미지 이해나 도구 사용 같은 기능이 필요한지도 함께 봐야 해요.
예를 들어 한 번에 작업을 끝내는 모델이 세 배 비싸더라도 저렴한 모델에서 네 번 재시도해야 같은 결과를 얻는다면 실제 작업 비용은 뒤집힐 수 있습니다.
저도 이런 가격을 비교할 때 “100만 토큰 최저가가 얼마인가?”보다
“원하는 결과 한 건을 만드는 데 총 얼마가 드는가?”
를 더 중요하게 봐요.
OpenAI, Claude, Gemini를 살펴봤을 때와 마찬가지로 DeepSeek에서도 이 기준은 같습니다.
DeepSeek는 ‘시간’과 ‘캐시’까지 계산해야 해요
2026년 10월 1일 기준 DeepSeek API 가격에서 가장 눈에 띄는 모델은 V4.1 Flash예요.
캐시 미적중 기준으로 피크 시간에는 입력 100만 토큰당 0.30달러, 출력 1.20달러이고 오프피크에는 각각 0.15달러와 0.60달러입니다.
V4 Pro도 현재 공식 가격 페이지에서 계속 제공되고 있으며, 피크 기준 캐시 미적중 입력은 1.32달러, 출력은 3.96달러예요. 오프피크에서는 입력 0.66달러, 출력 1.98달러로 내려갑니다. DeepSeek API Docs
결국 DeepSeek의 실제 운영비를 계산할 때는 모델만 볼 게 아니라 시간대, 캐시 적중률, 입력·출력 비율, 추론 토큰 사용량까지 함께 봐야 합니다.
낮은 단가는 분명 큰 장점이에요.
하지만 실제 서비스를 만든다면 대표 작업 몇 개를 정해 직접 테스트하고, 작업 성공률과 토큰 사용량을 함께 측정해보는 것이 가장 확실합니다.
AI API 가격과 모델 제공 정책은 바뀔 수 있으니 실제 서비스에 적용하기 전에는 DeepSeek 공식 가격 페이지를 다시 확인해주세요.
가격 확인 기준일 : 2026년 10월 1일
참고한 공식 자료 : DeepSeek Models & Pricing / DeepSeek-V4.1-Flash Release / Context Caching / Thinking Mode / DeepSeek API Change Log
'AI서비스' 카테고리의 다른 글
| 2026 AI API 가성비 비교 : GPT·Claude·Gemini·DeepSeek, 같은 성능이면 어디가 가장 저렴할까? (0) | 2026.10.03 |
|---|---|
| 2026 Gemini API 가격 비교 : Gemini 모델별 100만 토큰 비용은 얼마일까? (0) | 2026.10.01 |
| 2026 Claude API 가격 비교 : Claude 모델별 100만 토큰 비용은 얼마일까? (0) | 2026.09.30 |
| 2026 OpenAI API 가격 비교 : OpenAI 모델별 100만 토큰 비용은 얼마일까? (0) | 2026.09.29 |
| 2026년 하반기 AI API 가격 비교 : GPT·Claude·Gemini·DeepSeek 100만 토큰 비용 총정리 (0) | 2026.09.29 |