elsa in mac

DeepSeek, 이미지분석이 가능한 vision 기능을 탑재한 deepseek-v4-flash-vision-exp 모델 공개 본문

AI/AI 동향

DeepSeek, 이미지분석이 가능한 vision 기능을 탑재한 deepseek-v4-flash-vision-exp 모델 공개

elsa in mac 2026. 8. 21. 18:54

DeepSeek가 2026년 8월 21일. 자사 홈페이지를 통해 이미지를 분석할 수 있는 deepseek-v4-flash-vision-exp 모델을 공개했습니다. 

자 우선 이 vision-exp API의 사용 시 비용을 먼저 봅니다  기존의 v4-flash, v4-pro와 동일하게 peaktime 이 적용되며 각격 테이블은 아래와 같습니다. 

모델명이 v4-flash-vision-exp에서 볼 수 있듯이. v4-flash 가격과 정확히 동일한 것을 알 수 있습니다. off peak-time을 기준으로 백만 토큰 기준으로 input cache hit는 0.007 달러, input miss는 0.22 달러, output 은 0.55 달러입니다. 

이 vision 모델은 JPG PNG, GIF 및 WebP 이미지 형식 파일을 입력으로 받을 수 있으며, 모델에게 이미지를 설명하거나, 이미지에 포함된 텍스트를 인식하거나 차트등을 분석할 수 있고, 출력은 해당 이미지에 대한 텍스트 설명이라고 할 수 있습니다.  이지미를 생성할 수 있는 모델은 아니라는 점을 유의해야 합니다.  이미지는 https URL 링크의 경우는 해당 링크를 사용할 수 있지만, local에 저장된 이미지를 전송하려면 bae64로 인코딩해서 보내야 합니다. 이것은 부가적인 프로세셍이 요구되므로 file API를 이용하여 upload 후, uploading 된 file id를 return 받은 후에 이 file id를 참조로 agent에게 질문을 하는 형태로 사용해야 합니다. 즉, agent harness에서 v4-flash-vision-exp 모델을 지원하도록 해 줘야 하는 것이죠. 

vision-exp API를 사용할 때 주의할 점은 사용할 수 있는 이미지는 파일 크기(48 MiB)와 업로드 시간(10분 이내) 제한이 있습니다. 만일 이미지가 48MiB 크기를 넘어서는 경우에는 file API를 통해 agent에 전달할 수 있습니다. 이미지는 800x800 pixels을 기준으로 그 보다 작은 이미지는 확대되고, 그 보다 더 큰 이미지는 축소됩니다.  확대 및 축소는 이미지 비율을 유지한 상태로 확대 및 축소됩니다.  이것은 크기를 산술적으로 800으로 줄이는 것이 아니라. 800x800 즉, 640,000 pixel 수준으로 맞추는 것입니다. 

예를 들어 사용자가 2048x1024 px 이미지(2,2111,840 px)를 전송하면,  이를 800x800(640,000 px) 수준으로 축소하여 결론적으로 1102x581 px의 이미지로 축소한 후 분석하게 됩니다. 

토큰은 이미지당 최대 384 token 이 사용되며, 요청당 최대 600개의 이미지를 한번에 요청할 수 있습니다. 
deepseek는 openAI, Anthropic 및 Response API를 지원하며, 이 3개의 API에서 모두 deepseek-v4-flash-vision-exp를 사용할 수 있습니다.  이미지는 user 메시지에서만 사용될 수 있어며, system prompt 나 assistant 용 메시지에서는 사용할 수 없습니다. 

아미지 1개당 최대 384 토큰이고, input miss 시, off-peak 기준으로 백만 토큰당 0.22달러 이므로, 0.22 달러에 약 2,600개의 이미지를 분석할 수 있는 셈이니, 뭐 거의 무료 수준이라고 볼 수 있습니다. (텍스트 프롬프트 및 응답 토큰은 별도)

테스트를 해 봤습니다. 속도 빠르고.. 분석도 잘 하네요.. ^^

참고로, 위의 스샷은 reasonix v1.8.0 기반으로 개인적으로 custom 하여 사용하고 있는 버전을 스샷 한 것입니다. 

DeepSeek의 자체 벤치마크에서는 Opus-4.8 multi-modal agent의 비전 기능에 근접한다고 자평하고 있습니다만, 이것은 추후 사용자들이 평가하게 될 것입니다. 

우선 benchmark 지표로만 보면, 기존의 v4-flash-0731 보다 더 성능이 뛰어난 것으로 판단딥니다.  exp 가 붙은 것은 완성본은 아니고 experimental 즉 아직은 실험적인 단계라고 자체 판단한 것 같습니다. 현재 exp 모델로 변경하여 사용해 보고 있는데, 느낌 상으로도 v4-flash 보다 좀 더 좋게 느껴집니다. API 가격이 동일하므로 가능하다면 v4-flash-exp를 사용하는 것이 유리해 보입니다. 며칠 간 사용해 보고 특이사항이 있다면 별도로 포스팅을 해 보겠습니다. 

- - - - - - - - - 

Deepseek 의 vision 은 이미 예전부터 deepseek chat에서 제공을 했었는데, chat 홈 페이지에서 사용한 모델이 이번에 공개한 v4-flash-vision-exp 모델인지는 잘 모르겠습니다. 암튼, API를 통해 vision 기능을 사용할 수 있게 되었다니.. deepseek 사용자로서 반가운 소식이 아닐 수 없습니다. 

공유하기 링크
Comments