DeepSeek-v4-flash-vision-exp

DeepSeek-v4-flash-vision-exp 모델은 이미지와 텍스트를 함께 입력받아 설명, 텍스트 추출, 차트 분석 등을 지원한다. 이미지는 base64 인라인, 외부 URL, 파일 API 참조의 세 가지 방식으로 제공할 수 있으며, 각각 제한 사항이 다르다.

AI 요약

딥시크(DeepSeek)가 새로운 비전 모델인 deepseek-v4-flash-vision-exp를 공개했다. 이 모델은 이미지와 텍스트를 함께 입력받아 이미지 설명, 스크린샷 텍스트 읽기, 차트 분석 등을 수행할 수 있다. JPEG, PNG, GIF, WebP 형식을 지원하며, 이미지 제공 방식은 Base64 인라인 인코딩, 외부 URL, Files API 업로드의 세 가지가 있다. OpenAI 호환 Chat Completions API 형식을 사용한다.

핵심 포인트

  • deepseek-v4-flash-vision-exp 모델은 이미지+텍스트 멀티모달 입력 지원
  • 이미지 제공 3가지 방식: Base64 인라인(48MiB 제한), 외부 URL(최대 8192자, 32MiB, 60초 다운로드), Files API(최대 64MiB)
  • 지원 형식: JPEG, PNG, GIF, WebP (파일 내용 기반 형식 감지)
  • OpenAI 호환 API 형식으로 Chat Completions 및 Responses API 모두 지원

향후 전망

  • 딥시크의 비전 모델 확장으로 멀티모달 AI 경쟁이 더욱 치열해질 전망
Share

이것도 읽어보세요

댓글

이 소식에 대한 의견을 자유롭게 남겨주세요.

댓글 (0)

불러오는 중...