AI 요약
딥시크(DeepSeek)가 새로운 비전 모델인 deepseek-v4-flash-vision-exp를 공개했다. 이 모델은 이미지와 텍스트를 함께 입력받아 이미지 설명, 스크린샷 텍스트 읽기, 차트 분석 등을 수행할 수 있다. JPEG, PNG, GIF, WebP 형식을 지원하며, 이미지 제공 방식은 Base64 인라인 인코딩, 외부 URL, Files API 업로드의 세 가지가 있다. OpenAI 호환 Chat Completions API 형식을 사용한다.
핵심 포인트
- deepseek-v4-flash-vision-exp 모델은 이미지+텍스트 멀티모달 입력 지원
- 이미지 제공 3가지 방식: Base64 인라인(48MiB 제한), 외부 URL(최대 8192자, 32MiB, 60초 다운로드), Files API(최대 64MiB)
- 지원 형식: JPEG, PNG, GIF, WebP (파일 내용 기반 형식 감지)
- OpenAI 호환 API 형식으로 Chat Completions 및 Responses API 모두 지원
향후 전망
- 딥시크의 비전 모델 확장으로 멀티모달 AI 경쟁이 더욱 치열해질 전망
출처:hackernews
