DeepSeek V4 Flash 0731

DeepSeek V4 Flash 0731은 ARC-AGI-1 Semi-Private에서 89.0%, ARC-AGI-2 Semi-Private에서 61.4%의 점수를 기록했으며, 각각 태스크당 $0.02와 $0.04의 비용이 든다. 이 모델은 Max, High, Low 세 가지 추론 변형을 제공하며, ARC-AGI-2 Public Eval에서 120개 태스크 중 상당수를 해결했다.

AI 요약

DeepSeek V4 Flash 0731 모델이 ARC-AGI-1 Semi-Private 벤치마크에서 최대 추론 설정 시 89.0%의 점수를 달성했으며, 태스크당 비용은 0.02달러에 불과하다. ARC-AGI-2에서는 61.4%의 점수를 기록했고 태스크당 0.04달러의 비용이 소요된다. 세 가지 추론 변형(최대, 높음, 낮음)에 따라 성능이 차등적으로 나타나며, ARC-AGI-1 공개 평가 400개 태스크와 ARC-AGI-2 공개 평가 120개 태스크에 대한 상세한 통과/실패 결과가 공개됐다.

핵심 포인트

  • ARC-AGI-1 Semi-Private: 최대 추론 시 89.0% (태스크당 $0.02), 높음 87.0%, 낮음 84.0%
  • ARC-AGI-2 Semi-Private: 최대 추론 시 61.4% (태스크당 $0.04), 높음 56.0%, 낮음 46.0%
  • ARC-AGI-3 벤치마크에서는 아직 검증된 점수 없음
  • 2026년 7월 31일자 모델로, 3가지 추론 변형 제공

향후 전망

  • 저비용·고성능 조합으로 AI 추론 비용 절감 경쟁에서 강력한 경쟁력 확보
  • ARC-AGI-3 벤치마크 결과 공개 시 일반 추론 능력의 추가 검증 기대
출처:Hacker News (ARC Prize)
Share

이것도 읽어보세요

댓글

이 소식에 대한 의견을 자유롭게 남겨주세요.

댓글 (0)

불러오는 중...