AI 요약
DeepSeek V4 Flash 0731 모델이 ARC-AGI-1 Semi-Private 벤치마크에서 최대 추론 설정 시 89.0%의 점수를 달성했으며, 태스크당 비용은 0.02달러에 불과하다. ARC-AGI-2에서는 61.4%의 점수를 기록했고 태스크당 0.04달러의 비용이 소요된다. 세 가지 추론 변형(최대, 높음, 낮음)에 따라 성능이 차등적으로 나타나며, ARC-AGI-1 공개 평가 400개 태스크와 ARC-AGI-2 공개 평가 120개 태스크에 대한 상세한 통과/실패 결과가 공개됐다.
핵심 포인트
- ARC-AGI-1 Semi-Private: 최대 추론 시 89.0% (태스크당 $0.02), 높음 87.0%, 낮음 84.0%
- ARC-AGI-2 Semi-Private: 최대 추론 시 61.4% (태스크당 $0.04), 높음 56.0%, 낮음 46.0%
- ARC-AGI-3 벤치마크에서는 아직 검증된 점수 없음
- 2026년 7월 31일자 모델로, 3가지 추론 변형 제공
향후 전망
- 저비용·고성능 조합으로 AI 추론 비용 절감 경쟁에서 강력한 경쟁력 확보
- ARC-AGI-3 벤치마크 결과 공개 시 일반 추론 능력의 추가 검증 기대
출처:Hacker News (ARC Prize)
