AI 요약
AI 그림 생성 모델들의 창의적 능력을 평가하기 위해, 연구진이 GPT-5.6 Sol, Claude Fable 5, Grok 4.5, Gemini 3.6 Flash 등 4개 비전 모델에 색연필 도구 세트를 제공하고 모나리자와 별이 빛나는 밤 등 목표 이미지 재현 및 텍스트 프롬프트 기반 그림 그리기를 수행하게 했다. 총 28개의 그림이 생성되었으며, Grok 4.5는 기본적인 그림 작업에서 부진했고, Claude Fable 5는 가장 많은 비용과 시간이 소요되었음에도 결과물이 좋지 않았다. 이 실험은 모델의 객관적 성능 테스트가 아닌 개방형 과제를 통해 실제 역량 차이를 드러내기 위한 목적으로 진행되었다.
핵심 포인트
- 4개 모델(GPT-5.6 Sol, Claude Fable 5, Grok 4.5, Gemini 3.6 Flash)이 2개 목표 이미지와 5개 개방형 프롬프트로 총 28개 그림 생성
- Claude Fable 5는 가장 긴 시간과 높은 비용을 소모했으나 결과물은 최하위 수준
- Grok 4.5는 기본적인 그림 작업에서도 어려움을 겪었으며, 오픈웨이트 모델들은 대부분 사용 불가능
향후 전망
- 개방형 창의적 과제가 모델의 실제 프론티어 역량과 일반 모델 간 격차를 드러내는 효과적인 평가 방법으로 자리잡을 가능성
