AI 요약
사이먼 윌리슨(Simon Willison)이 시작한 '펠리칸이 자전거를 타는 SVG 생성' 벤치마크가 AI 업계의 비공식 표준이 된 가운데, 연구자가 이 벤치마크에 과적합(펠리칸맥싱)되었는지 실험했다. 8종 동물 × 6종 탈것 = 48개 프롬프트로 7개 최신 모델(GPT-5.6 Terra, Claude Sonnet 5 등)에서 총 1,008개의 SVG를 생성하고 LLM 평가자로 채점했다. 분석 결과, 펠리칸-자전거 조합이 다른 동물-탈것 조합보다 특별히 높은 점수를 받지 않아 명백한 벤치마크 과적합 증거는 발견되지 않았다.
핵심 포인트
- 8종 동물(펠리칸, 플라밍고, 왜가리, 수달, 너구리, 영양, 고래, 고양이) × 6종 탈것(자전거, 외발자전거, 스케이트보드, 스쿠터, 비행기, 보트) = 48개 프롬프트 사용
- GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2, DeepSeek V4 Pro 등 7개 모델 테스트
- 1,008개 생성 중 단 11회만 재시도 필요, 대부분 모델이 유효한 SVG를 즉시 생성
- 펠리칸-자전거 조합이 다른 조합보다 유의미하게 높은 점수를 받지 않아 벤치마크 과적합 증거 불발
향후 전망
- AI 연구소의 비공식 벤치마크 과적합 시도는 지속될 가능성이 높아, 더 체계적이고 다양한 평가 방법론 개발이 필요
- 단일 프롬프트 기반 평가의 한계를 넘어 다양한 도메인과 난이도를 포괄하는 종합 벤치마크의 중요성이 부각될 것
출처:hackernews
