AI 연구소, '펠리칸맥싱' 논란…과연 현실일까?

AI 연구소의 '펠리칸맥싱' 논란을 조사하기 위해 7개 최첨단 모델(GPT-5.6 Terra, Claude Sonnet 5 등)로 1,008개의 SVG를 생성하고 LLM 평가를 진행했다. 실험 결과, 펠리칸 자전거 프롬프트에 대한 과적합(벤치맥싱) 증거는 발견되지 않았으며, 모델들은 다양한 동물-탈것 조합에서 일관된 성능을 보였다.

AI 요약

사이먼 윌리슨(Simon Willison)이 시작한 '펠리칸이 자전거를 타는 SVG 생성' 벤치마크가 AI 업계의 비공식 표준이 된 가운데, 연구자가 이 벤치마크에 과적합(펠리칸맥싱)되었는지 실험했다. 8종 동물 × 6종 탈것 = 48개 프롬프트로 7개 최신 모델(GPT-5.6 Terra, Claude Sonnet 5 등)에서 총 1,008개의 SVG를 생성하고 LLM 평가자로 채점했다. 분석 결과, 펠리칸-자전거 조합이 다른 동물-탈것 조합보다 특별히 높은 점수를 받지 않아 명백한 벤치마크 과적합 증거는 발견되지 않았다.

핵심 포인트

  • 8종 동물(펠리칸, 플라밍고, 왜가리, 수달, 너구리, 영양, 고래, 고양이) × 6종 탈것(자전거, 외발자전거, 스케이트보드, 스쿠터, 비행기, 보트) = 48개 프롬프트 사용
  • GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2, DeepSeek V4 Pro 등 7개 모델 테스트
  • 1,008개 생성 중 단 11회만 재시도 필요, 대부분 모델이 유효한 SVG를 즉시 생성
  • 펠리칸-자전거 조합이 다른 조합보다 유의미하게 높은 점수를 받지 않아 벤치마크 과적합 증거 불발

향후 전망

  • AI 연구소의 비공식 벤치마크 과적합 시도는 지속될 가능성이 높아, 더 체계적이고 다양한 평가 방법론 개발이 필요
  • 단일 프롬프트 기반 평가의 한계를 넘어 다양한 도메인과 난이도를 포괄하는 종합 벤치마크의 중요성이 부각될 것
Share

이것도 읽어보세요

댓글

이 소식에 대한 의견을 자유롭게 남겨주세요.

댓글 (0)

불러오는 중...