모델들이 일부러 멍청해지고 있다

최신 AI 모델들은 추론 능력은 향상되지만 사실 지식은 감소하는 추세다. GLM-5.2는 AIME 2026에서 99.2%를 기록하지만, SimpleQA에서 최고 모델도 53%에 그친다. 이는 지식보다 추론에 파라미터를 집중하는 의도적 설계로, 소형 모델의 환각률은 80% 이상이다.

AI 요약

최신 AI 모델들이 추론 능력은 급격히 향상되는 반면 사실적 지식은 의도적으로 줄어들고 있다는 분석이다. GLM-5.2는 AIME 2026에서 99.2%를 기록하며 파라미터당 효율이 비약적으로 개선됐지만, SimpleQA 같은 사실 회상 벤치마크에서는 최고 모델인 Gemini 2.5 Pro도 53%에 그친다. 소형 모델의 경우 Qwen3.5 4B와 9B는 지식 벤치마크에서 80~82%의 환각률을 보인다. 이는 연구소들이 세계 지식 대신 추론 능력을 우선시하는 의도적 설계 결정으로, 사실 지식은 파라미터당 약 2비트가 필요한 반면 추론은 압축 효율이 훨씬 높기 때문이다.

핵심 포인트

  • GLM-5.2는 AIME 2026에서 99.2%를 기록하며 약 400억 파라미터로 GPT-4(2800억 추정) 대비 압도적 효율
  • SimpleQA에서 최고 모델 Gemini 2.5 Pro도 53%에 그쳐 사실 회상 능력의 한계 노출
  • Qwen3.5 4B와 9B는 지식 벤치마크에서 80~82% 환각률 기록
  • 연구소들은 세계 지식 대신 추론 능력을 우선하는 의도적 트레이드오프를 선택

향후 전망

  • 소형 모델의 추론 능력 향상이 지속되는 한편, 사실적 지식 부족을 보완하기 위한 도구 사용(tool use) 통합이 더 중요해질 전망
  • 특정 도메인에 특화된 지식 모델과 범용 추론 모델의 분화가 가속화될 것으로 예상
Share

이것도 읽어보세요

댓글

이 소식에 대한 의견을 자유롭게 남겨주세요.

댓글 (0)

불러오는 중...