오픈AI 'GPT-6 Astra', 초지능 테스트 ARC-AGI-3서 첫 돌파구

OpenAI의 GPT-6 Astra가 ARC-AGI-3 벤치마크에서 62.7%의 점수(Standard harness, $26K)를 기록하며 인간 기준을 넘어섰다. 모델은 탐색, 모델링, 목표 설정, 계획 실행 능력을 평가하는 이 테스트에서 96%의 레벨에서 인간보다 적은 행동을 사용했고, 환경을 기호적 세계 모델로 변환하는 능력을 보였다. 이는 초지능 테스트에서의 첫 돌파구로 평가된다.

AI 요약

OpenAI의 GPT-6 Astra가 ARC-AGI-3 벤치마크에서 사상 최초로 인간 기준을 넘어서는 성과를 기록했다. 표준 하네스에서 62.7%, Provider Adapter 하네스에서 99.9%의 점수를 달성했으며, 96%의 레벨에서 중간 수준의 인간보다 더 적은 행동으로 문제를 해결했다. 특히 주목할 점은 Astra가 익숙하지 않은 환경을 논리 규칙과 도메인 특화 언어로 표현하는 '컴팩트한 기호적 세계 모델'로 변환하는 능력을 보였다는 것이다.

핵심 포인트

  • GPT-6 Astra는 ARC-AGI-3 Semi-Private에서 표준 하네스 기준 62.7% ($26K), Provider Adapter 기준 99.9% ($19K) 달성
  • 96%의 레벨에서 중간값 인간 테스터보다 더 적은 행동 수로 문제 해결
  • ARC-AGI-3는 탐색, 모델링, 목표 설정, 계획 및 실행의 4가지 에이전트 지능 요소를 테스트
  • Astra는 게임 메커니즘을 논리 규칙으로 표현하고 자체 도메인 특화 언어를 개발하는 행동을 보임

향후 전망

  • ARC-AGI 시리즈가 측정하는 '잔여 격차'가 지속적으로 축소되면서 AGI 도달 시점 논의가 가속화될 전망
  • 에이전트형 AI의 추론 효율성 개선으로 추론 비용이 오히려 감소하는 추세 지속
출처:hackernews
Share

이것도 읽어보세요

댓글

이 소식에 대한 의견을 자유롭게 남겨주세요.

댓글 (0)

불러오는 중...