AI 요약
OpenAI의 GPT-6 Astra가 ARC-AGI-3 벤치마크에서 사상 최초로 인간 기준을 넘어서는 성과를 기록했다. 표준 하네스에서 62.7%, Provider Adapter 하네스에서 99.9%의 점수를 달성했으며, 96%의 레벨에서 중간 수준의 인간보다 더 적은 행동으로 문제를 해결했다. 특히 주목할 점은 Astra가 익숙하지 않은 환경을 논리 규칙과 도메인 특화 언어로 표현하는 '컴팩트한 기호적 세계 모델'로 변환하는 능력을 보였다는 것이다.
핵심 포인트
- GPT-6 Astra는 ARC-AGI-3 Semi-Private에서 표준 하네스 기준 62.7% ($26K), Provider Adapter 기준 99.9% ($19K) 달성
- 96%의 레벨에서 중간값 인간 테스터보다 더 적은 행동 수로 문제 해결
- ARC-AGI-3는 탐색, 모델링, 목표 설정, 계획 및 실행의 4가지 에이전트 지능 요소를 테스트
- Astra는 게임 메커니즘을 논리 규칙으로 표현하고 자체 도메인 특화 언어를 개발하는 행동을 보임
향후 전망
- ARC-AGI 시리즈가 측정하는 '잔여 격차'가 지속적으로 축소되면서 AGI 도달 시점 논의가 가속화될 전망
- 에이전트형 AI의 추론 효율성 개선으로 추론 비용이 오히려 감소하는 추세 지속
출처:hackernews
