AI 요약
한 연구자가 NVIDIA RTX 5090 GPU 하나로 1.5시간 만에 처음부터 학습시킨 초소형 트랜스포머 모델이 ARC-1 벤치마크에서 여러 대형 LLM들을 능가하는 성과를 냈다. 이 모델은 이전 버전보다 더 빠르고 저렴하면서도 성능이 개선됐으며, ARC-2에서도 7%의 점수를 기록했다. 연구자는 샘플 효율성(sample efficiency)이 현재 AI의 가장 중요한 문제라고 강조하며, 트랜스포머 기반 딥러닝의 한계를 탐구하고 비용을 절감하는 것을 목표로 삼고 있다.
핵심 포인트
- RTX 5090 단일 GPU에서 1.5시간 학습으로 ARC-1 공개 평가에서 다수 LLM을 능가
- SwiGlu, RMSnorm, 8레이어 스케일업 등 현대적 아키텍처 적용으로 성능 대폭 개선
- AdamW 대신 Normuon, flash attention varlen 트레이닝 등으로 비용 절감
- ARC-2에서 7% 점수 기록, 오픈소스로 공개됨
향후 전망
- 샘플 효율성 극한을 탐구하는 연구가 AI 학습 비용을 획기적으로 낮출 가능성
- ARC-AGI 벤치마크에서 데이터 효율성 측면의 새로운 기준을 제시할 것으로 기대
출처:mvakde.github.io (연구자 블로그)
