AI 요약
GPU Mode와 Core Automation이 주최한 자동 리서치 대회에서 참가자가 Codex를 활용해 배치 정사각 컴팩트 Householder QR 분해 커널을 구현, 베이스라인 대비 232배 속도 향상을 달성했습니다. 작성자는 183명 중 12위를 기록했으며, 이 과정에서 블록 Householder 알고리즘 적용, 아이디어 다양성 도입 등을 통해 로컬 최적해를 극복한 경험을 공유합니다.
핵심 포인트
- 대회 과제: FP32 CUDA 배치 행렬에 대한 컴팩트 Householder QR 분해 구현 (torch.geqrf와 동일한 출력)
- 183명 참가자 중 12위, 베이스라인 대비 232배 속도 향상 달성
- 주요 행렬 크기: 512×512, 1024×1024, 2048×2048, 4096×4096
- FP16, FP8, NVFP4 등 저비트 연산이 내부적으로 허용되었으나 FP32 스타일 QR 검증 통과 필요
향후 전망
- 자동 리서치(Codex 활용) 방식이 GPU 커널 최적화 분야에서 새로운 패러다임으로 자리잡을 가능성
- '루프 엔지니어링'으로 불리는 이 접근법은 향후 다양한 선형대수 커널 최적화에 확대 적용될 전망
출처:hackernews
