Codex 자동 리서치로 커널 속도 232배 향상시킨 방법

GPU Mode와 Core Automation이 주최한 자동 연구 대회에서 배치 QR 분해 문제를 해결하며 기준선 대비 232배 속도 향상을 달성했다. Householder 반사와 블록 알고리즘을 활용하고, 아이디어 다양성을 도입해 지역 최적해를 탈출한 것이 주요 성공 요인이었다.

AI 요약

GPU Mode와 Core Automation이 주최한 자동 리서치 대회에서 참가자가 Codex를 활용해 배치 정사각 컴팩트 Householder QR 분해 커널을 구현, 베이스라인 대비 232배 속도 향상을 달성했습니다. 작성자는 183명 중 12위를 기록했으며, 이 과정에서 블록 Householder 알고리즘 적용, 아이디어 다양성 도입 등을 통해 로컬 최적해를 극복한 경험을 공유합니다.

핵심 포인트

  • 대회 과제: FP32 CUDA 배치 행렬에 대한 컴팩트 Householder QR 분해 구현 (torch.geqrf와 동일한 출력)
  • 183명 참가자 중 12위, 베이스라인 대비 232배 속도 향상 달성
  • 주요 행렬 크기: 512×512, 1024×1024, 2048×2048, 4096×4096
  • FP16, FP8, NVFP4 등 저비트 연산이 내부적으로 허용되었으나 FP32 스타일 QR 검증 통과 필요

향후 전망

  • 자동 리서치(Codex 활용) 방식이 GPU 커널 최적화 분야에서 새로운 패러다임으로 자리잡을 가능성
  • '루프 엔지니어링'으로 불리는 이 접근법은 향후 다양한 선형대수 커널 최적화에 확대 적용될 전망
Share

이것도 읽어보세요

댓글

이 소식에 대한 의견을 자유롭게 남겨주세요.

댓글 (0)

불러오는 중...