AI 요약
대규모 언어 모델(LLM)은 수십억 개의 파라미터를 보유해 소비자 하드웨어에서 실행하기 어렵다. 양자화(Quantization)는 이러한 모델을 압축하는 핵심 기술로, 부동소수점 숫자를 더 적은 비트로 표현해 메모리 사용량을 줄인다. 이 글은 50개 이상의 시각 자료를 통해 숫자 표현 방식부터 양자화의 다양한 방법론과 원리를 단계적으로 설명한다.
핵심 포인트
- LLM은 수십억 개의 파라미터(주로 가중치)를 보유해 대용량 VRAM을 가진 GPU가 필요함
- IEEE-754 표준은 비트가 부호(sign), 지수(exponent), 가수(fraction)로 값을 표현하는 방식을 정의
- 더 많은 비트를 사용할수록 표현 가능한 값의 범위(동적 범위)와 정밀도가 높아짐
- 양자화는 메모리 효율성을 높이기 위해 값 표현에 사용되는 비트 수를 줄이는 기법
향후 전망
- 양자화 기술 발전으로 LLM이 소비자 하드웨어에서도 원활히 실행되는 시대가 도래할 전망
- 훈련 개선, 어댑터 등과 결합한 하이브리드 경량화 기법이 더욱 발전할 것으로 예상
