AI 요약
AI 기술에 대한 회의감과 AI 기업의 윤리 문제에 대한 우려를 바탕으로, 로컬 LLM 구축에 도전한 경험을 상세히 공유한다. 목표 모델은 알리바바의 Qwen3.6-27B-FP8로, 270억 개 파라미터를 8비트 양자화해 VRAM 44GB 이상의 GPU 환경에서 구동하는 것을 목표로 삼았다. 중고 GPU를 구매해 직접 머신을 조립하고 vLLM을 활용한 구체적인 구축 과정을 설명하며, AI 기술의 대안적 활용 가능성을 제시한다.
핵심 포인트
- 목표 모델: Qwen3.6-27B-FP8 (270억 파라미터, 8비트 양자화)
- 필요 VRAM: 약 44GB (KV 캐시 + 모델 가중치 + 활성화 메모리 포함)
- 2026년 6월 기준, 100B 미만 오픈웨이트 모델 중 Gemma 4와 Qwen3.6이 최고 성능
- 중고 GPU 구매를 통한 자체 로컬 LLM 머신 구축 방식 채택
향후 전망
- MoE(Mixture-of-Experts) 모델이 로컬 LLM의 주류가 될 가능성
- 로컬 LLM이 AI 기업 의존도를 낮추는 대안으로 주목받을 전망
출처:hatena
