AI 요약
NeoMind Labs가 13년 된 HP StoreVirtual 스토리지 서버(듀얼 제온 E5-2690 v2, GPU 없음, DDR3 RAM)에서 Google의 Gemma 4 26B MoE 모델을 초당 약 5토큰 속도로 구동하는 데 성공했다. AVX1만 지원하는 구형 CPU에서 AVX2/FMA3 명령어셋이 필요한 최신 추론 커널을 Claude AI의 도움으로 수정하여 실행했다. 총 비용 300달러 미만의 장비로 현대적 AI 모델을 구동한 사례로, AI 모델 최적화의 중요성을 보여준다.
핵심 포인트
- 하드웨어: 듀얼 제온 E5-2690 v2 (Ivy Bridge, 2013), GPU 없음, DDR3
- 모델: Google Gemma 4 26B-A4B (MoE), Q8_0 양자화
- 성능: 디코딩 약 5.2토큰/초, 프롬프트 평가 약 16토큰/초
- 총 비용: 300달러 미만
- Claude AI가 AVX2/FMA3 없는 구형 CPU용 커널 수정 작업 수행
향후 전망
- 구형 하드웨어에서의 AI 모델 구동 최적화 기술 발전
- AI 모델의 하드웨어 의존성 완화 및 접근성 향상
