13년 된 제온 CPU, GPU 없이 Gemma 4 26B 구동… 초당 5토큰 '느린 혁명

13년 된 Ivy Bridge 제온 CPU(듀얼 E5-2690 v2, AVX1만 지원)에서 GPU 없이 Gemma 4 26B(A4B) MoE 모델을 Q8_0 양자화로 구동, 디코드 약 5.2토큰/초, 프롬프트 평가 약 16토큰/초를 달성했습니다. 하드웨어 비용은 300달러 미만이며, AVX2 부재를 우회하기 위해 Claude의 도움으로 코드를 수정했습니다.

AI 요약

NeoMind Labs가 13년 된 HP StoreVirtual 스토리지 서버(듀얼 제온 E5-2690 v2, GPU 없음, DDR3 RAM)에서 Google의 Gemma 4 26B MoE 모델을 초당 약 5토큰 속도로 구동하는 데 성공했다. AVX1만 지원하는 구형 CPU에서 AVX2/FMA3 명령어셋이 필요한 최신 추론 커널을 Claude AI의 도움으로 수정하여 실행했다. 총 비용 300달러 미만의 장비로 현대적 AI 모델을 구동한 사례로, AI 모델 최적화의 중요성을 보여준다.

핵심 포인트

  • 하드웨어: 듀얼 제온 E5-2690 v2 (Ivy Bridge, 2013), GPU 없음, DDR3
  • 모델: Google Gemma 4 26B-A4B (MoE), Q8_0 양자화
  • 성능: 디코딩 약 5.2토큰/초, 프롬프트 평가 약 16토큰/초
  • 총 비용: 300달러 미만
  • Claude AI가 AVX2/FMA3 없는 구형 CPU용 커널 수정 작업 수행

향후 전망

  • 구형 하드웨어에서의 AI 모델 구동 최적화 기술 발전
  • AI 모델의 하드웨어 의존성 완화 및 접근성 향상
Share

이것도 읽어보세요

댓글

이 소식에 대한 의견을 자유롭게 남겨주세요.

댓글 (0)

불러오는 중...