AI 요약
애플 M 시리즈 맥에서 26B 파라미터 규모의 Gemma 4 모델을 약 2GB RAM만으로 구동할 수 있는 오픈소스 엔진 ‘TurboFieldfare’가 공개되었다. 전체 14.3GB 모델을 메모리에 로드하지 않고, SSD에서 필요한 전문가(expert)만 스트리밍하는 방식으로 8GB RAM 맥에서도 실행 가능하다. Swift와 Metal로 작성되었으며, M2 맥북에어에서 초당 5.1~6.3 토큰, M5 Pro에서 초당 31~35 토큰의 디코딩 속도를 기록했다.
핵심 포인트
- Gemma 4 26B-A4B 모델을 약 2GB RAM으로 구동 가능
- 전체 14.3GB 모델을 메모리에 로드하지 않고 SSD 스트리밍 방식 채택
- M2 8GB MacBook Air 기준 초당 5.1~6.3 토큰 디코딩 속도
- 네이티브 Mac 앱, CLI, OpenAI 호환 서버 등 다양한 인터페이스 제공
향후 전망
- 저사양 하드웨어에서도 대규모 AI 모델 구동이 가능해져 AI 접근성 대폭 향상
- Apple Silicon 기반 온디바이스 AI 추론 기술 발전에 기여할 전망
출처:GitHub (drumih/turbo-fieldfare)
