48GB 맥에서 104GB Qwen3.8-Flash-Next 구동 성공…속도는 초당 12토큰

슬롯스트림은 125B 파라미터 MoE 모델인 Qwen3.8-Flash-Next를 48GB 메모리 맥에서 구동하는 도구로, SSD에서 스트리밍하여 4-bit 양자화 104GB 모델을 실행합니다. 48GB M5 Pro에서 초당 12토큰 디코딩 속도, 최대 32GB 메모리 사용, 2초 내 시작을 달성했으며, Ollama·OpenAI API 호환으로 기존 도구와 연동됩니다.

AI 요약

슬롯스트림(slotstream)은 125B 파라미터 MoE 모델인 Qwen3.8-Flash-Next(104GB, 4-bit)를 48GB 메모리의 Mac에서 구동할 수 있게 해주는 Swift 기반 단일 바이너리 도구다. SSD에서 가중치를 스트리밍하여 제한된 메모리에서도 실행하며, Ollama 및 OpenAI 채팅 API를 지원해 기존 도구를 그대로 사용할 수 있다. 48GB M5 Pro 기준 초당 약 12토큰의 디코딩 속도와 최대 32GB 메모리 사용량을 기록했으며, 8GB Mac에서도 최소 3토큰/초로 실행 가능하다. 설치 전 slotstream doctor 명령으로 자신의 Mac 실행 계획을 확인할 수 있다.

핵심 포인트

  • 125B 파라미터 MoE 모델, 104GB(4-bit) 가중치를 SSD 스트리밍 방식으로 구동
  • 48GB M5 Pro 기준: 웜 디코드 ~12토큰/초, 피크 메모리 32GB, 엔진 시작 ~2초
  • Apple Silicon + macOS 14+ 필요, 512GB 저장공간이 현실적 최소 요구사항
  • 24개 파일 총 103.8GB 다운로드, sha256 해시 검증 및 중단 후 재개 지원

향후 전망

  • 로컬 Mac에서 초대형 MoE 모델 구동이 가능해짐에 따라 개인 개발자의 대규모 모델 실험이 활성화될 것
  • SSD 스트리밍 방식이 저사양 하드웨어에서 LLM 실행의 표준적 접근법으로 자리잡을 가능성
Share

이것도 읽어보세요

댓글

이 소식에 대한 의견을 자유롭게 남겨주세요.

댓글 (0)

불러오는 중...