“맥에서 80B Qwen을 4.3GB RAM으로, 아이폰에서 35B 모델까지… ‘Show HN’ 화제”

Swiftlet은 Swift와 Metal 기반 런타임으로, Qwen3-Next 및 Qwen3.5/3.6 MoE 모델을 Apple 기기에서 실행합니다. 모델의 작은 dense 코어만 메모리에 유지하고, 필요할 때 라우팅된 MoE 가중치를 스토리지에서 스트리밍하여, 80B 모델을 4.3GB RAM으로, 35B 모델을 2.6GB RAM으로 실행합니다. iPhone 17에서는 35B 모델이 약 2.5GB RAM으로 1 tok/s 속도로 구동되며, 이는 이 클래스의 모델이 네이티브로 폰에서 실행된 첫 사례입니다.

AI 요약

Swiftlet은 Swift와 Metal을 기반으로 한 새로운 런타임으로, Qwen3-Next 및 Qwen3.5/3.6 MoE 하이브리드 모델을 일반 Apple 기기에서 실행할 수 있게 한다. 모델의 작은 밀집 코어만 메모리에 유지하고 라우팅된 MoE 가중치를 스토리지에서 스트리밍하는 방식으로, M5 Mac에서 80B 모델을 4.3GB RAM으로, iPhone 17에서 35B 모델을 약 2.5GB RAM으로 실행하는 데 성공했다. 이는 해당 클래스의 모델이 휴대폰에서 네이티브로 실행된 첫 사례로 알려져 있다. 현재는 디코딩 루프가 디스패치 바운드 상태라 커널 속도 최적화에 집중하고 있으며, 토큰당 약 3B 파라미터만 활성화되어 대형 모델처럼 대화하지만 사실 기억력은 소형 모델 수준이라는 점을 명확히 밝히고 있다.

핵심 포인트

  • Qwen3.6-35B-A3B 4-bit 모델: 디스크 18GB, RAM 2.6GB, 디코드 속도 7~11 tok/s (M5 Mac)
  • Qwen3-Next-80B-A3B 4-bit 모델: 디스크 42GB, RAM 4.3GB, 디코드 속도 4.5~5 tok/s (M5 Mac)
  • iPhone 17에서 35B 모델이 약 2.5GB RAM으로 약 1 tok/s 속도로 실행 — 이 클래스 모델의 첫 네이티브 폰 실행
  • 오픈소스로 공개되어 있으며, macOS 14+ 또는 iOS 17+ Apple Silicon 기기에서 구동 가능

향후 전망

  • 디코딩 루프가 IO 바운드가 아닌 디스패치 바운드이므로 커널 최적화를 통한 상당한 속도 개선 여지가 있음
  • Priv AI 앱의 Experimental Models 기능을 통해 iPhone에서도 곧 모델을 직접 다운로드해 사용할 수 있게 될 예정
Share

이것도 읽어보세요

댓글

이 소식에 대한 의견을 자유롭게 남겨주세요.

댓글 (0)

불러오는 중...