AI 요약
Swiftlet은 Swift와 Metal을 기반으로 한 새로운 런타임으로, Qwen3-Next 및 Qwen3.5/3.6 MoE 하이브리드 모델을 일반 Apple 기기에서 실행할 수 있게 한다. 모델의 작은 밀집 코어만 메모리에 유지하고 라우팅된 MoE 가중치를 스토리지에서 스트리밍하는 방식으로, M5 Mac에서 80B 모델을 4.3GB RAM으로, iPhone 17에서 35B 모델을 약 2.5GB RAM으로 실행하는 데 성공했다. 이는 해당 클래스의 모델이 휴대폰에서 네이티브로 실행된 첫 사례로 알려져 있다. 현재는 디코딩 루프가 디스패치 바운드 상태라 커널 속도 최적화에 집중하고 있으며, 토큰당 약 3B 파라미터만 활성화되어 대형 모델처럼 대화하지만 사실 기억력은 소형 모델 수준이라는 점을 명확히 밝히고 있다.
핵심 포인트
- Qwen3.6-35B-A3B 4-bit 모델: 디스크 18GB, RAM 2.6GB, 디코드 속도 7~11 tok/s (M5 Mac)
- Qwen3-Next-80B-A3B 4-bit 모델: 디스크 42GB, RAM 4.3GB, 디코드 속도 4.5~5 tok/s (M5 Mac)
- iPhone 17에서 35B 모델이 약 2.5GB RAM으로 약 1 tok/s 속도로 실행 — 이 클래스 모델의 첫 네이티브 폰 실행
- 오픈소스로 공개되어 있으며, macOS 14+ 또는 iOS 17+ Apple Silicon 기기에서 구동 가능
향후 전망
- 디코딩 루프가 IO 바운드가 아닌 디스패치 바운드이므로 커널 최적화를 통한 상당한 속도 개선 여지가 있음
- Priv AI 앱의 Experimental Models 기능을 통해 iPhone에서도 곧 모델을 직접 다운로드해 사용할 수 있게 될 예정
출처:Hacker News
