단일 AMD MI300X에서 구동되는 DeepSeek V4 Flash

DeepSeek V4 Flash 모델을 단일 AMD MI300X GPU에서 실행하는 설정을 공개한 저장소로, 304B 파라미터 모델을 양자화나 오프로드 없이 HBM 156.67GiB에 적재한다. vLLM ROCm nightly와 AITER 튜닝을 통해 단일 스트림 디코딩 168.6 tok/s, 프리필 약 7.9-8.5K tok/s, 64스트림 버스트 830 tok/s를 달성했으며, 256K 컨텍스트를 지원한다. MI300X의 FP8 형식 차이와 MoE 라우팅 문제를 해결한 패치를 포함한다.

AI 요약

DeepSeek V4 Flash(304B 파라미터) 모델을 단일 AMD MI300X GPU에서 프로덕션 환경으로 구동하는 설정과 패치를 공개한 저장소입니다. FP8 형식 비호환성, MoE 라우팅 버그, 커널 튜닝 문제를 해결했으며, 추가 양자화나 오프로드 없이 전체 모델을 HBM에 적재합니다. 단일 스트림 디코딩 168.6 tok/s, 프리필 약 8K tok/s, 64스트림 버스트에서도 OOM 없이 830 tok/s를 달성했습니다.

핵심 포인트

  • MI300X의 192GB HBM3와 5.3TB/s 대역폭을 활용, H100 대비 약 절반 비용으로 304B 모델 단일 GPU 구동
  • AMD/Graphcore fnuz FP8 변형(E4M3)과 OCP 표준 FP8 간 스케일 차이(2배)로 인한 정확성 문제 해결
  • vLLM ROCm nightly 0.26.1rc1.dev229+g124154a88.rocm723, AITER 0.1.19 버전 고정 사용
  • 256K 컨텍스트 검증 완료, 20GB GPU KV 풀 + 96GiB CPU 프리픽스 캐시 계층 구성

향후 전망

  • MI325X 이상의 OCP 표준 FP8 하드웨어에서는 추가 패치 없이 공식 vLLM 레시피 사용 가능
  • 단일 GPU 대규모 모델 서빙의 비용 효율성 입증으로 AMD GPU 채택 확대 기대
Share

이것도 읽어보세요

댓글

이 소식에 대한 의견을 자유롭게 남겨주세요.

댓글 (0)

불러오는 중...