AI 요약
DeepSeek V4 Flash(304B 파라미터) 모델을 단일 AMD MI300X GPU에서 프로덕션 환경으로 구동하는 설정과 패치를 공개한 저장소입니다. FP8 형식 비호환성, MoE 라우팅 버그, 커널 튜닝 문제를 해결했으며, 추가 양자화나 오프로드 없이 전체 모델을 HBM에 적재합니다. 단일 스트림 디코딩 168.6 tok/s, 프리필 약 8K tok/s, 64스트림 버스트에서도 OOM 없이 830 tok/s를 달성했습니다.
핵심 포인트
- MI300X의 192GB HBM3와 5.3TB/s 대역폭을 활용, H100 대비 약 절반 비용으로 304B 모델 단일 GPU 구동
- AMD/Graphcore fnuz FP8 변형(E4M3)과 OCP 표준 FP8 간 스케일 차이(2배)로 인한 정확성 문제 해결
- vLLM ROCm nightly 0.26.1rc1.dev229+g124154a88.rocm723, AITER 0.1.19 버전 고정 사용
- 256K 컨텍스트 검증 완료, 20GB GPU KV 풀 + 96GiB CPU 프리픽스 캐시 계층 구성
향후 전망
- MI325X 이상의 OCP 표준 FP8 하드웨어에서는 추가 패치 없이 공식 vLLM 레시피 사용 가능
- 단일 GPU 대규모 모델 서빙의 비용 효율성 입증으로 AMD GPU 채택 확대 기대
출처:hackernews
