AI 요약
iMessage 기반 AI 어시스턴트 Olly를 운영하는 저자가 OpenRouter를 통해 오픈소스 모델을 사용하며 겪은 함정들을 정리했다. Olly는 지금까지 1800만 건 이상의 메시지를 처리했고 그중 약 3분의 1이 OpenRouter 경유 오픈 모델이었다. 핵심 문제는 동일한 모델 가중치라도 이를 호스팅하는 제공자(provider)마다 정밀도·최적화·파서가 달라 성능이 크게 차이 난다는 점이다. 예를 들어 DeepSeek V4 Flash 0731의 경우 1차 제공자는 GPQA 90.2%·TAU 81.3%를 기록했지만 DigitalOcean은 75.3%·58.4%로 크게 떨어졌다.
핵심 포인트
- Olly가 OpenRouter 경유로 1800만 건 이상 메시지 처리, 약 3분의 1이 오픈 모델
- 동일 가중치라도 제공자별 정밀도·최적화·파서 차이로 성능 편차 발생
- DeepSeek V4 Flash 0731: 1차 제공자 GPQA 90.2%·TAU 81.3% vs DigitalOcean 75.3%·58.4%
- 대부분 호스트가 툴 호출(TAU)에서 1차 대비 5~7점 낮고, 일부는 지식 벤치마크에서 급락
향후 전망
- 워크로드에 맞는 벤치마크를 기준으로 제공자를 선별하는 전략 필요
- 제공자별 성능 편차가 에이전트 신뢰성에 직접적 영향을 미칠 것으로 전망
출처:mmoustafa.com (hackernews)
