OpenRouter, 어떻게 활용할까?

iMessage AI 어시스턴트 Olly를 운영하며 OpenRouter를 통해 1,800만 건 이상의 메시지를 처리한 저자가 제공자별 편차 문제를 지적했다. 동일한 DeepSeek V4 Flash 0731 가중치라도 제공자에 따라 GPQA Diamond 점수가 70.5~90.2%, TAU-Bench Airline이 58.4~81.3%로 최대 20점 이상 차이가 났으며, 특히 DigitalOcean은 75%와 58%를 기록했다.

AI 요약

iMessage 기반 AI 어시스턴트 Olly를 운영하는 저자가 OpenRouter를 통해 오픈소스 모델을 사용하며 겪은 함정들을 정리했다. Olly는 지금까지 1800만 건 이상의 메시지를 처리했고 그중 약 3분의 1이 OpenRouter 경유 오픈 모델이었다. 핵심 문제는 동일한 모델 가중치라도 이를 호스팅하는 제공자(provider)마다 정밀도·최적화·파서가 달라 성능이 크게 차이 난다는 점이다. 예를 들어 DeepSeek V4 Flash 0731의 경우 1차 제공자는 GPQA 90.2%·TAU 81.3%를 기록했지만 DigitalOcean은 75.3%·58.4%로 크게 떨어졌다.

핵심 포인트

  • Olly가 OpenRouter 경유로 1800만 건 이상 메시지 처리, 약 3분의 1이 오픈 모델
  • 동일 가중치라도 제공자별 정밀도·최적화·파서 차이로 성능 편차 발생
  • DeepSeek V4 Flash 0731: 1차 제공자 GPQA 90.2%·TAU 81.3% vs DigitalOcean 75.3%·58.4%
  • 대부분 호스트가 툴 호출(TAU)에서 1차 대비 5~7점 낮고, 일부는 지식 벤치마크에서 급락

향후 전망

  • 워크로드에 맞는 벤치마크를 기준으로 제공자를 선별하는 전략 필요
  • 제공자별 성능 편차가 에이전트 신뢰성에 직접적 영향을 미칠 것으로 전망
출처:mmoustafa.com (hackernews)
Share

이것도 읽어보세요

댓글

이 소식에 대한 의견을 자유롭게 남겨주세요.

댓글 (0)

불러오는 중...