AI 요약
인터콤(Intercom)이 AI 에이전트 'Fin'의 성능 평가 시스템인 'Evals'와 'Releases'를 공개했다. Evals는 실제 대화를 기반으로 한 시뮬레이션 시나리오를 통해 Fin의 행동을 대규모로 테스트하고, Releases는 실시간 버전과 분리된 공간에서 변경사항을 안전하게 구축하고 테스트할 수 있게 한다. 기존의 Monitors와 결합하여 운영 전·중·후 전체 과정에서 Fin의 성능을 평가하는 'Eval 기반 전달(Eval-driven delivery)' 시스템을 구축했다. 이는 AI 에이전트가 확률적으로 동작하기 때문에 동일한 질문에도 다른 답변이 나올 수 있고, 수천 가지 시나리오를 수동으로 검증할 수 없는 문제를 해결하기 위한 것이다.
핵심 포인트
- Evals는 환불 요청, 에스컬레이션 규칙, 톤 등 주제별로 시뮬레이션 대화를 그룹화하여 자동으로 기준에 따라 통과/실패를 평가
- Releases는 콘텐츠, 절차, 가이드라인 변경사항을 하나로 묶어 팀 협업 후 Evals로 테스트하고, 점진적 트래픽 확대 또는 A/B 테스트로 안전하게 출시
- Monitors는 모든 실시간 대화를 기준에 따라 평가하고 문제를 감지하여 다음 Evals·Releases 개선 사이클로 연결
- 대규모 고객 운영 환경에서 1%의 성능 회귀만으로도 하루 수천 건의 대화에 영향을 줄 수 있어 체계적 평가 시스템 필요
향후 전망
- AI 에이전트의 품질 관리를 위한 'Eval 기반 전달' 방식이 업계 표준으로 자리잡을 전망
- AI 에이전트의 확률적 특성으로 인한 성능 편차를 체계적으로 관리하는 도구의 중요성이 지속적으로 증가할 것
출처:intercom_blog
