AI 요약
인공지능 모델 평가 플랫폼인 Artificial Analysis가 업데이트한 에이전틱 인덱스(Agentic Index)에서 Qwen3.8 Max가 종합 1위를 차지했습니다. 이번 업데이트(v4.1.1)는 𝜏³-Banking을 v1.0.1로 이동하고 HLE, AA-LCR, AA-Omniscience 평가의 채점기를 GPT-5.6 Luna(medium)로 업그레이드했습니다. 인텔리전스 인덱스는 GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR 등 9개 평가를 통합합니다.
핵심 포인트
- Qwen3.8 Max가 에이전틱 인덱스 종합 1위에 등극 (2025년 8월 5일 평가)
- 인텔리전스 인덱스 v4.1.1은 9개 평가(GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, HLE, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR) 통합
- DeepSeek V4 Flash 0731이 인텔리전스 인덱스 50점 기록, 이전 버전 대비 10점 상승
- Endpoint Accuracy Index 신규 출시: 제공업체 엔드포인트가 참조 모델과 동일한 품질을 제공하는지 측정
향후 전망
- 에이전틱 벤치마크가 단순 언어 이해를 넘어 실제 업무 수행 능력을 평가하는 표준으로 자리잡을 전망
- 엔드포인트 정확도 지수 도입으로 동일 모델이라도 제공업체별 품질 차이에 대한 객관적 비교가 가능해질 것
출처:Hacker News (Artificial Analysis)
