AI 요약
다중 LLM 시스템에서 텍스트 기반 통신의 한계를 극복하기 위해 KV-캐시를 직접 융합하는 Cache-to-Cache(C2C) 패러다임이 제안됐다. C2C는 신경망으로 소스 모델의 KV-캐시를 대상 모델에 투영·융합하고, 학습 가능한 게이팅으로 캐시 통신의 수혜 레이어를 선택한다. 실험 결과 개별 모델 대비 평균 정확도 6.4~14.2% 향상, 텍스트 통신 대비 3.1~5.4% 우수한 성능, 지연 시간은 평균 2.5배 단축됐다. ICLR 2026에 게재됐다.
핵심 포인트
- 논문 제목: "Cache-to-Cache: Direct Semantic Communication Between Large Language Models" (arXiv:2510.03215)
- 저자: Tianyu Fu 외 6인, 2025년 10월 3일 제출, 2026년 3월 2일 개정
- 개별 모델 대비 평균 정확도 6.4~14.2% 향상, 텍스트 통신 대비 3.1~5.4% 향상
- 지연 시간 평균 2.5배 단축, ICLR 2026 게재
향후 전망
- 텍스트를 매개하지 않는 모델 간 통신이 멀티 에이전트 시스템의 표준 패러다임으로 자리잡을 가능성
- KV-캐시 융합 기법이 이기종 모델 간 협업 및 추론 효율화 연구로 확장될 전망
출처:hackernews
