캐시 투 캐시: LLM 간 직접 의미론적 통신 (2025)

arXiv에 게재된 'Cache-to-Cache(C2C)' 논문은 텍스트 토큰 대신 KV-캐시를 직접 융합해 LLM 간 의미론적 통신을 가능하게 하는 새 패러다임을 제안한다. C2C는 개별 모델 대비 평균 정확도 6.4~14.2% 향상, 기존 텍스트 통신 대비 3.1~5.4% 우수한 성능을 보였으며 평균 2.5배 지연 시간 단축을 달성했다. 학습 가능한 게이팅 메커니즘이 캐시 통신의 이점을 얻을 대상 레이어를 선택하며, 코드는 공개되어 있다.

AI 요약

다중 LLM 시스템에서 텍스트 기반 통신의 한계를 극복하기 위해 KV-캐시를 직접 융합하는 Cache-to-Cache(C2C) 패러다임이 제안됐다. C2C는 신경망으로 소스 모델의 KV-캐시를 대상 모델에 투영·융합하고, 학습 가능한 게이팅으로 캐시 통신의 수혜 레이어를 선택한다. 실험 결과 개별 모델 대비 평균 정확도 6.4~14.2% 향상, 텍스트 통신 대비 3.1~5.4% 우수한 성능, 지연 시간은 평균 2.5배 단축됐다. ICLR 2026에 게재됐다.

핵심 포인트

  • 논문 제목: "Cache-to-Cache: Direct Semantic Communication Between Large Language Models" (arXiv:2510.03215)
  • 저자: Tianyu Fu 외 6인, 2025년 10월 3일 제출, 2026년 3월 2일 개정
  • 개별 모델 대비 평균 정확도 6.4~14.2% 향상, 텍스트 통신 대비 3.1~5.4% 향상
  • 지연 시간 평균 2.5배 단축, ICLR 2026 게재

향후 전망

  • 텍스트를 매개하지 않는 모델 간 통신이 멀티 에이전트 시스템의 표준 패러다임으로 자리잡을 가능성
  • KV-캐시 융합 기법이 이기종 모델 간 협업 및 추론 효율화 연구로 확장될 전망
출처:hackernews
Share

이것도 읽어보세요

댓글

이 소식에 대한 의견을 자유롭게 남겨주세요.

댓글 (0)

불러오는 중...