AI 모델 KV-캐시 통신, 지연시간 2.5배 단축
제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.
핵심 포인트
- 칭화대 연구진이 대규모 언어 모델 간 KV-캐시 직접 통신 기술을 공개했다.
- 단일 모델보다 정확도가 최대 14.2% 높아졌지만 모델 확장성과 오류 전파 문제는 남았다.
- 대규모 언어 모델(LLM)이 텍스트 대신 내부 상태인 KV-캐시를 직접 주고받는 통신 기술이 공개됐다.
본문
칭화대 연구진이 대규모 언어 모델 간 KV-캐시 직접 통신 기술을 공개했다. 단일 모델보다 정확도가 최대 14.2% 높아졌지만 모델 확장성과 오류 전파 문제는 남았다. 대규모 언어 모델(LLM)이 텍스트 대신 내부 상태인 KV-캐시를 직접 주고받는 통신 기술이 공개됐다. 칭화대 연구진은 이 방식으로 모델 간 평균 통신 지연시간을 기존 텍스트 기반 방식보다 2.5배 단축했다고 밝혔다. 연구진이 제안한 ‘Cache-to-Cache(C2C)’는 한 모델의 KV-캐시를 다른 모델의 표현 공간으로 변환한 뒤 결합하는 구조다. 모델 규모는 0.6B부터 14B까지였고 OpenBookQA, MMLU-Redux, ARC-Challenge, C-Eval 등 벤치마크가 사용됐다. 텍스트 기반 모델 통신과 비교해도 정확도가 3.1~5.4% 개선됐다. 논문은 KV-캐시가 단순한 계산용 임시 저장공간을 넘어 모델 간 의미 전달 수단이 될 수 있다고 설명했다.
모델 조합이 늘어날수록 퓨저 학습 비용과 통신 과정에서 발생하는 오류를 함께 관리해야 한다. 실험 결과는 단일 NVIDIA A100 GPU와 제한된 응답 길이, 연구진이 정한 모델 조합에서 측정됐다. 저장소에는 일부 모델 조합에 사용할 수 있는 사전 학습 퓨저와 학습·평가 예제가 포함됐지만, C2C가 모든 모델 조합에 즉시 적용되는 범용 통신 표준으로 공개된 것은 아니다. 이번 연구는 중국 연구진이 AI 모델 간 통신 구조를 바꾸는 방법을 제시했다는 데 의미가 있다.