얀덱스, 800억 파라미터 AI 모델 공개
제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.
핵심 포인트
- 얀덱스가 토큰당 30억개 파라미터만 활성화하는 800억 파라미터 기초 모델을 공개했다.
- 러시아어 평가에서는 강점을 보였지만 영어 평가에서는 비교 모델에 뒤졌다.
- 얀덱스(Yandex)가 전체 800억개 파라미터 가운데 각 토큰 처리에 30억개만 활성화하는 대규모 언어모델을 공개했다.
본문
얀덱스가 토큰당 30억개 파라미터만 활성화하는 800억 파라미터 기초 모델을 공개했다. 러시아어 평가에서는 강점을 보였지만 영어 평가에서는 비교 모델에 뒤졌다. 얀덱스(Yandex)가 전체 800억개 파라미터 가운데 각 토큰 처리에 30억개만 활성화하는 대규모 언어모델을 공개했다. 얀덱스는 21일 AliceAI-Foundation-80B-A3B-Base를 공개했다. 베도모스티는 얀덱스 관계자의 설명을 바탕으로 학습 규모를 18조 토큰으로 보도했다. 반면 모델 카드에는 각 2조 토큰 규모의 별도 학습 실험을 진행했다는 설명이 담겨 있어 두 수치를 같은 학습 단계로 단정하기는 어렵다. 모델 카드에 따르면 AliceAI는 러시아어 사실 지식 벤치마크 WikiWebFacts와 HardMultiQA에서 각각 86.5점과 67.9점을 기록했다.
TriviaQA에서 AliceAI는 79.0점으로 DeepSeek-V4-Flash-Base의 89.4점과 Nemotron-3-Super-120B-A12B-Base의 89.8점에 뒤졌다.
베도모스티는 스베르방크 측이 이번 공개를 러시아 엔지니어링 역량을 보여주는 사례로 평가하면서도, 세계 AI 경쟁의 기준은 수백억~수조 파라미터 규모의 플래그십 모델이라고 지적했다고 전했다. 러시아 디지털경제 관련 단체와 AI 산업연합 관계자는 공개 라이선스가 상업용 제품 개발의 법적 장벽을 낮춘다고 평가했다. 이번 공개는 모델 총량뿐 아니라 공개 가중치와 토큰당 일부 파라미터만 활성화하는 구조를 함께 제시했다는 데 의미가 있다. 대규모 희소 모델 간 구조 비교는 딥시크 V4.1 플래시의 활성 파라미터 공개 보도 에서도 다뤄진 바 있다.