큐웬 3.8 플래시, 문맥 10만 토큰서 출력속도 3할 하락
제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.
핵심 포인트
- 비탈릭 부테린이 AMD 스트릭스 헤일로 노트북에서 로컬 AI 모델을 실측했다.
- 문맥이 수천 토큰에서 10만 토큰 이상으로 늘자 출력 속도는 초당 28~33토큰에서 18~21토큰으로 떨어졌다.
- 비탈릭 부테린이 로컬 AI 모델의 문맥 길이를 10만 토큰 이상으로 늘리자 출력 속도가 초당 18~21토큰으로 낮아지는 실측 결과를 공개했다.
본문
비탈릭 부테린이 AMD 스트릭스 헤일로 노트북에서 로컬 AI 모델을 실측했다. 문맥이 수천 토큰에서 10만 토큰 이상으로 늘자 출력 속도는 초당 28~33토큰에서 18~21토큰으로 떨어졌다. 비탈릭 부테린이 로컬 AI 모델의 문맥 길이를 10만 토큰 이상으로 늘리자 출력 속도가 초당 18~21토큰으로 낮아지는 실측 결과를 공개했다. 부테린은 AMD 스트릭스 헤일로(Strix Halo) 플랫폼을 탑재한 노트북에서 큐웬 3.8 플래시(Qwen 3.8 flash)를 오픈소스 추론 프레임워크 라마.cpp(llama.cpp)로 실행했다. 체인뉴스(ABMedia)는 그가 10개 테스트의 성능표를 공개했다고 전했다. 테스트는 기존 문맥 길이에 따라 짧은 문맥과 긴 문맥 두 그룹으로 나뉘었다. 기존 문맥이 2136~7799토큰인 6개 테스트에서 출력 속도는 초당 28.07~33.37토큰이었다.
짧은 문맥 그룹에서는 한 차례를 제외하고 초당 300~373토큰이었지만, 긴 문맥 그룹에서는 초당 150~198토큰으로 낮아졌다.
짧은 문맥 그룹의 예외적인 입력 처리 속도는 초당 109.82토큰이었다. 문맥 길이는 모델이 한 번에 참고하는 입력 정보의 범위를 뜻하며, 문맥이 길어질수록 모델이 처리해야 할 정보량도 늘어난다. 이번 결과는 같은 노트북에서 문맥 길이에 따른 성능 변화를 비교한 자료다. 이번 결과는 특정 노트북에서 문맥 길이에 따른 로컬 모델의 처리 속도 차이를 보여준 측정값이다.