토큰포스트 주요 시장 뉴스
제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.
핵심 포인트
- 智谱가 국산 칩 10만 장 기반의 최대 200 tokens/s 추론 속도를 내세운 GLM-5.3-FlashX를 출시했다.
- 智谱는 GLM-5.3-FlashX가 국산 칩 10만 장에서 제공하는 추론 연산력을 기반으로 속도를 높였다고 밝혔다.
- 회사는 인프라와 추론 최적화 투자도 추가했다고 PANews는 보도했다.
본문
智谱가 국산 칩 10만 장 기반의 최대 200 tokens/s 추론 속도를 내세운 GLM-5.3-FlashX를 출시했다. 智谱는 GLM-5.3-FlashX가 국산 칩 10만 장에서 제공하는 추론 연산력을 기반으로 속도를 높였다고 밝혔다. 회사는 인프라와 추론 최적화 투자도 추가했다고 PANews는 보도했다. GLM-5.3-FlashX의 기반 모델인 GLM-5.3-Flash는 8월 26일 공개됐다. 총 매개변수는 3200억 개, 한 번의 추론 과정에서 활성화되는 매개변수는 180억 개이며 100만 tokens의 컨텍스트 창을 지원한다. 활성 매개변수는 입력을 처리할 때 실제 계산에 참여하는 부분으로, 전체 규모를 유지하면서도 한 번의 요청에 필요한 연산량을 줄이는 데 활용된다. 100만 tokens 컨텍스트는 한 번의 요청에서 모델이 처리할 수 있는 입력과 대화 기록의 범위를 나타낸다.
다만 컨텍스트 창의 크기와 실제 응답 속도는 서로 다른 지표이므로, 긴 입력을 처리할 때도 최대 속도가 동일하게 유지된다고 볼 수는 없다. 智谱는 GLM-5.3-FlashX의 최고 추론 속도를 200 tokens/s로 제시했다. 따라서 200 tokens/s가 어떤 입력 길이와 하드웨어 구성에서 측정됐는지는 추가 운영 자료를 통해 확인할 필요가 있다. 이후 정식 모델명이 공개되면서 智谱의 GLM-5 계열 모델로 확인됐고, 이번 FlashX 출시는 해당 모델 계열을 API와 체험 서비스에서 활용하는 단계로 이어졌다. GLM-5.3-FlashX의 실제 성능은 향후 공개될 세부 벤치마크와 API 운영 자료에서 비교할 수 있다.