그록 4.7, 코딩 평가 1~3위…심사위원 달라 직접 비교엔 한계
제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.
핵심 포인트
- 그록 4.7은 VulcanBench Frontier v4에서 추론 수준별로 1~3위를 기록했다.
- 코드 품질 심사에 다른 심사위원이 참여해 모델 간 점수를 직접 비교하기는 어렵다.
- 그록 4.7이 코딩 평가에서 추론 수준별로 1~3위를 기록했지만, 심사위원 구성이 달라 점수만으로 다른 모델보다 코딩을 잘한다고 결론 내리기는 어렵다.
본문
그록 4.7은 VulcanBench Frontier v4에서 추론 수준별로 1~3위를 기록했다. 코드 품질 심사에 다른 심사위원이 참여해 모델 간 점수를 직접 비교하기는 어렵다. 그록 4.7이 코딩 평가에서 추론 수준별로 1~3위를 기록했지만, 심사위원 구성이 달라 점수만으로 다른 모델보다 코딩을 잘한다고 결론 내리기는 어렵다. VulcanBench는 10월 4일 Frontier v4 평가 결과를 공개했다. 그록 4.7은 Cursor의 코딩 에이전트 CLI에서 23개 과제를 수행해 최고 수준 설정에서 93.15점으로 1위, 높은 수준에서 92.71점으로 2위, 중간 수준에서 92.30점으로 3위를 기록했다. VulcanBench는 다른 모델의 코드 품질을 평가할 때 그록 4.6을 심사위원으로 포함했지만, 그록 4.7 평가에는 GPT-6.1 Sol을 대신 사용했다.
VulcanBench는 이 차이 때문에 그록 4.7의 종합 점수를 다른 모델과 직접 비교하는 데 한계가 있다고 밝혔다.
공통 심사위원인 Muse Spark 1.3의 점수만 비교한 결과에서도 그록 4.7은 중간·높음·최고 수준에서 상위권을 유지했다. xAI는 9월 21일 그록 4.7을 공개하며 그록 4.6보다 더 큰 기반 모델을 사용했다고 밝혔다. 회사가 제시한 API 가격은 입력 토큰 100만 개당 2달러(약 2686원), 출력 토큰 100만 개당 6달러(약 8058원)다. 평가 지표와 실행 조건이 달라 Frontier v4 점수와 직접 묶어 비교하기는 어렵다. 이번 결과는 특정 코딩 과제와 Cursor 환경에서 그록 4.7이 높은 점수를 기록했다는 점을 보여준다.