소넷 5.5, 에이전트 평가 3위…4위와 점수 차 0.25%p
제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.
핵심 포인트
- 클로드 소넷 5.5(Max)가 Agent Arena 순위표에서 순 개선 점수 12.52%로 3위를 기록했다.
- 4위 GPT-6 아스트라(Max)와의 차이는 0.25%포인트로, 오차 범위보다 작다.
- 클로드 소넷 5.5(Max)가 Agent Arena 공개 순위에서 순 개선 점수 12.52%로 3위를 기록했다.
본문
클로드 소넷 5.5(Max)가 Agent Arena 순위표에서 순 개선 점수 12.52%로 3위를 기록했다. 4위 GPT-6 아스트라(Max)와의 차이는 0.25%포인트로, 오차 범위보다 작다. 클로드 소넷 5.5(Max)가 Agent Arena 공개 순위에서 순 개선 점수 12.52%로 3위를 기록했다. 4위 GPT-6 아스트라(Max)와의 점수 차는 0.25%포인트로, 소넷 5.5의 오차 범위보다 작다. Arena.ai는 10월 2일 공개한 순위표에서 클로드 패블 5.1(Max)이 14.31%로 1위, 클로드 오퍼스 5.5(High)가 13.82%로 2위에 올랐다고 밝혔다. 이번 결과는 해당 평가에서 소넷 5.5가 상위권에 들었다는 것을 보여주지만, GPT-6 아스트라보다 성능이 확실히 높다는 뜻으로 해석하기는 어렵다.
Arena.ai는 실제 에이전트 작업에서 작업 성공, 사용자 피드백, 도구 사용 등 여러 신호를 평균적인 오케스트레이터와 비교해 순 개선 점수를 산출한다고 설명한다.
이 점수는 에이전트 시스템의 작업 수행 개선 정도를 요약하며 모든 업무에서의 모델 우열을 나타내지는 않는다. 소넷 5.5의 작업당 중앙값 비용은 2.76달러(약 3754원), 출력 토큰 중앙값은 11만5800개다. 앤트로픽은 토큰 가격을 입력 100만개당 2달러(약 2720원), 출력 100만개당 10달러(약 1만3600원)로 공개했다. 앤트로픽은 9월 28일 소넷 5.5를 공개하며 코딩과 다단계 작업 성능을 강조했다. 에이전트 모델 비교에서는 앞서 공개된 GPT-6 솔의 Agent Arena 점수와 가격 처럼 성능 순위와 함께 실제 작업의 비용·토큰 사용량도 살펴볼 필요가 있다.