앤트로픽 고객지원 AI, 비용 5분의 1·정확도 90.5%
제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.
핵심 포인트
- 앤트로픽이 Claude Code에 AI 애플리케이션 평가와 자동 조정 기능을 추가했다.
- 고객지원 사례에서 정확도는 78.6%에서 90.5%로 높아졌고 건당 비용은 약 1센트로 줄었다.
- 앤트로픽의 고객지원 AI 사례에서 응답 정확도가 78.6%에서 90.5%로 높아지고 건당 비용은 기존의 약 5분의 1로 줄었다.
본문
앤트로픽이 Claude Code에 AI 애플리케이션 평가와 자동 조정 기능을 추가했다. 고객지원 사례에서 정확도는 78.6%에서 90.5%로 높아졌고 건당 비용은 약 1센트로 줄었다. 앤트로픽의 고객지원 AI 사례에서 응답 정확도가 78.6%에서 90.5%로 높아지고 건당 비용은 기존의 약 5분의 1로 줄었다. 앤트로픽은 9월 28일 개발자 블로그에서 Claude Code에서 사용할 수 있는 ‘claude-api’ 스킬에 ‘build-eval’과 ‘hillclimb’ 명령을 추가했다고 밝혔다. build-eval은 실제 운영 기록과 고객지원 티켓 등을 바탕으로 평가 세트를 만들고, hillclimb는 평가 결과에 따라 프롬프트와 모델, 매개변수를 한 번에 하나씩 조정한다. 이후 낮은 추론 강도의 Opus 5.5를 적용하자 정확도는 87.8%로 높아졌고 비용은 건당 1.9센트(약 26원)로 낮아졌다.
앤트로픽은 모델 변경과 프롬프트 정리가 비용 절감에 함께 영향을 줬다고 설명했다.
낮은 추론 강도의 Sonnet 5는 정확도 약 88.9%를 기록하면서 비용을 건당 약 1센트(약 14원)로 줄였다. 별도로 남겨둔 14건의 검증용 티켓에서는 최종 설정이 90.5%를 기록해 기존 설정의 78.6%를 웃돌았다. 이후 오류 보고와 고객지원 티켓, 개발자가 직접 작성한 5~10개 사례, 코드에서 합성한 사례 순으로 입력값을 구성하고, 개발자가 각 입력값을 확인한 뒤 평가에 반영한다. 해당 평가의 통과율은 66%에서 약 88%로 높아졌고, 이 과정에서 누락된 기능과 프로그래밍 언어별 문서 오류, 문제와 채점 기준이 맞지 않는 사례를 찾아 수정했다. 다만 이번 수치는 앤트로픽의 내부 고객지원 사례에서 나온 결과로, 다른 서비스에서도 같은 개선이 나타나는지는 평가 데이터와 채점 방식에 따라 달라질 수 있다.