Anthropic Ships Claude Fable 5.1, 주요 벤치마크에서 이전 버전의 두 배 이상 증가
제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.
핵심 포인트
- Fable 5.1과 그 제한된 형제 Mythos 5.1은 수출 통제로 인해 Anthropic이 Fable 5를 18일 동안 오프라인으로 전환한 지 3개월 후에 출시됩니다.
- 이는 6월 9일 Fable 5가 출시된 이후 Mythos급 모델 라인에 대한 첫 번째 업데이트입니다.
본문
Fable 5.1과 그 제한된 형제 Mythos 5.1은 수출 통제로 인해 Anthropic이 Fable 5를 18일 동안 오프라인으로 전환한 지 3개월 후에 출시됩니다. Anthropic은 화요일에 Claude Fable 5.1과 Claude Mythos 5.1을 출시했습니다. 이는 6월 9일 Fable 5가 출시된 이후 Mythos급 모델 라인에 대한 첫 번째 업데이트입니다. 회사는 새로운 AI 모델이 세계에서 "코딩 및 지식 작업에 가장 앞선 모델"이라고 주장하며 3가지를 달성했습니다. 이미 18일간의 수출 통제 중단, 한여름 구독 액세스를 둘러싼 가격 싸움, Fable 5의 가격을 낮추는 Claude Opus 5의 7월 출시 등이 포함된 출시 주기가 몇 달이 지났습니다. Fable 5.1과 Mythos 5.1은 Anthropic에 따라 서로 다른 안전 필터가 적용된 동일한 기본 모델입니다.
Anthropic의 헤드라인 번호는 AI 에이전트가 명령줄 환경 내에서 과학 연구 작업을 수행할 수 있는지 테스트하는 벤치마크인 Terminal-Bench-Science 0.1에서 따온 것이며 합격률로 점수가 매겨집니다. Fable 5.1은 52.6%를 기록했는데, Fable 5는 24.7%, Opus 5는 29.0%를 기록했는데, 이는 전작보다 2배 이상 높은 수치입니다. 더 가벼운 사이버 보안 필터로 실행되는 Mythos 5.1은 동일한 테스트에서 60.9%를 기록했습니다. Anthropic은 이러한 격차가 자사의 보호 장치가 차단하여 Opus 4.8로 다시 라우팅된 작업을 반영한다고 말합니다.
수십 개의 학문 분야에 걸쳐 전문가 수준의 질문으로 구성되어 합격률로 점수를 매기는 다학제적 추론 테스트인 Humanity's Last Exam에서 Fable 5.1은 외부 도구 없이는 60.9%, 외부 도구를 사용하면 65.0%를 기록하여 Opus 5보다 앞서서 이것이 Anthropic의 학문적 목적을 위한 가장 발전된 모델임을 보여줍니다. 7월에 출시된 Opus 5는 Fable 5 토큰당 가격의 절반 비용이 드는 동시에 대부분의 주요 벤치마크에서 Fable 5를 능가하여 대부분의 유료 사용자에게 플래그십 모델을 효과적으로 중복하게 만들었습니다. Fable 5.1은 이를 반전시킵니다. 이전에 Opus 5가 Fable 5를 이겼던 벤치마크를 포함하여 Anthropic이 발표한 모든 벤치마크에서 Opus 5를 능가합니다. 모델에 대한 Anthropic의 자체 주장은 원시 점수가 아닌 노력 수준에 의존합니다.
Fable 5.1을 낮거나 중간 정도의 추론 노력에서 실행하면 훨씬 낮은 비용으로 Fable 5의 이전 결과와 일치하거나 능가하는 동시에 다른 모든 것을 방해하는 문제에 대해 최고 노력 계층을 확보한다고 말합니다. Pro 요금제 및 표준 Team 또는 Enterprise 시트에서 Fable 5.1은 해당 요금제의 주간 한도에 포함되지 않으므로 API 요율로 청구되는 종량제 사용 크레딧에서 전적으로 인출됩니다. Claude Fable 5.1은 이제 Claude API, Amazon Bedrock, Google Cloud 및 Microsoft Foundry에서 모델 ID "claude-fable-5-1"로 제공됩니다.