코인베이스 과거 평가서 GPT 재현율 20.7%포인트 하락
제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.
핵심 포인트
- 코인베이스의 과거 결제 거래 평가에서 최신 오푸스·소넷·GPT 모델은 이전 버전보다 사기 탐지율과 사기 금액 포착률이 낮았다.
- GPT-5.6 (sol)은 정밀도가 11.5%포인트 높았지만 재현율은 20.7%포인트 떨어졌다.
- 코인베이스의 과거 결제 거래 평가에서 오푸스·소넷·GPT 계열 최신 모델은 이전 버전보다 사기 거래와 사기 금액을 덜 포착했다.
본문
코인베이스의 과거 결제 거래 평가에서 최신 오푸스·소넷·GPT 모델은 이전 버전보다 사기 탐지율과 사기 금액 포착률이 낮았다. GPT-5.6 (sol)은 정밀도가 11.5%포인트 높았지만 재현율은 20.7%포인트 떨어졌다. 코인베이스의 과거 결제 거래 평가에서 오푸스·소넷·GPT 계열 최신 모델은 이전 버전보다 사기 거래와 사기 금액을 덜 포착했다. GPT-5.6 (sol)은 사기로 표시한 거래의 정확도는 높였지만, 전체 사기 거래와 금액을 찾아내는 비율은 낮아졌다. 코인베이스($COIN)는 10월 7일 공개한 자체 평가에서 오푸스 4.5와 오푸스 5, 소넷 4.6과 소넷 5, GPT-5.4와 GPT-5.6 (sol)을 비교했다. GPT-5.6 (sol)의 정밀도는 이전 모델보다 11.5%포인트 높았다. 반면 재현율은 20.7%포인트, 달러 가중 재현율은 21.8%포인트 낮았다.
오푸스의 재현율은 0.8%포인트 하락했고, 소넷은 재현율과 달러 가중 재현율이 각각 22.2%포인트, 22.9%포인트 떨어졌다.
코인베이스는 하락 원인이 모델 학습 방식이나 특정 변경 때문인지 확인하지 못했다고 밝혔다. 코인베이스는 앞선 별도 온라인 실험에서 기존 머신러닝 모델과 규칙에 AI 검토를 추가한 뒤 사기 거래가 30%, 사기 금액이 22% 줄었다고 발표했다. 코인베이스는 10월 8일 공개한 별도 평가에서 사기 데이터로 추가 학습한 Qwen3.5-9B가 오푸스 4.5보다 네 가지 탐지 지표에서 높은 결과를 냈다고 밝혔다. F1 점수는 9.6%포인트 높았고, 온라인 추론 지연 시간은 55% 짧았다.