AI 평가자 자기 계열 선호…리더보드 신뢰도 시험대
제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.
핵심 포인트
- AI 모델이 다른 모델의 답변을 평가할 때 자신과 유사한 계열의 답변을 더 높게 평가하는 현상이 여러 실험에서 관찰됐다.
- 크립토브리핑(CryptoBriefing)은 AI 평가자가 자신의 답변을 약 58%의 확률로 선호한다는 연구 결과를 소개했다.
- 4개 모델 모두 자기 계열 답변을 상대적으로 선호했고, 자기 선호 지수 평균은 +0.14였다.
본문
AI 모델이 다른 모델의 답변을 평가할 때 자신과 유사한 계열의 답변을 더 높게 평가하는 현상이 여러 실험에서 관찰됐다. 크립토브리핑(CryptoBriefing)은 AI 평가자가 자신의 답변을 약 58%의 확률로 선호한다는 연구 결과를 소개했다. 4개 모델 모두 자기 계열 답변을 상대적으로 선호했고, 자기 선호 지수 평균은 +0.14였다. 연구진은 이를 자기 답변을 알아보고 편드는 현상이라기보다, 자신과 유사한 문체·구성·표현 분포를 더 자연스럽거나 우수하다고 판단하는 현상으로 분석했다. AI 평가자가 모델의 답변을 채점하고 그 결과가 모델 순위나 학습 데이터에 다시 반영되면 평가자의 선호가 순위에 누적될 수 있다. AAAI에 게재된 2026년 연구는 모델마다 선호 편향이 달라 평가자별 순위가 일관되지 않을 수 있다고 지적했다.
한 Reddit 실험에서는 인간 29명과 AI 평가자 13개가 1181건의 쌍대 비교를 수행했고, 32개 질문 가운데 26개에서 같은 방향의 선호를 보였다고 작성자가 밝혔다.
모델이 자기 계열 답변을 선호한 일부 원인은 실제 답변 품질 차이일 수 있어, 편향과 품질 차이를 분리하는 추가 실험이 필요하다. 평가의 독립성과 검증 인프라를 둘러싼 논쟁은 앞서 AI 평가자의 접근권과 편집권, 보복 방지 장치를 요구한 사례 에서도 제기됐다. 현재 확인된 연구들은 AI 평가자에게 자기 선호와 순서·길이 편향이 나타날 수 있음을 보여준다. 이번 논의의 핵심은 AI 모델 순위와 벤치마크를 단일 평가자의 결과만으로 판단하기보다 평가자 다변화, 인간 표본 대조, 답변 순서 교차, 길이·문체 편향 검사를 함께 적용해야 한다는 점이다. ◇ AI 평가자 편향의 구조 Chatbot Arena는 두 모델의 답변을 익명으로 비교한 뒤 이용자가 더 선호하는 답변을 선택하도록 설계된 평가 플랫폼이다.