퍼플렉시티 도구 호출 실패율 21.2% 낮췄다
제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.
핵심 포인트
- 퍼플렉시티가 실제 사용자 세션의 오류와 수정 내용을 학습에 반영해 후속 체크포인트의 도구 호출 실패율을 낮췄다.
- 퍼플렉시티가 실제 사용자 세션에서 발생한 오류와 사용자 수정 내용을 모델 학습에 반영해 도구 호출 실패율을 2.24%에서 1.77%로 낮췄다.
- 퍼플렉시티는 21일 연구 블로그 ‘Learning from Real-World Mistakes’에서 두 후속 학습 체크포인트를 비교한 온라인 A/B 테스트 결과를 공개했다.
본문
퍼플렉시티가 실제 사용자 세션의 오류와 수정 내용을 학습에 반영해 후속 체크포인트의 도구 호출 실패율을 낮췄다. 퍼플렉시티가 실제 사용자 세션에서 발생한 오류와 사용자 수정 내용을 모델 학습에 반영해 도구 호출 실패율을 2.24%에서 1.77%로 낮췄다. 퍼플렉시티는 21일 연구 블로그 ‘Learning from Real-World Mistakes’에서 두 후속 학습 체크포인트를 비교한 온라인 A/B 테스트 결과를 공개했다. 성공한 세션에서는 유효한 행동을 학습하고, 실패한 세션에서는 사용자 수정과 도구 오류를 바탕으로 교정이 필요한 지점을 추출했다. 퍼플렉시티는 도구 오류가 표시된 985개 세션을 별도로 재생성한 실험도 제시했다. 오류 회피가 곧 도구 호출 성공이나 전체 작업 성공을 의미하지는 않는다.
오프라인 평가에서는 기본 GLM 5.2의 도구 오류율이 2.79%, RFT 전용 체크포인트가 1.35%, RFT와 OPSD를 함께 적용한 체크포인트가 0.87%로 집계됐다.
첫 번째 실험에서 초기 RFT·OPSD 체크포인트의 도구 실패율은 2.82%로 GLM 5.2의 2.94%보다 낮았지만 통계적으로 유의미한 차이는 아니었다. 관련 연구인 DART-SD 논문도 다중 단계 도구 호출 과정에서 이미 올바르게 수행한 부분까지 전체적으로 다시 학습하면 유효한 탐색 행동이 훼손될 수 있다고 지적했다. 레딧 퍼플렉시티 커뮤니티에서는 일부 사용자가 장시간 검색 뒤 도구 호출이 중단되거나 오류가 발생한다고 보고했다. 이번 결과는 AI 에이전트 학습에서 최종 답변의 성공 여부뿐 아니라 검색과 외부 도구 호출 과정에서 발생한 오류까지 학습 신호로 활용할 수 있음을 보여준다. 다만 공개된 수치는 도구 호출 신뢰성 개선을 뒷받침할 뿐, 사용자 만족도나 전체 작업 성공률이 함께 개선됐다는 근거로 확대 해석하기는 어렵다.