AIRA₂는 ML 벤치마크에서 1위를 차지하고 이전 에이전트보다 9% 포인트 뛰어난 성능을 발휘합니다.
제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.
핵심 포인트
- Meta FAIR, UCL, Oxford의 AI 연구 에이전트 AIRA₃가 Kaggle 대회에서 4,000개 팀 중 8위를 차지하여 금메달을 획득했습니다.
- Meta FAIR, UCL 및 Oxford가 구축한 AI 연구 에이전트는 구조화된 기계 학습 경쟁에서 수천 명의 인간 경쟁사를 능가했습니다.
- AI 에이전트는 자체 게임에서 대략 3,992개의 인간 팀을 이겼습니다.
본문
Meta FAIR, UCL, Oxford의 AI 연구 에이전트 AIRA₃가 Kaggle 대회에서 4,000개 팀 중 8위를 차지하여 금메달을 획득했습니다. Meta FAIR, UCL 및 Oxford가 구축한 AI 연구 에이전트는 구조화된 기계 학습 경쟁에서 수천 명의 인간 경쟁사를 능가했습니다. AI 에이전트는 자체 게임에서 대략 3,992개의 인간 팀을 이겼습니다. Meta의 FAIR 연구소, University College London, University of Oxford의 연구진이 개발한 자율 AI 연구 에이전트 AIRA₂가 AI 추론에 초점을 맞춘 Kaggle 대회에서 4,000개 팀 중 8위를 차지하며 금메달을 획득했습니다. AIRA 에이전트 라인(이름은 AI Research Agent의 약자)은 복잡한 기계 학습 엔지니어링 문제를 자율적으로 해결하도록 설계되었습니다.
AIRA는 단일 모델을 실행하고 최고를 기대하는 대신 8개의 Nvidia H200 GPU에서 실행되는 비동기식 다중 GPU 실행 전략을 사용합니다. 또한 에이전트는 동적 ReAct 스타일 연산자를 사용합니다. 즉, 문제를 단계별로 추론하고 접근 방식을 즉시 조정하며 여러 프로세서에서 동시에 코드를 실행할 수 있습니다. 30개의 실제 Kaggle 대회를 기반으로 구축된 구조화된 벤치마크인 MLE-bench-30에서 AIRA₂는 24시간의 계산 후 평균 백분위수 순위 81.5%를 달성했습니다. 다른 에이전트의 이전 최고 기준은 72.7%로 AIRA₂의 개선 효과는 경쟁 제품보다 약 9% 포인트 높았습니다. AIRA₂는 AIRS-Bench 평가에서 20개 작업 중 6개 작업에서 인간의 최고 성능을 능가했습니다.
프레임워크는 팀이 AIRA-dojo 접근 방식이라고 부르는 방식을 기반으로 구축되었으며, 이는 이전 에이전트의 한계를 해결하기 위해 특별히 설계되었습니다. AIRA의 성공은 AI가 복잡한 문제 해결에서 인간의 능력을 뛰어넘어 미래 AI 애플리케이션을 재구성할 수 있는 잠재력을 강조합니다. 포스트 AIRA₂는 ML 벤치마크에서 1위를 차지했으며, 이전 에이전트보다 9% 포인트 더 뛰어난 성능을 보였습니다. Crypto Briefing에 처음 등장했습니다.