MIT와 Sakana AI의 SIFT 프레임워크로 자체 개선 코딩 에이전트 판단 비용 절감
제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.
핵심 포인트
- MIT와 Sakana AI의 SIFT 프레임워크는 Polyglot에서 30단계로 35.1%를 달성했으며 DGM 비용의 약 1/10인 약 34달러에 대한 전체 검색을 실행했습니다.
- 새로운 방법은 언어 모델을 사용하여 코드 변경 사항을 직접 참조하여 컴퓨팅 비용의 일부만으로 Polyglot에서 35.1%를 기록했습니다.
- 자신의 코드를 다시 작성하는 코딩 에이전트에는 조용한 문제가 있습니다.
본문
MIT와 Sakana AI의 SIFT 프레임워크는 Polyglot에서 30단계로 35.1%를 달성했으며 DGM 비용의 약 1/10인 약 34달러에 대한 전체 검색을 실행했습니다. 새로운 방법은 언어 모델을 사용하여 코드 변경 사항을 직접 참조하여 컴퓨팅 비용의 일부만으로 Polyglot에서 35.1%를 기록했습니다. 자신의 코드를 다시 작성하는 코딩 에이전트에는 조용한 문제가 있습니다. MIT와 Sakana AI의 연구원들은 이러한 검사를 수행하는 더 저렴한 방법을 찾았다고 생각합니다. Fast Tree-search를 통한 자기 개선(Self-Improvement via Fast Tree-search)의 약자인 SIFT라는 프레임워크는 단 30개의 확장 단계 후에 Polyglot 코딩 벤치마크에서 전체 점수 35.1%를 기록했습니다. 재귀적 자기 개선 코딩 에이전트는 작가가 자신의 초안을 수정하는 것처럼 작동합니다.
이 논문은 MIT의 Xinghong Fu가 Aravinth Kulanthaivelu 및 Yutaro Yamada와 함께 작성했으며 Sakana AI가 공동 연구실로 참여했습니다. 대화의 대부분은 비용 절감과 언어 모델 판단자가 실제로 얼마나 좋은지에 대한 중요성이 커지는 두 가지 주제에 중점을 두었습니다. 도쿄에 위치한 연구소는 AI 개발에서 무차별 대입 전략보다 진화적인 발견 방법을 강조해 왔으며 SIFT는 문제에 더 많은 하드웨어를 투입하기보다는 더 스마트하게 작업하는 사례입니다. DGM은 에이전트가 반복 검색을 통해 스스로를 개선할 수 있다는 사실을 확립했으며 SIFT는 검색 비용을 크게 높이는 평가 병목 현상을 목표로 합니다. SIFT의 전체 전제는 언어 모델 심사위원이 좋은 판정을 내리는 것에 달려 있습니다. 이것이 바로 심사위원의 품질이 논문 토론에서 중심 화두로 등장한 이유입니다.
SIFT의 비용 효율적인 평가 방법은 AI 자체 개선을 민주화하여 리소스 장벽을 줄여 잠재적으로 혁신을 가속화합니다. 포스트 MIT와 Sakana AI의 SIFT 프레임워크는 Crypto Briefing에 처음 등장한 자체 개선 코딩 에이전트를 판단하는 비용을 절감합니다.