마이크로소프트, 에이전트 강화학습 프레임워크 '에이전트 라이트닝 v1.0' 공개
제목 연관성·주요 수치·시장 영향·향후 전망을 기준으로 핵심 문장을 선별한 요약 브리핑입니다.
핵심 포인트
- [디지털투데이 황치규 기자]마이크로소프트가 에이전트 강화학습(RL) 프레임워크 '에이전트 라이트닝 v1.0'을 깃허브에 공개했다.더뉴스택 최근 보도에 따르면 '에이전트 라이트닝 v1.0'은 학습 엔진이 아니라 프로덕션 하네스가 컨텍스트 구성, 도구 실행, 에이전트-환경 상호작용 루프를 담당하는 것이…
- 이에 따라 개발자들은 에이전트가 도구를 쓰고 환경과 상호작용하는 로직을 학습 시스템 안에 따로 만들 필요가 없다.마이크로소프트는 '적당한 컴퓨팅 자원'으로 학습 더뉴스택 최근 보도에 따르면 '에이전트 라이트닝 v1.0'은 학습 엔진이 아니라 프로덕션 하네스가 컨텍스트 구성, 도구 실행, 에이전트-환경…
- 학습 엔진은 하네스와 주고받는 LLM 질문·답변 기록만 관찰한다.
본문
[디지털투데이 황치규 기자]마이크로소프트가 에이전트 강화학습(RL) 프레임워크 '에이전트 라이트닝 v1.0'을 깃허브에 공개했다.더뉴스택 최근 보도에 따르면 '에이전트 라이트닝 v1.0'은 학습 엔진이 아니라 프로덕션 하네스가 컨텍스트 구성, 도구 실행, 에이전트-환경 상호작용 루프를 담당하는 것이 핵심이다.학습 엔진은 하네스와 주고받는 LLM 질문·답변 기록만 관찰한다. 이에 따라 개발자들은 에이전트가 도구를 쓰고 환경과 상호작용하는 로직을 학습 시스템 안에 따로 만들 필요가 없다.마이크로소프트는 '적당한 컴퓨팅 자원'으로 학습 더뉴스택 최근 보도에 따르면 '에이전트 라이트닝 v1.0'은 학습 엔진이 아니라 프로덕션 하네스가 컨텍스트 구성, 도구 실행, 에이전트-환경 상호작용 루프를 담당하는 것이 핵심이다. 학습 엔진은 하네스와 주고받는 LLM 질문·답변 기록만 관찰한다.
마이크로소프트는 '적당한 컴퓨팅 자원'으로 학습 데이터 6000건만 사용해 큐원3.5-9B 모델을 강화학습했고 그 결과 SWE-벤치 베리파이드 벤치마크 점수가 41.8%에서 56.4%로 14.6포인트 오르는 성과를 거뒀다. 전통적 방식에서는 학습 엔진이 상호작용 루프 전체를 소유해 리토크나이제이션, 샘플 병합, 어드밴티지 계산, 손실 정규화, 학습 백엔드 스케줄링 등 여러 문제가 있었지만 마이크로소프트는 이같은 문제를 해결하기 위해 코딩 에이전트용 데이터 정제 파이프라인과 재현 가능한 학습 스크립트를 함께 제공했다. 전체 프레임워크는 핵심 파이썬 코드 약 3500줄로 구성됐고, MIT 라이선스로 공개됐다.
네브래스카 소재 소프트웨어공학 연구자 라시드 하산은 "실제 프로덕션 하네스를 통해 학습하면 학습·서빙 간 불일치가 줄어든다"며 "도구 프로토콜과 컨텍스트 정책, 복구 동작이 그대로 유지돼 학습 성과가 실제 프로덕션 환경으로 더 잘 이어진다"고 말했다. 콜로라도 소재 데이터 과학자 프리양크 제인은 이번 접근이 머신러닝에서 가장 오래되고 비용이 많이 들어가는 문제인 '학습-서빙 편차'를 없애는 시도라고 평가했다. 다만 실제로는 GPU·쿠버네티스 클러스터를 보유한 플랫폼팀 정도만 활용 가능할 것이라며, 하네스를 바꿀 때마다 모델 가중치에 그 특성이 반영되는 만큼 하하네스 자체도 버전 관리가 필요하다고 지적했다.