마이크로소프트 리서치 아시아가 실제 배포 환경의 에이전트 하니스를 그대로 강화학습에 참여시키는 '하니스드 에이전틱 RL' 패러다임을 제시하고, 이를 구현한 경량 오픈소스 프레임워크 '에이전트 라이트닝 v1.0'을 공개했다. 전체 코드가 약 3500줄에 불과하며, API 게이트웨이·롤아웃 컨트롤러·커스텀 트레이너 3대 구성요소로 이뤄져 기존 코딩 에이전트의 하니스를 변경하지 않고도 LLM 프록시를 통해 훈련에 연결할 수 있다. 쿠버네티스 네이티브 지원으로 상용 샌드박스 서비스 없이 자체 클러스터에서 에이전트를 실행할 수 있으며, '병렬 비동기 RL' 기법으로 동기식 대비 약 2배의 속도 향상을 달성했다. 약 6000개의 학습 샘플만으로 Qwen3.5-9B 모델의 SWE-bench Verified 성능을 41.8%에서 56.4%로 14.6%포인트 끌어올렸다.
- •마이크로소프트, 실제 배포 하니스를 RL 훈련에 직접 참여시키는 '하니스드 에이전틱 RL' 제안
- •전체 프레임워크 약 3500줄의 경량 코드로 구현
- •쿠버네티스 네이티브 지원으로 상용 샌드박스 서비스 불필요
- •'병렬 비동기 RL'로 동기식 대비 약 2배 속도 향상, GPU 사용량도 절감
- •6000개 샘플만으로 SWE-bench Verified 정확도 41.8%→56.4% 달성
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Agent Lightning v1.0: A 3,500-Line Lightweight Agentic RL Framework for Training Agents with Real Harnesses
- 1.MS리서치아시아, 실제 에이전트 하네스를 RL 훈련에 그대로 참여시키는 'Harnessed Agentic RL' 공개
- 2.약 3500줄 경량 프레임워크 'Agent Lightning v1.0', 쿠버네티스 네이티브 지원으로 상용 샌드박스 불필요
- 3.Qwen3.5-9B 코딩 에이전트가 SWE-bench Verified에서 41.8%→56.4%로 14.6%포인트 향상
- 4.'Collocated Async RL' 방식으로 동기식 대비 약 2배 속도 개선, GPU 사용량도 절감
왜 중요한가?
훈련용으로 에이전트 루프를 별도로 재구현해야 했던 기존 방식과 달리 실제 배포되는 하네스를 그대로 RL에 활용할 수 있게 해, 훈련된 에이전트와 배포되는 에이전트 간 불일치 문제를 해소한다.
본문 미리보기
Training AI agents with reinforcement learning can be challenging because their tools, context, and decision-making are managed by complex frameworks. Agent Lightning connects existing agents to RL training, making it easier to improve them without rebuilding them. The post Agent Lightning v1.0: A 3,500-Line Lightweight Agentic RL Framework for Training Agents with Real Harnesses appeared first on Microsoft Research.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:02AI 초안

