마이크로소프트가 에이전트 강화학습(RL) 프레임워크 '에이전트 라이트닝 v1.0'을 깃허브에 MIT 라이선스로 공개했다. 프로덕션 하네스가 컨텍스트 구성과 도구 실행, 에이전트-환경 상호작용 루프를 담당하고 학습 엔진은 LLM 질문·답변 기록만 관찰해 학습-서빙 간 불일치를 줄이는 구조다. 학습 데이터 6000건만으로 큐원3.5-9B 모델을 훈련해 SWE-벤치 베리파이드 점수를 41.8%에서 56.4%로 14.6포인트 끌어올렸다. 핵심 코드는 파이썬 약 3500줄로 가볍지만, 실제 활용은 GPU·쿠버네티스 인프라를 갖춘 팀에 국한될 것이라는 전망도 나온다.
- •프로덕션 하네스가 도구 실행·상호작용 루프를 전담, 학습 엔진은 QA 기록만 관찰하는 구조로 전환
- •학습 데이터 6000건으로 큐원3.5-9B의 SWE-벤치 베리파이드 점수 41.8%→56.4% 개선
- •핵심 코드 약 3500줄, MIT 라이선스로 공개, 데이터 정제 파이프라인·재현 가능한 학습 스크립트 포함
- •전문가들 학습-서빙 편차 해소 긍정 평가하면서도 보상 설계 이해 부족한 RL 시도 증가 우려
- •하네스 변경 시 모델 가중치에도 영향을 미쳐 하네스 자체의 버전 관리 필요성 제기
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
마이크로소프트, 에이전트 강화학습 프레임워크 '에이전트 라이트닝 v1.0' 공개

- 1.마이크로소프트, 에이전트 강화학습 프레임워크 '에이전트 라이트닝 v1.0' 깃허브 공개
- 2.프로덕션 하네스가 도구실행·상호작용 담당, 학습엔진은 LLM 질의응답 기록만 관찰하는 구조
- 3.큐원3.5-9B 모델을 학습데이터 6000건만으로 SWE-벤치 베리파이드 41.8%→56.4%로 개선
- 4.핵심 코드 약 3500줄, MIT 라이선스로 공개돼 인프라팀 검증 용이하다는 평가
왜 중요한가?
학습과 실제 배포 환경의 불일치를 줄이는 구조로 설계돼, 에이전트 강화학습을 실제 프로덕션에 적용하려는 기업들의 진입장벽을 낮출 수 있다는 점에서 주목된다.
본문 미리보기
[디지털투데이 황치규 기자]마이크로소프트가 에이전트 강화학습(RL) 프레임워크 '에이전트 라이트닝 v1.0'을 깃허브에 공개했다.더뉴스택 최근 보도에 따르면 '에이전트 라이트닝 v1.0'은 학습 엔진이 아니라 프로덕션 하네스가 컨텍스트 구성, 도구 실행, 에이전트-환경 상호작용 루프를 담당하는 것이 핵심이다.학습 엔진은 하네스와 주고받는 LLM 질문·답변 기록만 관찰한다. 이에 따라 개발자들은 에이전트가 도구를 쓰고 환경과 상호작용하는 로직을 학습 시스템 안에 따로 만들 필요가 없다.마이크로소프트는 '적당한 컴퓨팅 자원'으로 학습
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:33AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
