AWS가 Amazon SageMaker AI의 다중턴 강화학습(MTRL) 기능으로 검색 에이전트를 파인튜닝한 사례를 공개했다. Qwen3.6-27B 모델에 BM25 키워드 검색과 벡터 검색 두 도구를 쥐여주고 nDCG@10을 보상으로 삼아 학습한 결과, BrowseComp-Plus에서 nDCG@10이 23.7%, WixQA에서 18.4% 개선됐다. 가장 두드러진 변화는 신뢰성으로, BrowseComp-Plus의 실패율이 22.89%에서 0.68%로 급감해 턴·토큰 한도 내에 과제를 마치는 능력이 크게 향상됐다. 학습은 max_epochs, global_batch_size, rollout_max_concurrency 등 3개 하이퍼파라미터만 조정하고 나머지는 기본값을 사용했으며, GPU 클러스터 프로비저닝 없이 토큰당 과금되는 서버리스 방식으로 진행됐다. 소형 모델에 프런티어급 모델 수준의 신뢰성을 부여하면서도 속도와 비용 이점을 유지할 수 있음을 보여준 사례다.
- •Qwen3.6-27B를 BM25·벡터 검색 두 도구로 다중턴 RL 파인튜닝, 보상은 nDCG@10 사용
- •BrowseComp-Plus nDCG@10 +23.7%p, WixQA +18.4%, Wands +6%, FreshStack은 소폭 하락
- •BrowseComp-Plus 실패율 22.89%→0.68%로 급감, 턴 수도 7.0→6.3으로 효율화
- •FRAMES·BRIGHT·Musique 등 다수 공개 데이터셋 활용, 서버리스 토큰당 과금으로 GPU 관리 불필요
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Fine-tune a search agent with multi-turn RL on Amazon SageMaker AI
- 1.AWS SageMaker MTRL로 Qwen3.6-27B 기반 검색 에이전트 파인튜닝, 프런티어 모델급 신뢰성 확보
- 2.BrowseComp-Plus서 nDCG@10 +23.7%, 실패율 22.89%→0.68%로 급감
- 3.WixQA +18.4%, Wands +6% 개선…FreshStack만 소폭 하락
- 4.서버리스 방식으로 GPU 클러스터 관리 없이 토큰당 과금으로 멀티턴 RL 훈련 가능
왜 중요한가?
소형 모델도 멀티턴 강화학습으로 프런티어 모델급 검색 신뢰성을 확보할 수 있음을 보여줘, 비용·지연시간 부담이 큰 대형 모델 대신 특화 소형 모델을 쓰려는 기업들에 실질적 대안을 제시한다.
본문 미리보기
Fine-tuning teaches a small search agent your tools and environment, giving it the reliability of a frontier model at lower latency and cost. In this post, we fine-tune an LLM-powered search agent with multi-turn reinforcement learning (MTRL) on Amazon SageMaker AI and share the gains we measured in retrieval quality and reliability.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:02AI 초안

