기업 SaaS API 도구 사용 에이전트에 RLVR을 직접 적용한 개념 증명 연구다. Jira REST v3와 Confluence v2 API를 스키마 수준으로 모사한 5개 합성 환경을 만들고, 실제 API·학습된 심판·인간 라벨 없이 도구 호출 트레이스만으로 보상을 계산해 GRPO로 학습했다. 보상이 유효한 4개 시나리오에서 RL 학습 정책이 Qwen3.5-4B 기준선의 평균 보상 0.35~0.92를 0.95~1.00으로 끌어올렸고, Confluence 페이지 생성에서 0.35→1.00의 최대 개선을 보였다. 다만 검증 가능 보상의 수작업 설계가 소수 엔드포인트 이상으로 확장되기 어렵고 일부 시나리오는 보상이 포화되는 한계도 명시했다. 틈새 기업 API에 특화된 소형 모델을 결과 최적화로 만드는 접근의 초기 가능성을 보여준다.
- •Jira REST v3·Confluence v2 API를 스키마 수준으로 모사한 5개 합성 환경 구축, 도구 호출 트레이스만으로 보상 계산
- •실제 API·학습된 심판·인간 라벨 없이 GRPO 학습 — 완전 자동화된 검증 가능 보상 루프
- •유효 시나리오 4개에서 평균 보상 0.35~0.92 → 0.95~1.00, Confluence 페이지 생성은 0.35→1.00 최대 개선
- •Qwen3-1.7B·Qwen3.5-4B 소형 모델 대상 — 틈새 기업 API 특화 소형 모델의 결과 최적화 가능성
- •한계 명시: 수작업 보상 설계는 소수 엔드포인트 이상 확장 어려움, 티켓 전환 시나리오는 보상 포화
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Beyond Next-Token Prediction: An RLVR Proof of Concept for Tool-Use Agents on Atlassian Workflows
- 1.Jira REST v3·Confluence v2 API를 스키마 수준으로 모사한 5개 합성 환경에서 RLVR 검증
- 2.보상을 툴콜 트레이스만으로 계산, 라이브 API·학습된 판정모델·인간 라벨 모두 불필요
- 3.GRPO 훈련 후 Qwen3.5-4B 평균 보상 0.35~0.92에서 0.95~1.00으로, 페이지 생성은 0.35→1.00
- 4.수작업 보상 설계의 확장성 한계와 티켓 전환 시나리오의 보상 포화를 한계로 명시
왜 중요한가?
니치 엔터프라이즈 SaaS API에서 필수 필드 누락·툴 환각 같은 무성 실패를 소형 모델의 환경 내 RL로 없앨 수 있음을 보인 개념증명이다. 대형 범용 모델 대신 결과 최적화된 소형 전용 에이전트라는 비용 효율적 경로를 제시한다.
본문 미리보기
arXiv:2607.01465v1 Announce Type: new Abstract: Large language models are trained to predict the next token, not to act inside a specific API. In niche enterprise SaaS workflows -- where success means hitting the right endpoint with the right nested arguments in the right order -- this objective mismatch shows up as silent failures: dropped required fields, hallucinated tools, or early stops after a single read. We ask whether Reinforcement Learning with Verifiable Rewards (RLVR), applied direc
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

