상수 컨텍스트 기술 학습은 반복적인 에이전트 워크플로우를 경량 태스크 패밀리 모듈의 가중치로 학습하여, 추론 시 긴 기술 프롬프트 없이 현재 관측값과 간결한 상태 블록만으로 동작합니다. 결정론적 트래커가 태스크 진행 상황을 렌더링하고 서브골 보상을 제공해 단계별 SFT와 온라인 RL로 훈련됩니다. Qwen3-8B로 ALFWorld 89.6%, WebShop 76.8%, SciWorld 66.4% 성공률을 달성하면서 ReAct 대비 프롬프트 토큰을 2~7배 절감했습니다.
- •재사용 절차를 경량 모듈 가중치로 학습해 프롬프트 대신 가중치에 절차적 컨텍스트 저장
- •결정론적 트래커가 상태 블록 렌더링 및 정렬된 서브골 보상 제공으로 단계별 훈련 지원
- •Qwen3-8B SFT+RL로 ALFWorld 89.6%, WebShop 76.8%, SciWorld 66.4% 성공률 달성
- •ReAct 프롬프팅 대비 턴당 프롬프트 토큰 2~7배 절감으로 클라우드·로컬 에이전트 모두에 유리
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
From History to State: Constant-Context Skill Learning for LLM Agents
- 1.LLM 에이전트의 재사용 절차를 경량 모듈 가중치에 학습시키는 상수-컨텍스트 프레임워크 제안
- 2.프롬프트 토큰 수를 기존 ReAct 대비 2~7배 줄이면서 동등 이상의 성능 달성
- 3.Qwen3-8B 기준 ALFWorld 89.6%, WebShop 76.8%, SciWorld 66.4% 성공률 기록
- 4.클라우드 모델의 프라이버시 문제와 로컬 모델의 성능 한계를 동시에 완화
왜 중요한가?
LLM 에이전트의 컨텍스트 비용·프라이버시 문제를 절차를 가중치로 이전하는 방식으로 동시에 해결하며, 개인 어시스턴트 등 실용적 에이전트 배포에 실질적 돌파구를 제시합니다.
본문 미리보기
arXiv:2605.05413v1 Announce Type: new Abstract: Large language model (LLM) agents are increasingly used to operate browsers, files, code and tools, making personal assistants a natural deployment target. Yet personal agents face a privacy-cost-capability tension: cloud models execute multi-step workflows well but expose sensitive intermediate context to external APIs, while local models preserve privacy but remain less reliable. Both settings also pay repeatedly for long skill prompts and growi
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

