비정상성(non-stationary) 환경에서의 인컨텍스트 강화학습(ICRL)을 체계적으로 정리한 서베이 논문이다. ICRL은 사전학습된 의사결정 모델이 테스트 시 파라미터 업데이트 없이 상호작용 맥락만으로 잠재 과제 규칙을 추론하고 행동을 개선하는 능력을 말한다. 기존 서베이가 사전학습 목표·아키텍처·평가 프로토콜 중심으로 분야를 정리한 반면, 이 논문은 보상 명세·전이 커널·관측 채널 등이 현재 체제와 어긋나면서 축적된 맥락이 낡거나 오도하는 정보가 되는 변화 환경에 집중한다. 에이전트가 현재 결정 규칙과 함께 축적 증거 중 무엇이 여전히 유효한지를 추론해야 하는 문제로 정의하고, 무엇이 변하는가, 변화가 어떻게 전개되는가, 변화가 얼마나 관측 가능한가라는 세 질문으로 문헌을 조직화했다. 배포 후 환경 변화에 대응해야 하는 에이전트 설계자에게 유용한 지도다.
- •ICRL: 테스트 시 파라미터 업데이트 없이 맥락만으로 과제 규칙을 추론·개선하는 능력
- •비정상 환경에서는 축적된 맥락이 낡거나 오도하는 정보가 될 수 있음을 핵심 문제로 정의
- •메타-RL, 의사결정 시퀀스 모델링, 검색 증강 RL, 보상 피드백 에이전트와의 관계 정리
- •무엇이 변하는가·어떻게 전개되는가·얼마나 관측 가능한가 3축으로 문헌 분류
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
In-Context Reinforcement Learning under Non-Stationarity: A Survey
- 1.비정상성 환경에서의 인컨텍스트 강화학습(ICRL)을 체계화한 최초급 서베이 논문
- 2.파라미터 업데이트 없이 컨텍스트만으로 현재 규칙과 유효한 증거를 동시에 추론하는 문제로 정의
- 3.환경 변화 시 누적 컨텍스트가 오히려 오래되거나 오도성 정보가 될 수 있음을 핵심 지적
- 4.무엇이·어떻게·얼마나 관측 가능하게 변하는가 3질문 축으로 기존 문헌을 분류
왜 중요한가?
기존 ICRL 서베이가 사전학습 목표·아키텍처 중심이었던 반면, 실제 배포 환경에서 필연적인 비정상성(보상·전이·관측 변화) 문제를 정면으로 다룬다. 장기 배포되는 에이전트가 축적된 컨텍스트를 언제 신뢰하고 언제 버려야 하는지에 대한 설계 프레임을 제공한다는 점에서 에이전트 메모리 설계에 직접 시사점이 있다.
본문 미리보기
arXiv:2607.11906v1 Announce Type: new Abstract: The development of decision-pretrained transformers, algorithm distillation, long-context meta-RL, and retrieval-augmented agents has renewed interest in in-context reinforcement learning (ICRL): the ability of a pretrained or fine-tuned decision model to infer latent task rules and improve future behavior from interaction context, without test-time parameter updates. This line of work asks when trial-and-error evidence, rewards, transitions, demo
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:40AI 초안

