Feedback Manipulation Regularization(FMR)은 모방학습 정책의 정렬(alignment)을 개선하기 위해 평가적 피드백을 교정 신호로 활용하는 알고리즘 독립적 방법이다. 기존 접근은 인간 시연과 피드백을 언어 생성의 맥락적 밴딧 관점에 맞춘 다단계 파이프라인으로 결합했으나, FMR은 완전한 순차적 의사결정 환경에서 이 두 신호를 단일 단계 오프라인 학습의 상호 연결된 신호로 통합한다. Safety Gymnasium 환경을 정렬 평가 테스트베드로 적용해 다양한 모방학습 알고리즘에서 최대 98%의 미정렬 감소를 달성했다. 데이터가 부족하고 시연이 노이즈로 오염된 제한적 환경에서도 견고함을 유지해, 오프라인 에이전트 정렬의 실용적 대안을 제시한다.
- •평가적 피드백을 교정 신호로 활용해 모방학습 정책의 정렬을 개선하는 알고리즘 독립적 방법 FMR 제안
- •인간 시연과 피드백을 단일 단계 오프라인 학습의 상호 연결 신호로 통합
- •Safety Gymnasium 환경에서 다양한 모방학습 알고리즘 대상 최대 98% 미정렬 감소 달성
- •정렬된 시연이 부족하고 노이즈가 섞인 제한적 데이터 환경에서도 견고성 유지
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Feedback Manipulation Regularization: Enabling Offline Agent Alignment for Imitation Learning
- 1.평가 피드백을 교정 신호로 쓰는 FMR 제안, 모방학습 정렬을 단일 단계 오프라인 학습으로 개선
- 2.Safety Gymnasium을 정렬 평가 테스트베드로 개조, 다양한 모방학습 알고리즘에서 오정렬 최대 98% 감소
- 3.정렬된 시연이 희소하고 노이즈가 많은 저데이터 환경에서도 견고성 유지
왜 중요한가?
인간 시연과 평가 피드백을 다단계 파이프라인 대신 단일 오프라인 학습에서 결합하는 알고리즘 불가지론적 방법으로, 언어 생성이 아닌 순차적 의사결정 에이전트의 정렬 비용을 낮출 수 있는 방향을 제시했다.
AI 에이전트가 인간의 가치에 부합하는 행동을 학습하도록 하는 '정렬(alignment)'은 AI 안전성 확보에 핵심 과제입니다. 특히 오프라인 모방 학습 환경에서 피드백 조작을 통한 정렬 강화 연구는 실제 환경에서의 AI 시스템 오류 가능성을 줄이는 데 기여할 수 있습니다. 자율주행, 로봇 등 AI 에이전트의 안전한 배포를 강조하는 국내 산업 및 규제 환경에서 이 연구는 실질적인 적용 가능성을 제시합니다.
본문 미리보기
arXiv:2607.07859v1 Announce Type: new Abstract: Reinforcement learning (RL) research has increasingly shifted focus towards alignment, ensuring agents learn behaviors adhering to human values. While human demonstrations and feedback have proven crucial for alignment, existing approaches predominantly combine these signals using multi-stage pipelines designed for the contextual bandit framing of language generation. Yet little work explores how these complementary inputs can serve as a richer, i
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

