이 논문은 비마르코프 환경에서의 행동 복제(BC)가 긴 시간축에 걸친 맥락 추론 문제로 어려움을 겪는다는 점에 착안해, 자기지도 방식으로 정보가 중요한 관찰들(mnemonics)을 발견하는 Keyframe Mnemonics를 제안한다. 과거 관찰을 무작위로 샘플링해 학습한 목표를 키프레임 선택의 보상으로 활용하고, 발견된 키프레임에 조건화한 BC 정책으로 행동 분포를 모델링한다. 합성 메모리 도메인에서는 100% 성공률을 달성하고 학습 시 경험하지 못한 훨씬 긴 시간축에도 성능 저하 없이 일반화했으며, 메모리 집약적 로봇 조작 벤치마크 23개 과제에서는 가장 강력한 기준선보다 평균 13.9%p 높은 성공률을 보였고 실제 로봇에서 20배 긴 시간축에서도 80%의 성공률을 유지했다.
- •자기지도 방식으로 정보가 중요한 관찰(키프레임)을 발견하는 Keyframe Mnemonics 제안
- •합성 메모리 도메인에서 100% 성공률, 학습보다 훨씬 긴 시간축에도 성능 저하 없이 일반화
- •로봇 조작 벤치마크 23개 과제에서 최강 기준선 대비 평균 13.9%p 성공률 향상
- •실제 로봇 실험에서 20배 긴 시간축에서도 80% 성공률 유지
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Self-Supervised Keyframe Discovery for Horizon-Invariant Behavior Cloning
- 1.비마르코프 환경 행동복제(BC)의 긴 호라이즌 문제를 푸는 자기지도 방식 'Keyframe Mnemonics' 제안
- 2.과거 관측 샘플링으로 학습한 보상으로 정보 핵심 키프레임을 발굴, 이를 조건으로 BC 정책 학습
- 3.합성 메모리 도메인에서 100% 성공률, 훈련보다 훨씬 긴 호라이즌에도 성능 저하 없이 일반화
- 4.로봇 조작 23개 과제에서 최강 베이스라인보다 13.9%p 개선, 실제 로봇서 20배 긴 호라이즌에도 80% 유지
왜 중요한가?
순환·어텐션 구조의 은닉상태 붕괴나 문맥 길이 한계 없이 꼭 필요한 순간만 기억해, 장기 호라이즌 로봇 조작 모방학습의 실용성을 끌어올린다.
본문 미리보기
arXiv:2610.10857v1 Announce Type: new Abstract: Behavior cloning (BC) in non-Markovian environments is a challenging problem because policies have to reason over contextual information over long horizons. Existing policy architectures rely on recurrent or attention-based mechanisms to capture long-term dependencies. However, recurrent models suffer from hidden-state collapse and gradient instability under backpropagation through time, while attention-based models are fundamentally limited by co
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안



![[Tech Insight] "AI 해킹, 보안 문제로만 보는 건 위험한 착각"](https://cdn.digitaltoday.co.kr/news/photo/202610/706229_653947_485.jpg)