이 논문은 LLM 기반 자율 연구 루프가 가설 검증보다 지표 국소 최적화로 표류하는 문제를 구조적으로 해결하기 위해, 사족보행 로봇 내비게이션 정책의 일반화를 연구하는 'AI 과학자' 시스템을 제안한다. 예측과 결과를 고정된 스키마로 짝지어 되돌릴 수 없게 기록하는 불변 실험 카드, 기계적 역할에 국한된 전문화 서브에이전트, 사용자의 연구 취향을 타입이 있는 지식그래프로 보유하며 유일하게 주관적 판단을 내리는 오라클 'kkanbu'라는 세 요소를 도입했다. 11개 연구 스트림에서 kkanbu 유무를 비교한 결과 두 조건 모두 자체 가설의 약 4분의 3을 스스로 반증해 표류하지 않았으나, 최고 성능 정책은 오히려 오라클 없는 조건에서 나왔다. 다만 kkanbu는 테스트 시점 적응을 유일하게 탐색하고 승리한 설계를 주도하며 스트림 간 교훈을 전달해, 결과 점수보다 연구의 '방향'을 좌우하는 역할을 했다.
- •불변 실험 카드로 가설-결과를 고정 기록해 표류(drift)를 구조적으로 방지
- •기계적 역할 전용 서브에이전트와 주관적 판단 전담 오라클 kkanbu 도입
- •11개 연구 스트림에서 양 조건 모두 가설 약 75% 자체 반증, 표류 없음 확인
- •최고 성능 정책은 오라클 없는 조건에서 나왔으나 kkanbu가 테스트시점 적응 등 방향성 주도
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
An AI Scientist that Doesn't Drift: Taste, Structure, and Falsifiable Findings in a Quadruped Navigation Research Loop
본문 미리보기
arXiv:2608.07542v1 Announce Type: new Abstract: Autonomous research loops driven by large language models can run machine-learning experiments at scale but tend to drift toward local refinements of whichever metric they optimise rather than testing the hypotheses that motivate the experiments. We address this structurally and present an AI Scientist for studying generalisation in quadruped robot navigation policies in simulation. Building on the autoresearch paradigm of Karpathy, our loop adds
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:39AI 초안

