큐레이션된 스킬·성공 궤적·검증 신호 없이 오직 작업 프롬프트만 주어지는 개방형 환경에서, 에이전트가 스킬과 검증 신호를 처음부터 스스로 구축하는 '개방형 자기진화'를 연구하고 OpenSkill 프레임워크를 제안한다. OpenSkill은 문서·저장소·웹에서 근거 지식과 검증 앵커를 확보해 전이 가능한 스킬로 합성하고, 정답이 아닌 그 앵커에 기반한 자체 가상 작업에 대해 스킬을 정련한다. 즉 개방형 세계가 학습할 지식과 감독 없는 연습 환경을 동시에 제공하고, 목표 작업 감독은 최종 평가에만 사용한다. 3개 벤치마크·2개 대상 에이전트에서 무감독 제약을 지키면서 최고의 자동 통과율을 달성했고, 스킬은 모델별 적응 없이 전이됐으며 자체 검증기는 정답에 한 번도 접근하지 않고도 실제 결과와 일치했다.
- •감독 신호 없이 작업 프롬프트만으로 스킬과 검증 신호를 스스로 구축하는 개방형 자기진화 연구
- •문서·저장소·웹에서 근거 지식과 검증 앵커를 확보해 전이 가능한 스킬로 합성하는 OpenSkill
- •정답이 아닌 앵커 기반 자체 가상 작업으로 스킬을 정련, 목표 감독은 최종 평가에만 사용
- •3개 벤치마크에서 무감독 제약 준수하며 최고 통과율 달성, 스킬은 모델 간 전이·검증기는 정답과 일치
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
OpenSkill: Open-World Self-Evolution for LLM Agents
- 1.감독 신호 없이 스킬과 검증 신호를 처음부터 구축하는 오픈월드 자가진화 연구
- 2.문서·저장소·웹에서 근거 지식과 검증 앵커를 수집하는 OpenSkill 프레임워크 제안
- 3.정답 대신 앵커 기반 가상 작업으로 스킬을 정제, 목표작업 감독 없이 학습
- 4.3개 벤치마크·2개 에이전트서 무감독 제약 충족하며 최고 자동 통과율 달성
왜 중요한가?
큐레이션된 스킬·성공 궤적·검증기가 없는 실제 오픈월드 배포 상황에서, 에이전트가 스스로 학습 루프를 부트스트랩한다는 점에서 자가진화 에이전트의 현실 적용 가능성을 넓힌 연구다.
언급 프로젝트
배포 후 지속적인 적응이 필요한 LLM 에이전트의 '오픈 월드' 자가 진화 가능성을 탐구하는 연구입니다. 한국에서 다양한 산업 분야에 걸쳐 AI 에이전트 도입이 확대되는 가운데, 실제 환경에서 스스로 학습하고 발전하는 AI 시스템은 유지보수 비용을 절감하고 AI의 활용 가치를 극대화하는 데 중요한 역할을 할 것입니다.
본문 미리보기
arXiv:2606.06741v1 Announce Type: new Abstract: Self-evolving agents requires adaptation after deployment, but existing approaches assume a usable learning loop, such as curated skills, successful trajectories, or verifier signals. Real open-world deployments may provide none of these, offering only a task prompt. In this work, we study open-world self-evolution, where an agent must build both its skills and its own verification signals from scratch, using open-world resources but no target-tas
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:12AI 초안

