LLM 에이전트용 재사용 가능한 '실행형 스킬'을 올바른 동작은 유지한 채 오류만 고치는 능력을 평가하는 350개 과제 벤치마크 SkillScriptBench가 공개됐다. 3만5천 개 이상의 깃허브 스킬 저장소를 조사해 100개 패키지로 150개 수리 과제를, 50개 패키지로 정상·문서 결함·스크립트 결함·복합 결함의 4가지 상태를 평가하는 200개 통제 과제를 구성했다. 4개 LLM 실험에서 문서와 스크립트를 함께 수정하는 방법이 스크립트 결함은 고치지만 문서 수리나 보존에서는 마크다운 전용 수정보다 일관되게 우수하지 않았다. 이에 추상구문트리와 호출 관계로 유지보수 요청을 관련 코드 위치에 연결하는 'AST 가이드 스킬 수정'을 도입해 수리 성공률을 평균 21.9~27.7%포인트 절대적으로 끌어올렸다.
- •실행형 에이전트 스킸의 오류 수리·보존 능력을 평가하는 350개 과제 벤치마크 SkillScriptBench 공개
- •3만5천 개 이상 깃허브 스킴 조사에서 100개 패키지, 150개 수리 과제 구성
- •기존 문서+스크립트 동시 수정 방식이 마크다운 전용 수정보다 일관된 우위 없음을 확인
- •AST·호출 관계 기반 'AST 가이드 스킴 수정' 도입으로 수리 성공률 21.9~27.7%p 향상
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
SkillScriptBench: Benchmarking Self-Evolution of Executable Agent Skill Packages Beyond Markdown
- 1.LLM 에이전트용 재사용 '실행형 스킬'의 자가 수정 능력을 평가하는 350개 과제 벤치마크 SkillScriptBench 공개
- 2.3만5천여 개 GitHub 스킬을 조사해 100개 패키지 선별, 문서·스크립트 수정·보존 능력을 분리 평가하는 과제 구성
- 3.4개 LLM 테스트 결과, 문서·스크립트 동시 수정 방식이 문서 수정·보존서는 마크다운만 수정보다 우월하지 않음
- 4.AST와 호출 관계로 수정 범위를 좁히는 'AST-Guided Skill Revision'으로 복구 성공률 모델 평균 최대 27.7%p 향상
왜 중요한가?
에이전트 스킬이 코드와 문서를 함께 포함하는 패키지로 자리잡으면서, 스킬을 '고치는' 능력 자체를 정교하게 측정·개선하는 벤치마크가 처음 제시돼 에이전트 스킬 생태계의 품질 관리 표준에 기여한다.
언급 프로젝트
본문 미리보기
arXiv:2610.04008v1 Announce Type: new Abstract: Executable Agent Skills combine natural-language instructions and scripts into reusable packages for LLM agents, and revising them requires fixing errors without breaking correct behavior. Existing benchmarks do not systematically distinguish documentation repair, script repair, and preservation when evaluating skill self-evolution. We introduce SkillScriptBench, a 350-task benchmark designed to evaluate these capabilities separately. From a surve
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

