마이크로소프트 리서치가 대형언어모델이 정답 레이블이나 외부 피드백 없이도 자신의 경험에서 스스로 학습하도록 돕는 프레임워크 '에볼립'을 공개했다. 에볼립은 과거 시도에서 얻은 경험을 단순히 저장하는 대신 재사용 가능한 '기술'과 반성적 '인사이트'로 변환하고, 유사한 지식을 통합하며 과제 성과에 따라 각 지식의 중요도를 지속적으로 재조정한다. 수학 추론, 효율성 제약 하의 코드 작성, 장기 의사결정 등 다양한 과제에서 기존 검색 기반 메모리 기법이나 다른 추상적 메모리 방식보다 일관되게 더 높은 성능과 더 적은 토큰 사용을 보였다. 과제 순서를 무작위로 바꿔도 성능이 안정적으로 유지돼, 모델을 업데이트하지 않고도 어떤 블랙박스 LLM 시스템에든 적용할 수 있는 실용적 학습 방식임을 보였다.
- •정답 레이블·외부 피드백 없이 자기 경험만으로 학습하는 자기지도 프레임워크
- •경험을 '재사용 가능한 기술'과 '반성적 인사이트'로 변환, 통합·가중치 재조정 반복
- •수학 추론·코드 작성·장기 의사결정 과제에서 기존 검색 기반 메모리 기법 능가
- •테스트 시점 연산을 늘릴수록 성능 향상 속도도 더 빠름
- •모델 가중치 업데이트 불필요, API로 제공되는 블랙박스 모델에도 적용 가능
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
EvoLib: Turning experience into evolving knowledge
본문 미리보기
LLMs do not get smarter just by remembering more. EvoLib turns experience into evolving knowledge, taking reusable skills and insights that help models learn and adapt across tasks long after deployment. The post EvoLib: Turning experience into evolving knowledge appeared first on Microsoft Research.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:05AI 초안

