대형언어모델(LLM) 에이전트는 축적된 경험으로부터 지속적으로 개선하는 자기진화(self-evolving)가 가능하지만, 기존 연구는 대부분 독립적 평가에 머물러 다양하고 복잡한 과제 흐름에 적응해야 하는 현실적 스트리밍 환경에서의 행동은 제대로 규명되지 않았다. 연구진은 에이전틱 벤치마크를 구성 가능한 과제 스트림으로 조직하고 테스트 시점에 '격리(Isolated)', '순차(Sequential)', '교차(Interleaved)'라는 점진적으로 범위와 도메인 구성이 달라지는 세 가지 스트리밍 시나리오를 구현하는 통합 프레임워크 '에이전트스트림(AgentStream)'을 제시했다. 3개 프론티어 파운데이션 모델에 걸쳐 대표적인 자기진화 기법 5종을 조합 평가한 결과, 자기진화의 신뢰성은 스트리밍 시나리오에 따라 달라지고, 그 이득은 모델 능력에 의해 제한되며 모델 강도에 대해 비단조적이고, 모델과 시나리오 전반을 지배하는 단일 기법은 없다는 사실이 드러났다. 연구진은 자기진화 에이전트를 고립된 단일 과제 설정이 아니라 현실적인 과제 스트림 아래서 평가해야 한다고 제안한다.
- •AgentStream, 자기진화 LLM 에이전트를 '격리·순차·교차' 세 가지 스트리밍 시나리오로 평가하는 통합 프레임워크
- •3개 프론티어 파운데이션 모델 × 대표 자기진화 기법 5종을 조합 평가
- •자기진화 신뢰성은 스트리밍 시나리오에 따라 달라짐
- •자기진화의 이득은 모델 능력에 의해 제한되고 모델 강도에 대해 비단조적(무조건 강할수록 좋지 않음)
- •모델·시나리오 전반을 지배하는 단일 최고 기법은 없음, 현실적 과제 스트림 하의 평가 필요성 제안
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
AgentStream: How Well Do Self-Evolving LLM Agents Perform Under Streaming Tasks?
본문 미리보기
arXiv:2608.00155v1 Announce Type: new Abstract: Large language model (LLM) agents can self-evolve by continually improving from their own accumulated experience. However, existing studies predominantly adopt independent evaluation. Consequently, the behavior of self-evolving agents in realistic streaming settings, where agents adapt to diverse and complex task streams, remains poorly understood. To address this gap, we introduce AgentStream, a unified framework that evaluates self-evolving agen
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

