IBM 리서치가 에이전트의 과거 실행 기록에서 추출한 가이드라인을 인퍼런스 시 다시 주입하는 'ALTK-Evolve' 기법을 8개 모델에 적용한 결과, 메모리 효과는 모델 역량에 따라 달라지는 '용량 맞춤형'이어야 한다는 결론을 얻었다. 여유가 있는 강한 모델(DeepSeek-V3.2 671B)은 전체 가이드라인 세트를 받을 때 태스크 완료율(TGC)이 9.5%p 상승했고, gpt-oss-120b 같은 약한 모델은 핵심 가이드라인과 태스크별 검색을 결합한 '큐레이션 검색' 방식에서 16.1%p 상승하며 토큰 비용은 5%만 늘었다. 반면 GLM-5처럼 이미 성능이 포화된 모델은 가이드라인을 줘도 개선 효과가 없었다. AppWorld 585개 멀티스텝 태스크로 검증했으며, 프롬프트 캐싱을 활용하면 전체 가이드라인 세트도 비용 부담 없이 운용할 수 있다고 설명했다.
- •강한 모델은 전체 가이드라인 세트, 약한 모델은 핵심+검색 조합이 최적
- •gpt-oss-120b는 큐레이션 검색으로 태스크 완료율 +16.1%p, 토큰은 +5%만 증가
- •DeepSeek-V3.2는 전체 가이드라인 세트로 TGC +9.5%p, SGC +16.1%p 개선
- •GLM-5 등 이미 성능이 포화된 모델은 메모리 추가에도 측정 가능한 개선 없음
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
How Much Memory Does Your Agent Actually Need?
- 1.ALTK-Evolve로 8개 모델에 자기증류 가이드라인 주입, 메모리 효과는 모델별로 다름을 확인
- 2.gpt-oss-120b는 선별 검색(curated retrieval) 적용 시 태스크완료율 +16.1%p, 토큰비용은 +5%에 그침
- 3.DeepSeek-V3.2는 전체 가이드라인 주입 시 +9.5%p, GLM-5는 이미 포화상태로 개선 없음
- 4.프롬프트 캐싱을 활용하면 전체 가이드라인 세트 주입 비용도 실사용 수준으로 절감 가능
왜 중요한가?
에이전트 메모리를 무조건 많이 넣는 게 아니라 모델 역량에 맞춰 용량을 조절해야 한다는 실증 결과로, 약한 모델엔 선별 검색이 정확도와 비용 모두에서 최선이라는 실무 지침을 제공한다.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:58AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
