학술 논문 PDF에서 데이터셋 정보를 구조화 추출하는 과제로, reflection·메모리 같은 에이전트 구성요소가 고정 워크플로 대비 실제로 관찰·제어 가능한 개선을 만드는지 검증한 연구다. 고정 워크플로 기준선과 reflective 에이전트 변형들을 비교하고, 더 풍부한 PDF 도구와 동적 도구 선택을 갖춘 최적화 에이전트 조건(S2)을 별도로 규정했다. 평가의 초점은 추출 정확도보다 도구 실행, 재시도, reflection, 메모리 사용, 실행 시간, 실패 복구 등 과정(process) 수준 행동에 있다. 에이전트 메커니즘이 언제 시스템 행동을 바꾸는지, 그 변화가 과제 완수로 이어지는지를 규명해 에이전트 설계의 근거를 제공한다.
- •reflection·메모리 등 에이전트 구성요소의 실효성을 고정 LLM 워크플로와 직접 비교
- •학술 PDF에서 데이터셋 언급을 찾아 구조화 레코드로 추출하는 과제로 실험
- •정확도보다 도구 실행·재시도·실패 복구 등 과정 수준 행동 분석에 초점
- •관찰된 실패 유형을 바탕으로 동적 도구 선택을 갖춘 최적화 에이전트 조건 S2 설계
Behavioral Controllability of Agentic Models for Information Extraction: From Fixed Workflows to Reflective Agents
- 1.반영(reflection)·메모리 등 에이전트 요소가 고정 LLM 워크플로 대비 실제 개선을 주는지 검증
- 2.학술 PDF 데이터셋 추출 과제에서 고정 베이스라인과 반영형 에이전트 변형을 직접 비교
- 3.도구 실행·재시도·메모리 사용·실패 복구 등 프로세스 수준 행동을 주 평가지표로 설정
- 4.실패 유형 분석을 토대로 PDF 도구 강화·동적 도구 선택을 갖춘 최적화 에이전트(S2) 설계
왜 중요한가?
에이전트에 반영·메모리를 붙이면 좋아진다는 통념을 프로세스 행동 수준에서 검증한 연구로, 최종 결과 지표만 보던 기존 에이전트 평가 관행을 보완해 설계 의사결정에 실증 근거를 제공한다.
본문 미리보기
arXiv:2607.15715v1 Announce Type: new Abstract: Large language model (LLM) agents are increasingly used for complex information-extraction tasks, yet it remains unclear whether agentic components such as reflection and memory lead to observable and controllable improvements over fixed LLM workflows. We study this question through conference-paper dataset extraction, where a system must identify datasets mentioned in scholarly PDFs and produce structured records. We compare a fixed workflow base
전체 내용이 궁금하다면?
원문을 직접 읽어보세요