LLM이 자연어 요구사항으로 웹 스크레이퍼를 생성할 때 의존성 오류·깨진 셀렉터·스키마 불일치로 불안정한 문제를, LLM 출력을 자유형 코드에서 타입이 지정된 JSON 수집기 설정으로 전환해 해결하는 제약·검증 가능 에이전트 프레임워크를 제안한다. 6종 수집기 분류, 템플릿·유틸리티 함수 제약, 정적 Airflow DAG 실행, 규칙 기반 품질 검사, 구조화된 피드백 교정을 결합한다. 138개 과제 실험에서 안정적 인스턴스화에는 초기 설명을 넘어 소스·필드·실행 제약의 완성이 필요함을 확인했고, 독립 검증된 80개 과제에서 실행 단계 LLM 토큰 0개와 최저 평균 실행 시간으로 동작해 반복적 스케줄 수집에 적합한 재사용·결정론적·검증 가능한 실행 경로를 제시했다.
- •LLM 출력을 자유형 코드에서 타입화된 JSON 수집기 설정으로 전환해 스크레이핑 신뢰성 확보
- •6종 수집기 분류·정적 Airflow DAG 실행·규칙 기반 품질 검사·구조화 피드백 교정 결합
- •138개 과제 실험에서 안정적 인스턴스화에 소스·필드·실행 제약 완성이 필요함을 확인
- •검증된 80개 과제에서 실행 단계 LLM 토큰 0개와 최저 평균 실행 시간 달성, 반복 수집에 적합
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Making Failure Safe: A Constrained, Verifiable Agent Framework for Open-Web Data Collection
- 1.LLM 출력을 자유 코드 대신 타입화된 JSON 수집기 설정으로 제한하는 프레임워크 제안
- 2.6종 수집기 분류·템플릿 제약·정적 Airflow DAG 실행·규칙 기반 품질 검사 결합
- 3.검증된 80개 과제에서 실행 단계 LLM 토큰 0으로 최단 평균 실행 시간 달성
- 4.일회성 품질을 일부 양보하는 대신 재사용·결정론·검증 가능한 반복 수집 경로 확보
왜 중요한가?
LLM이 생성한 스크레이퍼의 셀렉터 파손·스키마 불일치 같은 고질적 불안정성을 '생성 자유도 제한'으로 해결한 접근으로, 정기 스케줄 데이터 수집 파이프라인에 저비용으로 적용 가능한 실용적 설계다.
언급 프로젝트
본문 미리보기
arXiv:2607.00035v1 Announce Type: new Abstract: LLMs and agents can generate web scrapers from natural-language requirements, but direct generation remains unreliable because of dependency errors, broken selectors, schema mismatches, and heterogeneous page structures. We propose a constrained, verifiable agent framework that shifts LLM output from free-form code to typed JSON collector configurations, combining a six-type collector taxonomy, template and utility-function constraints, static Air
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

