LLM 코딩 에이전트가 대규모·포맷 중심 문서 생성 시 빈 응답을 침묵 출력하는 'output stalling' 실패 양상을 이론적으로 설명·예방하는 연구다. 저자들은 (1) 컨텍스트 상태에 따른 에이전트의 실효 출력 능력을 정량화하는 Output Generation Capacity(OGC), (2) 오버헤드 배수 μ_f>1인 어떤 포맷에서도 지연 템플릿 렌더링이 직접 생성보다 토큰 효율이 같거나 우수함을 증명한 Format-Cost Separation Theorem, (3) 비용 대비 OGC 비율로 직접·청크·지연 전략을 선택하는 Adaptive Strategy Selection을 제안했다. Claude 3.5 Sonnet·GPT-4o·Llama 3.1 70B 세 모델과 4종 문서로 검증한 결과 지연 렌더링은 LLM 토큰을 48-72% 절감하고 stalling을 완전히 제거했다. 이를 GEN-PILOT이라는 오픈소스 MCP 서버로 구현했다.
- •코딩 에이전트의 출력 정지(output stalling) 현상을 공식적으로 정의
- •Output Generation Capacity 개념과 Format-Cost Separation 정리 도출
- •비용 대비 OGC 비율로 생성 전략(직접·청크·지연)을 자동 선택하는 프레임워크 제안
- •지연 렌더링이 토큰 48-72% 절감 및 출력 정지 완전 해소
- •이론을 오픈소스 MCP 서버 GEN-PILOT으로 구현
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
When Agents Go Quiet: Output Generation Capacity and Format-Cost Separation for LLM Document Synthesis
- 1.코딩 에이전트의 출력 멈춤 현상 진단 이론 프레임워크
- 2.컨텍스트 윈도우와 구분되는 출력 생성 용량(OGC) 정의
- 3.지연 템플릿 렌더링이 항상 토큰 효율적임을 증명
- 4.GEN-PILOT MCP 서버로 생성 토큰 48~72% 절감
왜 중요한가?
대형 포맷 문서 생성 시 LLM 에이전트가 빈 응답을 내는 실패 모드의 이론적 원인과 실용적 해법을 제시합니다.
본문 미리보기
arXiv:2604.16736v1 Announce Type: new Abstract: LLM-powered coding agents suffer from a poorly understood failure mode we term output stalling: the agent silently produces empty responses when attempting to generate large, format-heavy documents. We present a theoretical framework that explains and prevents this failure through three contributions. (1) We introduce Output Generation Capacity (OGC), a formal measure of an agent's effective ability to produce output given its current context stat
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:43AI 초안

