이 논문은 LLM 스트리밍 출력에서 유해 콘텐츠가 이미 전송된 뒤에야 완료되는 '릴리즈 타이밍 문제'를 다루며, 위험 신호를 이루는 두 어휘 조건이 모두 관찰될 때까지 마지막 청크 전송을 보류하는 결정론적 가드 기법을 제안한다. 4개의 신호군, 8가지 청크 크기, 32회의 메커니즘 시험에서 이 방식은 버퍼링 방식과 동일하게 모든 쌍 완성 청크를 정확히 차단했으며, 단일 조건만 있는 대조군은 모두 통과시켰다. 512회 전략 비교 실험에서는 전체 프리픽스 스캐닝과 완전 버퍼링이 모든 쌍을 탐지한 반면, 512자 창 방식은 128건 중 96건, 청크 단위 로컬 스캐닝은 128건 중 38건만 탐지했다. 다만 이 기법은 사람이 작성한 안전 응답 338건 중 오탐 0건, 배심원이 라벨링한 유해 응답 394건 중 탐지 0건을 기록해, 특정 좁은 위험 유형만 차단하는 보조 장치일 뿐 일반적 유해성 판별을 대체하지는 못한다는 한계도 드러났다.
- •위험 신호를 이루는 두 조건이 모두 나타날 때까지 마지막 청크 전송을 보류하는 결정론적 가드 제안
- •32회 시험에서 모든 쌍 완성 청크를 정확히 차단, 단일 조건 대조군은 모두 통과
- •512자 창 방식은 96/128건, 청크 단위 로컬 스캐닝은 38/128건만 탐지
- •안전 응답 오탐 0건이지만 유해 응답 394건은 전혀 탐지 못해 보조 장치로서의 한계 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Withholding the Completing Chunk: Deterministic Pair-Completion Guardrails for Streaming LLM Output
본문 미리보기
arXiv:2608.10279v1 Announce Type: new Abstract: Streaming language-model output creates a release-timing problem: complete-response moderation acts after streamed text has escaped, whereas repeated semantic classification of partial text can be costly and unstable. We study a narrow deterministic construction in which each committed danger signature is the conjunction of two lexical predicates. The guard scans the accumulated prefix before every release and withholds the first chunk that makes
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:23AI 초안



