15개 LLM을 대상으로 동시에 여러 제약(추론 구조, 안전 경계, 출력 스키마)을 지키게 하는 벤치마크 CSE를 만들어 36가지 제약 유형에 걸쳐 36만 9,753회 검증한 결과, 제약이 늘어날수록 전체 만족률이 급격히 무너지는 현상을 확인했다. 개별 제약 통과율은 완만히 떨어지지만, 8개 제약을 동시에 만족할 확률은 개별 통과율 41%에서 5.7%로 급락했으며, 구조적 제약은 어휘적 제약보다 2배 빠르게 성능을 잃는다. 대부분 모델은 5~6개를 넘는 동시 제약부터 신뢰도가 무너져, 15개 모델 중 12개가 3개 이상 제약에서 성공률 50% 이하로 떨어졌다. 다중 지시사항을 동시에 처리해야 하는 실제 에이전트 설계에 중요한 한계를 시사한다.
- •369,753회 검증, 36가지 제약 유형, k=1~12로 15개 모델 평가
- •구조적 제약이 어휘적 제약보다 제약당 2배 더 빠르게 성능 저하
- •8개 제약 동시 만족률 5.7%(개별 통과율 41%와 대비)
- •실패는 대부분 독립적이며 곱셈적으로 누적, 공유 출력 특성이 주요 원인
- •최강 모델도 7개 제약에서 성공률 50% 밑으로 하락
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Large Language Models Can Follow Instructions, But Not Many at Once: Phase Transitions in Compositional Constraint Satisfaction
- 1.CSE 벤치마크로 15개 모델·36개 제약유형·k=1~12서 369,753회 검증, LLM심사 없이 규칙기반 채점
- 2.k=8서 개별제약 통과율 41%지만 8개 모두 만족 확률은 5.7%로 급낙
- 3.구조적 제약이 어휘적 제약보다 제약당 성능손실 2배 커, 지속추적 필요한 제약이 더 취약
- 4.5~6개 이상 동시제약서 안정성 붕괴, 최강모델도 7개서 50% 미만·15개 중 12개는 3개 이하서 붕괴
왜 중요한가?
실제 서비스에서 안전규칙·출력스키마·추론구조 등 여러 제약을 동시에 걸어야 하는데, 제약이 늘수록 개별 통과율보다 훨씬 빠르게 전체 준수율이 무너진다는 정량적 근거를 제시해 프롬프트·가드레일 설계에 실질적 한계선을 제공한다.
본문 미리보기
arXiv:2608.12426v1 Announce Type: new Abstract: Large language models are increasingly deployed in settings that require simultaneous adherence to multiple explicit constraints - reasoning structure, safety boundaries, output schemas. Individual constraints are handled proficiently, but the compositional regime, where many must hold jointly, remains poorly characterized: how rapidly does performance degrade, what governs the degradation, and can the collapse be mitigated? We introduce Constrain
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:21AI 초안

