프롬프트 래퍼(wrapper)의 형식 차이만으로 모델 점수가 리더보드 결론을 뒤집을 만큼 달라진다는 문제를 토큰 통제 프로토콜로 정량화한 연구다. 래퍼 선택이 유발하는 정확도 범위인 FSI(Format Sensitivity Index)와 응답 파싱 가능성 범위인 PSI(Parseability Sensitivity Index)라는 상보적 지표 두 개를 도입했다. 7개 QA 과제, 5개 래퍼 계열, 7B~72B 인스트럭트 모델 4종에 걸친 14만 건의 OpenRouter 생성 결과, 평균 FSI가 모델 간 30배 이상 차이 났고 그 대부분이 형식 준수 실패로 설명됐다. 고정효과 회귀에서 파싱 가능성은 과제·모델·래퍼를 통제한 후에도 정확도의 강한 예측 변수로 남았다. 저자들은 래퍼 분산과 준수율 없이 정확도만 보고하는 것은 통계적으로 취약하다며 벤치마킹과 구조화 출력 배포를 위한 실무 권고를 제시했다.
- •토큰 통제 프로토콜 하에서 형식 민감도(FSI)와 파싱 민감도(PSI) 지표 도입
- •7개 QA 과제×5개 래퍼 계열×4개 모델(7B~72B), 총 14만 건 생성으로 대규모 검증
- •평균 FSI가 모델 간 30배 이상 차이 — 대부분 형식 준수 실패로 설명됨
- •파싱 가능성은 과제·모델·래퍼 통제 후에도 정확도의 강한 예측 변수 — 래퍼 분산 보고 없는 벤치마크는 통계적으로 취약
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking
- 1.FSI(포맷 민감도)·PSI(파싱 민감도) 지표 제안: 프롬프트 래퍼만 바꿔도 점수가 크게 변동
- 2.OpenRouter 14만 생성·7개 QA 과제·5개 래퍼 계열·7B~72B 4개 모델에서 측정
- 3.평균 FSI가 모델 간 30배 이상 차이, 대부분 형식 준수 실패로 설명됨
- 4.과제·모델·래퍼 통제 후에도 파싱 가능성이 정확도의 강한 예측변수로 확인
왜 중요한가?
포맷만 바뀐 래퍼가 리더보드 결론을 뒤집을 수 있음을 14만 건 규모로 정량화해, 래퍼 분산과 준수율 없이 정확도만 보고하는 현행 벤치마킹 관행이 통계적으로 취약함을 보였다. 구조화 출력을 쓰는 프로덕션 배포에도 직접 적용되는 진단 지표다.
언급 프로젝트
프롬프트 형식의 미묘한 변화가 LLM 벤치마킹 결과에 큰 영향을 미친다는 '형식 민감도 지수(FSI)' 연구는 국내 LLM 개발 및 평가 분야에 중요한 경고를 보냅니다. 한국의 AI 기업과 연구자들이 LLM 모델을 선택하고 최적화할 때, 신뢰할 수 있고 견고한 평가 방법론의 필요성을 강조하며, 이는 공정한 기술 경쟁 환경 조성에 필수적입니다.
본문 미리보기
arXiv:2607.09665v1 Announce Type: new Abstract: Prompt wrappers often differ only in formatting, yet they can change model scores enough to flip leaderboard conclusions. We study this variance under a token-controlled protocol and introduce two complementary metrics: the Format Sensitivity Index (FSI), the accuracy range induced by wrapper choice, and the Parseability Sensitivity Index (PSI), the corresponding range in answer parseability. Across 140,000 OpenRouter generations spanning 7 QA tas
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

