이 논문은 LLM 튜터가 정답이나 결정적 추론을 허가되지 않은 시점에 누설하는 문제를 '교육적 누설(pedagogical leakage)'로 정의하고, 이를 통제하는 인가 기반 완전 중재 경계를 제안한다. 선택기가 다섯 가지 공개 계약 중 하나를 결정하고, 신뢰된 정책이 특권 모드를 통제하며, 단일 릴리스 함수가 검사 가능한 규칙과 대체 절차를 적용해 선택·생성·검증·집행 단계의 실패를 분리 추적한다. Gemini 3.5 기반 599개 응답 실험에서 엄격한 중재를 적용하자 패널 다수결 기준 누설 플래그가 181건에서 0건으로 줄었으나, 581개 응답이 교체되며 도움 정도(helpfulness)는 낮아졌다. 40개 미공개 문제군·480개 공격 시퀀스로 진행한 외부 재현 실험에서도 고강도 릴리스 방식이 다수결 누설 플래그를 42건에서 8건으로 줄였다. 다만 일부 실패는 여전히 남아, 이 방법이 보편적인 의미론적 안전이나 학습 효과를 보장하지는 않는다는 점을 분명히 한다.
- •LLM 튜터의 미승인 정답·추론 노출을 '교육적 누설'로 정의하고 인가 기반 중재 경계 제안
- •선택-생성-검증-집행 단계를 분리 추적하는 단일 릴리스 함수 설계
- •Gemini 3.5 599개 응답 실험서 다수결 누설 플래그 181→0건, 단 581개 응답 교체·도움 정도 하락
- •40개 미공개 문제군 외부 재현서도 누설 플래그 42→8건으로 감소
- •안전성과 유용성 사이 트레이드오프 존재, 보편적 안전 보장은 아님
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Auditable Release Control for Pedagogical Leakage in LLM Tutors
- 1.LLM 튜터가 허가 전에 정답·결정적 풀이를 노출하는 '교육적 유출'을 형식화, 인가 기반 완전 매개 경계 제안
- 2.5종 공개 계약 선택기·신뢰 정책 게이트·단일 릴리스 함수로 선택·생성·검증·집행 실패를 분리 추적
- 3.Gemini 3.5 응답 599건에서 엄격 매개 적용 시 패널 다수결 유출 플래그 181건에서 0건으로 감소
- 4.미공개 40개 문제군·480개 공격 시퀀스 재현에서도 42건에서 8건으로 감소, 단 도움성은 하락
왜 중요한가?
AI 튜터의 '정답 유출'은 교육 효과를 해치는 고질적 문제인데, 이를 감사 가능한 릴리스 경계와 실패 귀속 체계로 다뤄 안전-유용성 트레이드오프를 정량화했다. 에듀테크 LLM 제품의 공개 정책 설계에 직접 참고할 수 있는 구조를 제시한다.
언급 프로젝트
본문 미리보기
arXiv:2608.00515v1 Announce Type: new Abstract: Large language model tutors can be correct and helpful yet disclose an answer or decisive reasoning before that disclosure is authorized. We formalize this state- and action-dependent failure as pedagogical leakage and introduce an authorization-aware complete-mediation boundary. A selector emits one of five disclosure contracts, trusted policy gates privileged modes, and a renderer proposes language. A single release function applies inspectable
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:35AI 초안

