LLM 소크라테스식 튜터가 학생의 집요한 요구에 밀려 유도 질문을 포기하고 답을 직접 알려주는 '스캐폴딩 붕괴(scaffolding collapse)'를 표현 수준에서 방어하는 연구다. 기존 방어가 프롬프팅·선호 최적화·필터링으로 겉으로 드러난 응답만 제약한 반면, 이 연구는 붕괴에 선행하는 내부 표현 드리프트를 겨냥한다. 지도 미세조정으로 튜터를 준비시킨 뒤 궤적 가중 DPO와 동결 참조 상태에 앵커링한 마진 보존 표현 손실을 결합하는 2단계 프레임워크를 제안했다. STEM 5개 분야, 레드티밍 공격 전략 5종으로 평가한 결과 Qwen3-8B에서 붕괴율을 32%로 낮추고 평균 붕괴 시점을 9턴 이후로 지연시키면서 과잉 거부는 낮게 유지했다. AI 튜터가 장기 대화에서도 교육적 원칙을 지키게 하는 표현 수준 정렬의 가능성을 보여준다.
- •학생 압박에 튜터가 유도 질문을 버리고 정답을 공개하는 '스캐폴딩 붕괴' 문제를 표현 수준에서 방어
- •SFT 워밍업 후 궤적 가중 DPO + 동결 참조 상태 앵커 마진 보존 표현 손실의 2단계 프레임워크
- •STEM 5개 분야·레드티밍 공격 5종으로 평가
- •Qwen3-8B에서 붕괴율 32%로 인하, 평균 붕괴 시점 9턴 이후로 지연, 과잉 거부는 낮게 유지
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Mitigating Scaffolding Collapse in Socratic Tutors via Representation Alignment
- 1.소크라테스식 LLM 튜터의 '스캐폴딩 붕괴'를 표현 정렬로 완화하는 2단계 프레임워크 제안
- 2.궤적 가중 DPO에 고정 참조 상태 앵커 기반 마진 보존 표현 손실을 결합
- 3.Qwen3-8B에서 붕괴율 32%로 감소, 평균 붕괴 시점을 9턴 이후로 지연
- 4.5개 STEM 분야·5종 레드티밍 공격에서 과잉 거부 없이 견고성 검증
왜 중요한가?
기존 방어는 프롬프트·선호 최적화로 겉으로 드러난 응답만 제어했지만, 붕괴에 선행하는 내부 표현 드리프트 자체를 정렬한다는 점이 새롭다. 학생 압박에 정답을 흘리지 않는 AI 튜터 제품의 장기 대화 견고성을 높이는 실용적 접근이다.
언급 프로젝트
본문 미리보기
arXiv:2607.19371v1 Announce Type: new Abstract: Large language model (LLM)-based Socratic tutors increasingly guide students through multi-turn questioning, but they can suffer from scaffolding collapse: under sustained student pressure, a tutor gradually abandons guided inquiry and reveals solutions directly. Prior defenses primarily constrain observable responses through prompting, preference optimization, or filtering, leaving the internal representation drift that precedes trajectory-level
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:40AI 초안

