Mitigating Scaffolding Collapse in Socratic Tutors via Representation Alignment
- 1.소크라테스식 LLM 튜터의 '스캐폴딩 붕괴'를 표현 정렬로 완화하는 2단계 프레임워크 제안
- 2.궤적 가중 DPO에 고정 참조 상태 앵커 기반 마진 보존 표현 손실을 결합
- 3.Qwen3-8B에서 붕괴율 32%로 감소, 평균 붕괴 시점을 9턴 이후로 지연
- 4.5개 STEM 분야·5종 레드티밍 공격에서 과잉 거부 없이 견고성 검증
왜 중요한가?
기존 방어는 프롬프트·선호 최적화로 겉으로 드러난 응답만 제어했지만, 붕괴에 선행하는 내부 표현 드리프트 자체를 정렬한다는 점이 새롭다. 학생 압박에 정답을 흘리지 않는 AI 튜터 제품의 장기 대화 견고성을 높이는 실용적 접근이다.
🏷️ 언급 프로젝트
본문 미리보기
arXiv:2607.19371v1 Announce Type: new Abstract: Large language model (LLM)-based Socratic tutors increasingly guide students through multi-turn questioning, but they can suffer from scaffolding collapse: under sustained student pressure, a tutor gradually abandons guided inquiry and reveals solutions directly. Prior defenses primarily constrain observable responses through prompting, preference optimization, or filtering, leaving the internal representation drift that precedes trajectory-level
전체 내용이 궁금하다면?
원문을 직접 읽어보세요