멀티버스컴퓨팅 연구팀이 '경계 인식 자기증류(Boundary-Aware Self-Distillation)'라는 방법으로, 정치 등 하나의 주제 전체를 거부하는 대신 그 주제 안에서 유해한 부분집합만 정교하게 거부하도록 LLM을 학습시키는 방법을 제시했다. 기존 자기생성 방식은 단일 스티어링 시도로 거부 응답을 생성할 때 프롬프트의 19.88%가 누락되는 커버리지 공백이 있었는데, 반복적 재시도로 이를 0.20%까지 줄였다. Qwen3-8B 실험에서 정치 관련 유해 프롬프트 거부율은 9.47%에서 84.75%로 올랐지만, 이 설정에서 안전한 프롬프트(XSTest)에 대한 과잉거부율도 2%에서 74%까지 치솟는 함정이 드러났다. 연구팀이 검증된 무해 경계 데이터를 추가하자 과잉거부율은 32.94%에서 4.16%로 크게 낮아졌고 유해 거부율은 91.88%에서 87.72%로 소폭만 하락해, 두 지표를 함께 측정해야 진짜 성능 개선을 알 수 있다는 점을 보였다.
- •'경개 인식 자기증륙'로 주제 전시가 아닌 유해 부분지분달 정윈하게 거뱈하도록 LLM 학습
- •단일 스파랥 자기생성 방식은 프롬프트에 19.88% 느막이개 발생, 반밍 장시된 봇넄 공른을 0.20%까지 개선
- •Qwen3-8B에서 유해 거뱈율 9.47%→84.75%로 상승했지만 XSTest 과잉거뱈율도 2%→74%로 급증하녌 함정 발걱
- •검증된 봇넄 공른 데이니 추가둌볶 과잉거뱈육 32.94%→4.16%, 유해 거뱈육은 91.88%→87.72%로 소폭만 하느하뀰 모뉰
- •안전성 횜망율만대 관토해서느느, 거낌 앞을 간셼 팉압하앴 즉카지 것과 관마도만 낙하녌 합계적은 붬
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Safety for Whom? Refusing the Right Subset of a Topic, Not the Whole Topic
- 1.멀티버스컴퓨팅 연구팀, 하나의 주제 안에서 '유해한 부분만' 거부하는 경계인식 자기증류 논문 발표(9/8)
- 2.Qwen3-8B에서 정치 거부율 9.47%→84.75%로 상승시키자 무해질문 과잉거부율(XSTest)도 2%→74%로 급증
- 3.경계 프롬프트 쌍 1,539개 추가로 과잉거부를 32.94%→4.16%로 낮춤, 유해거부율은 91.88%→87.72%로 소폭만 하락
- 4.단일시도 생성 시 데이터 19.88% 누락 문제를 단계적 재시도로 0.20%까지 줄이는 커버리지 보완 기법도 제시
왜 중요한가?
안전성 튜닝을 '얼마나 많이 거부하는가'가 아니라 '올바른 경계에서 거부하는가'로 재정의해, 과잉 검열로 유용성을 해치지 않으면서 배포 정책별로 세밀하게 제어 가능한 LLM 안전장치 설계법을 제시한다.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:39AI 초안

![[10월8일] “수학 문제 4000개에 AI 투입해 성과”…오픈AI가 보여준 과학연구의 변화](https://cdn.aitimes.com/news/photo/202610/216072_220045_048.png)

