LLM 은닉 공간에서 선형 반공간 제약으로 안전 경계를 학습하는 SaP(Safety as Polytope)의 제약 수 K를 범주별로 튜닝해야 하는 문제를 희소 오토인코더(SAE) 특징 추출로 해결한 연구다. SAE 특징 공간에서는 Qwen3.5-9B 기준 14개 중 12개 범주에서 K=2가 최적이 되어, 기존의 무작위 초기화 K=4~25 전수 탐색이 대부분 불필요해졌고 BeaverTails 분류 벤치마크에서 범주당 96~99% 정확도를 달성했다. 두 개 평면으로의 수렴은 선형 표현 가설(LRH)과 부합하며, 안전 경계가 SAE 특징 공간에서 저차원 선형 기술을 허용한다는 시사적 증거다. 이 기하학적 관점을 바탕으로 범주별 클러스터 집중도에 맞춰 개구부가 학습되는 콘(cone) 제약과 3단계 훈련 안정화 기법도 도입했다.
- •SAE 특징 추출로 SaP의 범주별 제약 수 K 튜닝 문제 해결—K=2가 14개 중 12개 범주에서 최적
- •Qwen3.5-9B·BeaverTails 벤치마크에서 범주당 96~99% 정확도
- •두 평면 수렴은 선형 표현 가설과 부합—안전 경계의 저차원 선형 기술 가능성 시사
- •클러스터 집중도에 적응하는 학습형 콘(cone) 제약과 3단계 훈련 안정화 도입
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Geometry-Guided Constraint Learning for LLM Safety Classification
- 1.SAE 피처 추출로 Safety as Polytope의 카테고리별 제약 수 K 튜닝 문제 해결
- 2.Qwen3.5-9B에서 14개 중 12개 카테고리가 K=2로 수렴, 정확도 96~99% 달성
- 3.안전 경계가 SAE 피처 공간에서 저차원 선형 기술을 허용한다는 선형 표현 가설 부합 증거
- 4.클러스터 집중도에 적응하는 학습형 개구부 콘(cone) 제약과 3단계 학습 도입
왜 중요한가?
기존 SaP는 카테고리마다 K=4~25를 전수 탐색해야 했지만 SAE 공간에서는 평면 2개로 충분해져 안전 분류기 구축 비용이 크게 준다. 안전 경계의 기하 구조가 단순하다는 발견은 해석 가능한 경량 가드레일 설계로 이어질 수 있다.
언급 프로젝트
본문 미리보기
arXiv:2607.19366v1 Announce Type: new Abstract: Safety as Polytope (SaP) learns linear half-space constraints in LLM hidden space but requires per-category tuning of the constraint count K. We show that sparse autoencoder (SAE) feature extraction resolves this: K=2 becomes optimal for 12/14 categories on Qwen3.5-9B, achieving 96-99% accuracy per category on our BeaverTails classification benchmark, largely eliminating the need for exhaustive sweeps (K=4-25 with random initialization). This conv
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:40AI 초안

