현재 LLM 적대적 강건성 방법들은 수만 개의 유해 프롬프트를 필요로 하지만 새로운 공격 벡터에 여전히 취약하다. 이 연구는 100개 미만의 추상적 개성 특성 진술문과 잠재적 적대적 훈련만으로 150,000개 이상 예시 기반 방법과 동등한 공격 성공률을 달성하는 '잠재 개성 정렬(LPA)'을 제안한다. LPA는 6개 유해성 벤치마크에서 기준 대비 오분류율을 2.6배 감소시키고 미지의 공격 분포에 더 잘 일반화된다. 개성 기반 정렬이 최소 비용으로 강건한 방어를 구축하는 원칙적 접근법임을 보여준다.
- •LPA는 100개 미만의 추상적 개성 특성 문장만으로 강건한 적대적 방어를 달성한다
- •유해 프롬프트 없이 훈련하면서도 15만 개 이상 예시 기반 방법과 동등한 성능을 보인다
- •6개 유해성 벤치마크에서 기준 대비 오분류율을 2.6배 감소시켰다
- •개성 기반 정렬이 미지의 공격 분포에 대한 일반화 능력을 크게 향상시킨다
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Latent Personality Alignment: Improving Harmlessness Without Mentioning Harms
- 1.LPA는 100개 미만의 성격 특성 문장만으로 150k+ 유해 예시 학습 방법과 동등한 공격 방어율 달성
- 2.잠재 적대적 훈련(LAT)으로 미지의 공격 분포에서 오분류율 기준 대비 2.6배 감소
- 3.유해 예시 없이 훈련하면서도 6개 유해 벤치마크 전반에 걸쳐 뛰어난 일반화 성능 확인
왜 중요한가?
AI 안전 방어를 위해 대규모 유해 데이터셋 없이도 강건한 모델 훈련이 가능함을 입증한 연구로, 안전 학습 비용을 획기적으로 절감할 수 있는 가능성을 제시한다.
본문 미리보기
arXiv:2605.08496v1 Announce Type: new Abstract: Current adversarial robustness methods for large language models require extensive datasets of harmful prompts (thousands to hundreds of thousands of examples), yet remain vulnerable to novel attack vectors and distributional shifts. We propose Latent Personality Alignment (LPA), a sample-efficient defense that achieves robustness by training models on abstract personality traits rather than specific harmful behaviors. Using fewer than 100 trait s
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

