오픈웨이트 LLM을 맞춤형 비서로 파인튜닝하면 학습 데이터가 악의적이지 않더라도 안전 정렬이 약해져 악성 프롬프트에 취약해질 수 있고, 모델이 갱신될 때마다 안전성을 다시 복구해야 하는 문제가 반복된다. SafeGene은 안전 복구를 모델별 수리 작업으로 보는 대신, 안전 역량을 과제별 업데이트와 분리된 독립적·재사용 가능한 어댑터 표현으로 다루는 모듈이다. 정렬된 모델과 성능 저하된 모델의 차이에서 안전 표현을 얻어, 데이터 인식 레이어 선택으로 과제 이전 가능한 안전 벡터로 정제하고, 소수 샷 레이어별 계수 재보정으로 각 하위 과제 모델에 적용한다. 여러 모델 패밀리·과제·안전 심사자 실험에서 하위 성능을 유지하면서 유해 응답률을 낮춰 기존 안전 적응 기법보다 나은 안전-효용 절충을 보였다.
- •파인튜닝이 안전 정렬을 약화시켜 반복되는 '안전 복구 문제'를 다룸
- •안전 역량을 과제 업데이트와 분리된 재사용 가능한 어댑터 표현으로 취급(동일 아키텍처 패밀리 내 재사용)
- •정렬–저하 모델 차이에서 안전 표현 추출 → 데이터 인식 레이어 선택으로 이전 가능한 안전 벡터 정제
- •소수 샷 레이어별 계수 재보정으로 각 하위 과제 모델에 적용
- •여러 모델 패밀리에서 하위 성능 유지 속 유해 응답률 감소, 안전-효용 절충에서 기존법 우위
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
SafeGene: Reusable Adapters for Transferable Safety Alignment
- 1.재사용 가능한 안전 어댑터 모듈 SafeGene 제안
- 2.다운스트림 파인튜닝이 안전 정렬을 약화시키는 반복적 안전 복구 문제 해결
- 3.정렬-열화 모델 차이에서 작업 전이 가능한 안전 벡터를 추출
- 4.여러 모델군·작업서 유해 응답률 감소하며 다운스트림 성능 유지
왜 중요한가?
오픈웨이트 LLM이 파인튜닝마다 안전성이 약화되는 문제를 모델별 수리가 아닌 재사용 가능한 독립 어댑터로 분리해, 반복 업데이트 환경에서 안전-효용 트레이드오프를 개선한 점이 실무적으로 중요하다.
언급 프로젝트
오픈소스 LLM을 미세 조정할 때 안전 정렬이 약화되어 악성 프롬프트에 취약해지는 문제는 국내 AI 윤리 및 보안의 핵심 과제입니다. 'SafeGene'은 이러한 문제를 해결하기 위한 재사용 가능한 어댑터를 제시하며, 이는 국내 기업들이 LLM을 맞춤형으로 개발하면서도 안전성을 유지하는 데 실질적인 도움을 줄 수 있습니다. AI 서비스의 신뢰성을 확보하고 사용자 피해를 방지하기 위한 국내 규제 및 가이드라인 준수에도 중요한 기술적 토대를 제공할 것입니다.
본문 미리보기
arXiv:2606.06519v1 Announce Type: new Abstract: Open-weight LLMs are increasingly fine-tuned into customized assistants, but downstream fine-tuning can weaken safety alignment and make models more vulnerable to malicious prompts, even when the training data is not intentionally harmful. This creates a recurring safety recovery problem as target models are repeatedly updated with new task data or user interactions. We propose SafeGene, a reusable safety-adapter module designed for cross-task reu
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:12AI 초안

