이 논문은 하나의 모델 가중치 안에서 사용자(프린시펄)별 접근 권한을 격자 구조로 관리하는 '역량 게이팅(capability-gated) 배포' 개념을 제안한다. 기존에는 안전 파인튜닝, 필터링, 언러닝 같은 안전장치가 가중치 밖에서만 사용자별로 달라졌지만, 이 연구는 기존 중첩 분해(factorisation) 메커니즘에 희소 랭크 게이팅을 적용해 가중치 내부에서 이를 구현한다. 실험 결과 보안 속성은 단조 유도(monotone-elicitation) 가정 하에 '만남(meet)' 지점에서 합성 가능함이 증명적으로 확인됐고, 두 계열의 모델에서 억제 효과가 깊어졌다. 반면 유용성은 합성되지 않아, 개별적으로는 무해한 권한 프로필들이 결합하면 모델의 유지력과 유창성이 손상될 수 있고 이를 예측할 합성 경계도 존재하지 않는다는 점을 보였다.
- •하나의 가중치 안에서 사용자별 권한을 격자로 관리하는 '역량 게이팅' 배포 개념 제안
- •기존 중첩 분해 메커니즘에 희소 랭크 게이팅 적용해 가중치 내부에서 접근 제어 구현
- •보안 속성은 '만남' 지점에서 합성 가능함을 증명적으로 확인
- •유용성은 합성되지 않아 무해한 권한 조합이 모델 성능을 손상시킬 수 있음을 발견
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Capability-Gated Language Models: Security Composes, Utility Does Not
- 1.가중치 내부에서 주체별 권한을 격자 구조로 관리하는 capability-gated 배포 개념 제안
- 2.기존 nested-factorisation 메커니즘 위에 희소 랭크 게이팅을 적용해 구현
- 3.보안은 단조 유도 가정 하 meet 지점에서 합성되지만, 효용은 합성되지 않아 무해한 프로필 조합이 성능저하를 유발함을 발견
왜 중요한가?
필터링·재학습 등 모델 바깥에서 이뤄지던 안전장치 구성을 가중치 내부의 권한 격자로 재구성하면서도, 보안은 합성 가능하지만 효용은 합성 불가하다는 트레이드오프를 드러내 안전-성능 균형 설계에 시사점을 준다.
본문 미리보기
arXiv:2609.00445v1 Announce Type: new Abstract: Deployed language model safeguards (safety fine-tuning, filtering, unlearning) vary by principal only outside the model weights: filters are reconfigured, tiers are multiplied, and artefacts are reissued; inside one set of weights every request meets the same model configuration. This motivates us to define capability-gated deployment: per-principal access control inside one set of weights, whose configurations form a lattice - meets accumulate a
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
