이 논문은 LLM 안전장치가 답변이 실제로 어떻게 쓰일지 확인하기 전에 답변 여부를 결정한다는 근본적 한계를 지적한다. 공격자가 선의의 요청과 상호작용 이력을 그대로 복제(copyable)할 수 있을 때, 유용한 답변을 유지하면서도 공격자에게 제공되는 지원을 완전히 막을 수 없다는 수학적 하한을 도출했다. 연구진은 이를 '안전 트릴레마(safety trilemma)'로 정식화했다: 유용한 능력, 신뢰할 수 있는 안전성, 개방적 접근을 동시에 만족할 수 없다는 것이다. 복제하기 어려운 신뢰 자격증명(trusted credential)을 결합하면 기존 안전장치를 보완해 이 한계를 완화할 수 있음을 보이고, 이중용도 평가와 적응형 공격 실험으로 이론의 실효성을 뒷받침했다.
- •LLM 안전장치는 답변의 실사용 맥락을 보지 못한 채 사전에 허용 여부를 결정하는 구조적 한계 보유
- •'유용한 능력·신뢰할 수 있는 안전성·개방적 접근'을 동시에 만족할 수 없는 '안전 트릴레마' 정식화
- •상호작용 이력이 복제 가능한 한 공격자 지원을 막는 데 수학적 하한이 존재함을 증명
- •복제하기 어려운 신뢰 자격증명 도입이 안전장치를 보완할 실질적 대안으로 제시
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Safeguards Based on Copyable Context Cannot Provide Reliable Safety for LLMs
본문 미리보기
arXiv:2607.27951v1 Announce Type: new Abstract: Large language model safeguards decide whether to answer before seeing how an answer will be used. This creates a basic problem for dual-use tasks: the same answer can help an authorized professional or an attacker, while an attacker can imitate a benign request and interaction history. We separate the capability released by the model from the evidence available about downstream use. When that evidence is copyable, we derive the exact worst-case f
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:06AI 초안



