이 논문은 프롬프트 인젝션 공격이 계속 진화하는 상황에서 기존의 정적인 방어 방식이 새로운 공격 유형마다 재설계가 필요하다는 한계를 지적하며, 이를 평생학습 문제로 재정의한 프레임워크 COPA를 제안한다. COPA는 한 번의 정렬(alignment)로 끝내지 않고 GRPO 기반 최적화로 새로 관측된 공격에 대한 피드백을 점진적으로 반영하며, 마진 가중 경험 재생을 통해 이전에 학습한 방어 능력을 유지해 이른바 '재앙적 망각'을 방지한다. 지속적인 프롬프트 인젝션 공격 스트림에 대한 실험에서 COPA는 기존 최신 방어 기법 대비 공격 성공률을 최대 6.3배, 평균 4.4배 낮췄다. 적응형 공격자에 대응하는 지속적 선호 최적화가 LLM 방어의 효과적인 패러다임이 될 수 있음을 보여준다.
- •프롬프트 인젠션 방어를 평생학습 문제로 재정의한 프레임워크 COPA 제안
- •GRPO 기반 점진적 최적화로 새로운 공격에 지속 적응
- •마진 가중 경험 재생으로 기존 방어 능력의 재앙적 망각 방지
- •최신 방어 기법 대비 공격 성공률 최대 6.3배, 평균 4.4배 감소
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
COPA: Continual Preference Optimization for Adaptive Prompt Injection Defense
- 1.COPA: 프롬프트 인젝션 방어를 평생학습 문제로 재정의한 지속적 선호 최적화 프레임워크, 고정적 정렬 방어의 한계를 해소
- 2.GRPO 기반 최적화로 새로운 공격을 점진적으로 반영하고, 마진가중치 경험재생으로 이전 공격 방어력 유지
- 3.최신 방어 대비 공격 성공률을 최대 6.3배, 평균 4.4배 감소
- 4.지속적 적응을 통해 파극적 망각(catastrophic forgetting) 없이 범용 능력을 보존하면서 방어력 강화
왜 중요한가?
기존 프롬프트 인젝션 방어는 정적이라 새 공격 유형이 등장할 때마다 재설계가 필요했는데, COPA는 지속 학습 관점으로 전환해 진화하는 공격에 실시간 적응하면서도 이전 방어력을 유지하는 실용적 해법을 제시한다.
언급 프로젝트
LLM의 치명적인 취약점인 프롬프트 인젝션 공격에 대한 적응형 방어 기술은 국내 AI 서비스 보안에 핵심적인 의미를 가집니다. 끊임없이 진화하는 공격 방식에 대응하기 위한 지속적인 선호도 최적화 방안은, 국내 기업들이 안전하고 신뢰할 수 있는 LLM 기반 서비스를 구축하고 운영하는 데 필수적인 보안 가이드라인과 기술적 토대를 제공할 것입니다.
본문 미리보기
arXiv:2608.19982v1 Announce Type: new Abstract: LLMs remain vulnerable to prompt injection attacks, where adversarial instructions embedded in user inputs or external content manipulate model behavior and bypass safeguards. Existing defenses are predominantly static, relying on fixed alignment objectives or attack-specific filtering mechanisms that require redesign as new attack strategies emerge. While recent lifelong alignment methods address shifting user preferences, they do not account for
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
