이 논문은 AI 에이전트에 대한 최대 위협으로 꼽히는 프롬프트 인젝션 방어를 위해, 토큰 단위 피드백으로 방어적 파인튜닝을 수행하는 Secure On-Policy Distillation(SecOPD)을 제안했다. 기존 DPO·GRPO 기반 방어 파인튜닝은 출력 전체를 동일하게 취급해 어느 토큰이 불안전한지 모델이 정확히 학습하지 못하는 한계가 있었는데, SecOPD는 주입된 샘플에 대한 롤아웃을 생성한 뒤 초기화 모델이 정상 입력 기준으로 각 토큰을 채점해 세밀한 학습 신호를 제공한다. 이렇게 방어된 Qwen3.6-27B는 최신 적응형 공격 PISmith에 대해 9.0%의 공격성공률(ASR)을 기록해, 기존 최고 방어 Meta-SecAlign의 94.0%를 크게 앞섰다. 학습에 전혀 없던 에이전트형 도구 호출 영역에서도 SecOPD는 4.7% ASR로 Meta-SecAlign(5.5%)보다 나은 일반화 성능을 보였다.
- •프롬프트 인적션 방어를 위해 토큰 단위 피드백으로 파인튜닝하는 Secure On-Policy Distillation(SecOPD) 제안
- •기존 DPO/GRPO는 출력 전체를 동일 취급, SecOPD는 초기화모델이 토큰별로 채점해 세밀한 신호 제공
- •방어된 Qwen3.6-27B가 최신 적응형 공격 PISmith에 ASR 9.0% 기록, 기존 최고(Meta-SecAlign) 94.0% 대비 대폭 개선
- •학습에 없던 에이전트 도구호출 영역에서도 ASR 4.7%로 우수한 도메인 일반화 성능 입증
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation
- 1.프롬프트 인젝션 방어를 위해 토큰 단위 피드백으로 파인틜윰하는 SecOPD(Secure On-Policy Distillation) 제안
- 2.기존 DPO/GRPO는 출력 전체를 동일 취급해 어느 토큰이 취약한지 학습하지 못하는 한계를 지적
- 3.방어 적용 Qwen3.6-27B가 최신 적응형 공격 PISmith 대상 ASR 9.0%, 기존 최고 Meta-SecAlign은 94.0%
- 4.학습에 없던 에이전트 도구호출 영역에서도 ASR 4.7%로 일반화, 코드·모델을 GitHub·HuggingFace에 공개
왜 중요한가?
프롬프트 인젝션은 AI 에이전트의 1위 위협으로 꼽히는데, 토큰 단위 학습신호만으로 최신 적응형 공격에 대한 방어 성공률을 기존 대비 10배 가까이 끌어올려 실전 배포 가능한 방어 수준에 근접했음을 보인다.
본문 미리보기
arXiv:2608.21500v1 Announce Type: new Abstract: Prompt injection is listed as the \#1 threat to AI agents. When an agent accesses external data from websites, files, or emails, an attacker may inject a prompt into the data, saying, "Ignore all prior instructions and perform ." To prevent arbitrary manipulation of agents, defenders try to train secure LLMs, which, however, still suffer from near 100% attack success rates (ASRs) against adaptive prompt injections. We note that this is because exi
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

