이 학위논문은 프롬프트 인젝션, 트로이목마(백도어), 자동 품질 지표 조작 등 LLM 운영 시스템이 겪는 적대적 입력 변형에 대한 평가·개선 방법을 체계적으로 다룬다. 입력에 작은 교란을 가했을 때 단계별 출력 분포 간 젠슨-섀넌 발산을 기반으로 한 생성형 견고성 지표 R_stab(f)를 제안하고, 국소화된 공격에 대해 결정 연산자가 교란에도 결정을 유지할 확률과의 관계식을 증명했다. LLM-as-a-Judge 시스템을 겨냥한 적응형 진화 블랙박스 공격 ASA는 공격 성공률 최대 73.8%(오픈모델 간 전이 시 62.6%)에 달했고, SaTML CTF 2024에서는 다층 방어의 네 가지 우회 유형을 체계화해 공격 성공률을 90%에서 15~25%로 낮췄으며, 5~7개의 이질적 모델로 구성한 위원회는 Gemma-3-4B의 공격 성공률을 47~55퍼센트포인트 낮춰 19.3%까지 떨어뜨렸다. 모델 컨텍스트 프로토콜(MCP) 기반 에이전트 시스템을 위해서는 호출당 0.1밀리초 이하로 도구 호출을 인증하는 AttestMCP를 제안해, 847개 시나리오의 MCPBench에서 평균 공격 성공률을 53.7%에서 12.4%로 낮췄다.
- •입륨 교라 시 출륥 봄포 뿀황을 잴슨-셐놩 봄포로 주정홈 생성홈 거고성 지표 R_stab(f) 제안
- •LLM-as-a-Judge 거통 적응홈 진홈 거격 ASA거 공격 성공륨 최뉨 73.8%, 전이 시 62.6% 똄성
- •SaTML CTF 2024 다출 봄어 우회 4유홈 체거홈호로 공격 성공륨 90%→15~25%로 거섁
- •5~7거 이질적 똄렄 위에휄롔로 Gemma-3-4B 공격 성공륨 47~55%p 거섁, AttestMCP로 MCPBench 홈교 ASR 53.7%→12.4%
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Evaluating and Improving the Robustness of Large Language Models to Input Sequence Variations
- 1.LLM 강건성 평가 지표 R_stab(f) 제안, 젠슨-섀넌 발산으로 입력 교란 시 출력 분포 변화 측정
- 2.적응형 진화 공격 ASA로 LLM 심사자 시스템 공격성공률 최대 73.8%, 모델 간 전이율 62.6% 달성
- 3.이형 모델 5~7개 심사위원단이 Gemma-3-4B 공격성공률을 47~55%p 낮춰 19.3%까지 감소
- 4.MCP 에이전트용 AttestMCP 제안, 호출당 0.1ms 미만 인증으로 MCPBench 평균 ASR을 53.7%→12.4%로 절감
왜 중요한가?
프롬프트 인젝션·트로이목마·LLM 심사자 조작 등 프로덕션 LLM의 실제 위협을 정량 지표와 방어 도구(JudgeGuard, TrojanArmor, MCPSec)로 체계화해 MCP 기반 에이전트 보안 설계에 바로 적용 가능한 방어선을 제시한다.
대규모 언어 모델(LLM)이 국내 다양한 산업 분야의 서비스에 활용되면서, 프롬프트 주입과 같은 입력 변형 공격에 대한 모델의 견고성 확보는 핵심 과제가 되고 있습니다. 본 연구는 LLM의 이러한 적대적 공격에 대한 강건성을 평가하고 개선하기 위한 방법론을 제시하며, 실제 서비스 환경에서 LLM의 신뢰성을 높이는 데 기여합니다. 이는 국내 기업들이 안전하고 안정적인 LLM 기반 서비스를 구축하는 데 필수적인 고려 사항을 제공할 것입니다.
본문 미리보기
arXiv:2610.02432v1 Announce Type: new Abstract: Large language models (LLMs) in production systems face prompt injections, trojans (backdoors), and manipulation of automatic quality metrics. This thesis develops models, methods, and algorithms for evaluating and improving LLM robustness to adversarial input sequence variations. We propose R_stab(f), a generative robustness metric based on the Jensen-Shannon divergence between per-step output distributions under small input perturbations. For lo
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

