MCP(Model Context Protocol) 환경에서 LLM이 도구 선택 과정에 얼마나 취약한지 측정하는 벤치마크 COPEX가 공개됐다. 에이전트 스택을 고정하고 도구 선택 모델만 바꿔가며 모델/에이전트, 클라이언트, 서버/도구, 전송 계층 등 4개 진입 경로에 걸친 25종 공격을 125개 시나리오로 구성했다. 9개 모델, 3,375회 시험에서 평균 공격 성공률이 64.4%에 달했고, 입력·컨텍스트 스캐닝을 결합한 방어는 성공률을 49.6% 낮췄다. 코드는 깃허브에 공개돼 있다.
- •모델/에이전트, 클라이언트, 서버/도구, 전송 등 4개 진입 경로에 걸친 25종 공격 125개 시나리오 구성
- •9개 모델 3,375회 시험에서 평균 공격 성공률 64.4%, 표면별 58.3~71.4%
- •입력·컨텍스트 스캐닝 방어 적용 시 공격 성공률 49.6% 감소
- •에이전트 스택을 고정해 모델 자체의 취약성만 분리 측정하도록 설계
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
COPEX: Benchmarking LLM Robustness to Adversarial Context Across Model Context Protocol Layers
- 1.MCP 환경에서 LLM의 적대적 컨텍스트 취약성을 격리 평가하는 벤치마크 'COPEX' 공개
- 2.모델/에이전트·클라이언트·서버/툴·전송 4개 진입 표면에 25종 공격을 125개 시나리오로 구성
- 3.9개 모델 3,375회 시행에서 평균 공격성공률 64.4%, 표면별 58.3~71.4% 분포
- 4.입력·컨텍스트 스캐닝 방어를 결합하면 8종 공격 하위집합에서 평균 공격성공률을 49.6% 낮춤
왜 중요한가?
LLM이 MCP로 도구를 호출하는 구조가 확산되는 가운데, 에이전트 전체가 아닌 모델 자체의 취약성만 분리 측정함으로써 가드레일·오케스트레이션과 모델 역량을 혼동해온 기존 평가의 한계를 보완한다.
언급 프로젝트
대규모 언어 모델(LLM)이 도구 사용 시스템에서 사용자 지침, 도구 스키마 등 다양한 공격 경로를 통해 악의적인 입력에 얼마나 취약한지 벤치마킹하는 연구입니다. 한국에서 LLM 기반 서비스 도입이 활발해지는 가운데, 이러한 모델의 견고성을 확보하는 것은 신뢰성 있는 AI 서비스 운영의 핵심 과제가 될 것입니다.
본문 미리보기
arXiv:2610.04378v1 Announce Type: new Abstract: Large language models increasingly mediate tool use in Model Context Protocol (MCP) systems, where adversarial influence may enter through user instructions, tool schemas, tool outputs, or protocol messages. Existing benchmarks often evaluate deployed agents, conflating model susceptibility with guardrails, orchestration, and general task capability. We introduce COPEX (COntext Provider EXploitation), a controlled benchmark that isolates the model
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

