연구진은 LLM 에이전트를 외부 도구에 연결하는 표준인 MCP(Model Context Protocol)에서 서버 측이 초기엔 정상 동작해 신뢰를 쌓고 경계심을 낮춘 뒤 특정 상호작용 임계치를 넘으면 악성 페이로드로 전환하는 새로운 위협 'TrustShift'를 정의했다. 이 공격은 배포 시점엔 정상이라 사전 정적 분석으로는 탐지가 불가능하며, 프롬프트 인젝션이나 중간자 공격과 달리 신뢰받는 서버 엔드포인트 자체가 공격자다. 이들이 개발한 TrustShiftProbe는 정상-이탈 2단계 위협 모델, 언어에 독립적인 공격 엔진, 정상 구간에서 학습한 행동 기준선으로 서버 페이로드를 감사하는 다계층 무오라클 런타임 방어 SHIELD, 9가지 TrustShift 변종 분류체계로 구성된다. 최신 상용·오픈웨이트 모델 전반에서 TrustShift 공격은 평균 69.5%의 성공률을 보였으며 SHIELD 적용 시 42.7%로 낮아졌다.
- •MCP 서버가 정상 조건화 후 임계치를 넘으면 악성 페이로드로 전환하는 'TrustShift' 위협 정의
- •사전 정적 분석으로는 탐지 불가, 서버가 자체가 공격자인 새로운 공격 유형
- •다계층 런타임 방어 SHIELD와 9가지 TrustShift 변종 분류체계 제안
- •공격 성공률 69.5%를 SHIELD로 42.7%까지 감소
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
TrustShiftProbe: Characterizing, Benchmarking, and Defending Staged Trust Attacks on MCP Servers
- 1.MCP 서버가 초기엔 정상 동작하며 신뢰를 쌓다가 상호작용 임계치를 넘으면 악성 페이로드로 전환하는 'TrustShift' 위협 정의
- 2.실행 메커니즘 3종·목적 3종 조합, 9종 TrustShift 변종 taxonomy 제시
- 3.프런티어 상용·오픈웨이트 모델 전반에서 TrustShift 공격 평균 성공률 69.5% 기록
- 4.방어 프레임워크 SHIELD가 클린 신뢰구간 행동 기준선과 서버 페이로드를 대조해 성공률을 42.7%로 완화
왜 중요한가?
공격 주체가 사용자 프롬프트나 중간자가 아닌 신뢰받는 MCP 서버 자체이며 사전 정적 분석으로는 탐지가 불가능하다는 점에서 기존 프롬프트 인젝션 방어와는 다른 차원의 위협으로, MCP 생태계 확산에 앞서 런타임 행동 기반 방어가 필요함을 보여준다.
언급 프로젝트
본문 미리보기
arXiv:2608.23763v1 Announce Type: new Abstract: The Model Context Protocol (MCP) has emerged as the standard layer connecting Large Language Model agents to external tool backends. This openness introduces a severe server-side threat we term TrustShift: a compromised MCP server behaves benignly during an initial conditioning phase, building operational reliance and suppressing agent skepticism, before switching to an adversarial payload once an interaction threshold is reached. The evasion is t
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
