지능형 교통시스템(ITS)은 영상 기반 인식 시스템 데이터를 활용해 도로 안전을 높이지만, 공격자가 영상 프레임을 조작해 하위 인식 모듈을 무력화하고 보행자 등 취약 이용자의 위험을 키울 수 있다. 이 연구는 안전이 중요한 영상 기반 시스템에서 특정 객체를 근실시간으로 제거하는 공격 모델과 종단간 프레임워크를 제시한다. 공격 파이프라인은 프레임별 표적 위치 파악, 이전 프레임에서 일관된 패치 검색, 맥락 인식 알파 합성을 이용한 블렌딩, 조작된 프레임 재구성의 4단계로 구성된다. 사우스캐롤라이나 커넥티드 비히클 테스트베드 교차로 실험에서 재구성된 프레임은 원본과 PSNR 40dB 이상, SSIM 0.996 이상의 높은 유사도를 유지하면서도 YOLO 기반 탐지에서 객체 탐지율을 최대 97.59% 낮췄고 프레임 단위 공격 성공률은 94.48%였다. GPU에서 프레임당 평균 실행 시간은 0.074~0.172초로 근실시간 수준이었고, 사전학습된 위변조 탐지 모델들도 재구성 프레임과 원본을 구별하는 데 한계를 보였다.
- •표적 위치 파악→패치 검색→알파 합성 블렌딩→프레임 재구성의 4단계 근실시간 객체 제거 공격 제시
- •재구성 프레임이 원본 대비 PSNR 40dB 이상, SSIM 0.996 이상으로 시각적 유사도 유지
- •YOLO 기반 탐지에서 객체 탐지율 최대 97.59% 감소, 프레임 단위 공격 성공률 94.48%
- •GPU에서 프레임당 0.074~0.172초로 근실시간 실행 가능
- •사전학습된 위변조 탐지 모델도 재구성 프레임과 원본 구별에 한계, 탐지 회피 가능성 시사
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Fast Object Removal Attacks on Safety-Critical Video-based Perception Systems
본문 미리보기
arXiv:2608.02806v1 Announce Type: new Abstract: By leveraging data from video-based perception systems, intelligent transportation systems (ITS) support safety-critical applications that improve road safety. However, adversaries may manipulate video frames to compromise downstream perception modules, causing failures in safety-critical functions and increasing risks to vulnerable road users. This paper presents a novel attack model and an end-to-end framework for near-real-time targeted object
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:58AI 초안



