PromptShield-Home은 스마트홈 비서가 진짜 사용자 명령과 TV 소리, 화면 텍스트, 엿들은 대화처럼 명령처럼 보이지만 아닌 주변·외부 콘텐츠를 구분할 수 있는지를 평가하는 파일럿 벤치마크다. 수신자 모호성, 화면·오디오 인젝션, 건강 모니터 오탐, 혼합 거주, 정상 명령 기준선을 아우르는 현실적 시나리오로 전통적 탐지기(L0), 단일 MLLM 에이전트(L1), 다중 에이전트 중재(L2) 세 가지 추상화 계층을 비교했다. 라벨 분포가 무행동 쪽으로 치우쳐 있어 항상 차단하는 예측기도 82%를 기록하므로 안전하지 않은 실행률과 안전한 완료율을 따로 보고했는데, 탐지기는 모든 것에 반응하는 반면 모든 MLLM 구성은 과도하게 거부해 진짜 명령을 거의 수행하지 못하고 모든 사례에서 실제 낙상을 놓쳤다. 결정적으로 두 계층의 정답 집합은 서로 겹치지 않아, 항상 올바른 계층을 고르는 오라클은 94.1%에 도달한 반면 최고의 단일 계층은 76.5%에 그쳐, 홈 에이전트 안전은 MLLM으로 탐지기를 대체하기보다 학습된 라우팅과 센서 융합으로 달성하는 것이 최선이라는 결론을 뒷받침했다.
- •전통 탐지기(L0)·단일 MLLM(L1)·다중 에이전트 중재(L2) 세 계층 비교
- •모든 MLLM 구성이 과도하게 거부해 진짜 명령 수행률 낮고 낙상 감지 실패
- •탐지기는 모든 콘텐츠에 반응(오탐 과다)하는 반대 실패 양상
- •최적 계층을 고르는 오라클 94.1% vs 최고 단일 계층 76.5%
- •학습된 라우팅·센서 융합이 MLLM 단독 대체보다 안전에 유리하다고 결론
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
PromptShield Home: Ambient Multimodal Prompt Injection Defense for Smart-Home Agents
본문 미리보기
arXiv:2608.05495v1 Announce Type: new Abstract: Smart-home assistants increasingly use multimodal large language models (MLLMs) that perceive video and audio directly. This raises a safety question specific to the home: can the agent tell a genuine user command from ambient or externally-sourced content, television speech, on-screen text, or an overheard conversation, that merely looks like a command? We introduce PromptShield-Home, a pilot benchmark of realistic smart-home scenarios spanning a
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:58AI 초안



