이 논문은 신경-기호(NeSy) AI가 백도어 공격에 얼마나 강건한지를 신경망 단독 모델과 비교해 체계적으로 평가한 최초의 연구다. 연구진은 대표적인 NeSy 프레임워크인 DeepProbLog를 기준 신경망과 함께 8가지 백도어 설정, 4가지 추론 과제에 걸쳐 비교했다. 실험 결과 NeSy 모델은 평균적으로 신경망 단독 모델보다 더 강건했지만, 그 강건성은 추론 과정의 엄격함과 선택된 적대적 목표와의 호환성에 크게 좌우되는 것으로 나타났다. 연구팀은 실험 재현을 위한 소스코드를 깃허브에 공개했다.
- •NeSy AI의 백도어 공격 강건성을 체계적으로 평가한 최초 연구
- •대표 프레임워크 DeepProbLog를 신경망 기준 모델과 8개 백도어 설정·4개 추론 과제에서 비교
- •NeSy 모델이 평균적으로 더 강건하지만 추론 엄격도·적대적 목표 호환성에 따라 편차 큼
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Does Reasoning Mitigate Backdoor Attacks? A Neuro-Symbolic Perspective
- 1.신경-기호(NeSy) AI의 백도어 공격 강건성을 최초로 체계 평가
- 2.대표 NeSy 프레임워크 DeepProbLog를 일반 신경망과 8개 백도어 설정·4개 추론과제에서 비교
- 3.NeSy가 평균적으로 더 강건하지만, 강건성은 추론 엄격성과 공격목표 적합성에 크게 좌우됨을 확인
왜 중요한가?
신경-기호 AI가 '설계상 안전하다'는 통념과 달리 신경-기호 통합 과정 자체가 새로운 공격 표면이 될 수 있음을 실증해, 신뢰할 수 있는 AI로 기대되는 NeSy 시스템의 보안 검증 필요성을 제기한다.
언급 프로젝트
본문 미리보기
arXiv:2609.00464v1 Announce Type: new Abstract: Neuro-Symbolic (NeSy) AI has recently emerged as a novel paradigm to enable trustworthy AI, aiming at integrating sub-symbolic neural perception with grounded symbolic reasoning. The neuro-symbolic integration process that characterizes these models has been proven beneficial to achieve more transparent, explainable and efficient AI systems. Meanwhile, their properties under adversarial settings have been overlooked being frequently deemed robust-
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
