멀티 에이전트 시스템에서 콘텐츠 수준에서는 무해해 보이지만 악의적 의도를 가진 에이전트를 탐지하는 Bot-Mod 조정 프레임워크를 소개합니다. 후보 의도 가설에 대한 깁스 기반 샘플링으로 유도되는 다중 턴 교환을 통해 에이전트의 기저 의도를 점진적으로 좁혀 식별합니다. Moltbook 데이터셋 기반 평가에서 다양한 적대적 구성에서 낮은 오탐률로 에이전트 의도를 신뢰성 있게 식별함을 입증했습니다.
- •Bot-Mod는 콘텐츠가 아닌 에이전트 의도에 기반한 멀티 에이전트 조정 프레임워크
- •깁스 기반 샘플링과 다중 턴 대화로 악의적 에이전트의 기저 의도를 점진적으로 식별
- •콘텐츠 필터링만으로는 감지 불가능한 교묘한 악의적 행동 탐지 가능
- •낮은 오탐률로 다양한 적대적 구성에서 신뢰할 수 있는 의도 식별 성능 입증
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Moltbook Moderation: Uncovering Hidden Intent Through Multi-Turn Dialogue
- 1.콘텐츠가 아닌 에이전트 의도 기반으로 악의적 다중 에이전트를 탐지하는 Bot-Mod 제안
- 2.Gibbs 샘플링 기반 멀티턴 교환으로 악의적 에이전트 의도를 점진적으로 좁혀 식별
- 3.Moltbook 기반 데이터셋으로 다양한 적대적 설정에서 의도 식별 신뢰성 검증
- 4.낮은 위양성률 유지하며 개방형 다중 에이전트 환경의 확장 가능한 모더레이션 지원
왜 중요한가?
콘텐츠 필터링만으로 포착 불가능한 악의적 에이전트 행동을 의도 수준에서 탐지함으로써, 다중 에이전트 AI 시스템의 보안과 안전성을 새로운 차원으로 끌어올린다.
언급 프로젝트
본문 미리보기
arXiv:2605.12856v1 Announce Type: new Abstract: The emergence of multi-agent systems introduces novel moderation challenges that extend beyond content filtering. Agents with {\em malicious intent} may contribute harmful content that appears benign to evade content-based moderation, while compromising the system through exploitative and malicious behavior manifested across their overall interaction patterns within the community. To address this, we introduce \textsc{\textbf{Bot-Mod}} (\textsc{\t
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

