에이전틱 AI에서 안전성과 공정성은 모델 가중치나 정렬이 아닌 상호작용 토폴로지에 의해 결정된다고 주장하는 포지션 페이퍼다. 순서 불안정성, 정보 캐스케이드, 기능적 붕괴의 세 가지 토폴로지 유발 병리가 발견되며, 역설적으로 더 유능한 모델로 확장할수록 이 효과가 강화된다. 에이전틱 AI를 정렬된 구성 요소의 집합이 아닌 동적 시스템으로 다루고 배포 전 다양한 아키텍처에서 견고성을 입증해야 한다고 촉구한다.
- •에이전틱 AI의 안전성은 개별 모델의 가중치나 정렬이 아닌 상호작용 토폴로지에 의해 결정된다.
- •순서 불안정성, 정보 캐스케이드, 기능적 붕괴의 세 가지 토폴로지 유발 병리가 발견된다.
- •더 유능한 모델로 확장하면 콘센서스 형성이 강화되어 실패 모드가 심화된다.
- •에이전틱 AI를 동적 시스템으로 다루고 배포 전 다양한 아키텍처 변형에서 견고성을 입증해야 한다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Position: Safety and Fairness in Agentic AI Depend on Interaction Topology, Not on Model Scale or Alignment
- 1.멀티 에이전트 AI의 안전성은 모델 성능이 아닌 에이전트 상호작용 구조에 의해 결정됨
- 2.순서 불안정성·정보 캐스케이드·기능적 붕괴 3가지 위상 병리가 일관되게 발생
- 3.모델 성능 향상이 오히려 합의 형성을 강화해 위상 병리를 악화시킬 수 있음
왜 중요한가?
개별 모델 정렬에만 집중하는 현행 AI 안전 평가의 맹점을 지적하고, 시스템 아키텍처 자체를 안전 규제 대상으로 삼아야 함을 주장함.
본문 미리보기
arXiv:2605.01147v1 Announce Type: new Abstract: As large language models are increasingly deployed as interacting agents in high-stakes decisions, the AI safety community assumes that safety properties of individual models will compose into safe multi-agent behavior. This position paper argues that this assumption is fundamentally mistaken. In agentic AI, safety is determined by interaction topology, not model weights. When agents deliberate sequentially or aggregate via parallel voting with a
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:12AI 초안

