오픈소스 자율 침투테스트 하니스 NeuroSploit v4.2.0이 다중 포레스트 액티브 디렉터리(AD) 실습 환경 GOAD를 상대로 벤치마크됐다. 22개 AD 특화 에이전트와 7개 다단계 공격 체인으로 케르베로스팅, NTLM 릴레이, AD CS 취약점 등 AD 킬체인 전반을 다루며, Claude Opus·GPT-6·Grok 4.6 등 9개 프론티어 LLM을 비교했다. 하니스는 96~100% 기법 커버리지와 90~97% 정밀도를 달성한 반면, 직접 호출 방식은 21~54%에 그치고 오탐이 3.2배 많았다. Opus 4.8은 가드레일 덕분에 134분 만에 3개 도메인을 완전 장악했다.
- •22개 AD 특화 에이전트와 7개 다단계 공격 체인으로 AD 킬체인 전 과정 자동화
- •Claude Opus 4.6~4.8, GPT-6 Astra 등 9개 프론티어 LLM을 하니스 내에서 비교
- •구조화된 하니스가 기법 커버리지 96~100%, 정밀도 90~97%로 직접 호출(21~54%)을 크게 앞섬
- •Opus 4.8은 134분 만에 3개 도메인 완전 장악, 가드레일이 위험한 행동 차단
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Autonomous Active Directory Exploitation via Multi-Model Harness Orchestration: A Benchmark Study with NeuroSploit on GOAD
- 1.오픈소스 Rust 기반 자율 침투테스트 하네스 'NeuroSploit v4.2.0'을 다중 포레스트 AD 취약랩 GOAD에서 벤치마크
- 2.22개 AD 전문 에이전트와 7개 공격체인 플레이북으로 커버로스로스팅부터 DCSync까지 AD 킬체인 전체를 다룸
- 3.Claude Opus 4.6~4.8, GPT-6 Astra, Grok 4.6 등 9개 최신 LLM을 하네스·직접호출 방식으로 비교
- 4.하네스는 기법 커버리지 96~100%, 정밀도 90~97%로 직접호출(21~54%, 오탐 3.2배)을 크게 앞섰다
왜 중요한가?
구조화된 가드레일 없는 단일 LLM 에이전트는 AD 침투테스트에서 커버리지가 낮고 오탐이 많았는데, 멀티에이전트 오케스트레이션과 결정론적 검증을 더하면 Opus 4.8 기준 134분에 3개 도메인을 완전 장악하는 실전 수준 자동화가 가능함을 보여줬다.
언급 프로젝트
대규모 언어 모델(LLM)이 엔터프라이즈 환경에서 핵심적인 Active Directory를 자율적으로 악용할 수 있음을 보여주는 이 연구는 한국 기업들의 사이버 보안 전략에 심각한 경고를 보냅니다. 내부 침투 테스트에서 가장 큰 영향을 미치는 AD 침해가 AI 기반으로 자동화될 수 있다는 점을 고려할 때, 기존의 보안 방어 체계를 넘어서는 새로운 위협 모델에 대한 이해와 대비가 시급합니다.
본문 미리보기
arXiv:2610.04243v1 Announce Type: new Abstract: Active Directory (AD) remains the predominant identity and access management infrastructure in enterprise environments, and its compromise represents the highest-impact outcome in internal penetration tests. Recent work has shown that large language models (LLMs) can autonomously conduct assumed-breach penetration testing against AD, but these studies employ standalone agents lacking structured guardrails, deterministic validation, and multi-stage
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

