이 연구는 보안운영센터(SOC)가 대량의 경보를 선별해야 하지만 추론 전략이 무엇을 수집하고 언제 조사를 충분하다고 볼지를 어떻게 결정하는지가 불명확하다는 문제에서, 단일 패스 도구 사용부터 반복 검색, 샘플링 조사, 자기 검토, 명시적 검증까지 다섯 가지 대표적 접근을 연구했다. 실제 엔터프라이즈 텔레메트리를 라이브 SIEM으로 재현하는 상호작용형 벤치마크 ALERT-BENCH를 구축했으며, 다단계 공격 시나리오의 1,247개 경보에서 모든 접근이 공격 관련 경보의 최소 40.4%를 놓쳤다. 추적 분석에서는 검색 결과가 없을 때 공격 경보가 더 쉽게 기각되고, 동일 맥락 재검토는 오히려 순 교정 효과가 음수였다. 이에 저자들은 제안된 결정을 독립적 반박에 앞서 명시적으로 요구하고 기각 전 더 엄격한 증거 요건을 두는 멀티에이전트 프레임워크 AIDA를 제안해, 동일 경보에서 F1 0.958(기존 0.371~0.744)을 달성하고 거짓음성률을 40.4%에서 3.1%로 낮추면서 경보의 18.4%를 분석가에게 에스컬레이션했다.
- •실제 엔탰프래즇 눘마트리를 쟁현하늘 사이똀 벤치마크 ALERT-BENCH 구축
- •뎘 쮔 똘하 추뇨 전릏이 고삸 공개 관랐 경릋의 40.4% 이상을 라감
- •검사 교옐·돌이 없느 뫌정구 관랐 경릋 감각을 뫍주이는 패텸 확인
- •AIDA가 F1 0.958, 거짐음성륨 3.1%로 기존 컵광뿡다 크게 앞섬
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
From Investigation Failures to Reliable SOC Agents: Understanding and Improving LLM-Based Alert Triage
- 1.SOC 알림 트리아지용 5가지 LLM 에이전트 전략을 비교하는 실시간 SIEM 벤치마크 ALERT-BENCH 구축
- 2.1,247개 알림 평가 결과 모든 전략이 공격 관련 알림의 40.4% 이상을 놓침
- 3.판단 후 독립적 반박과 엄격한 기각 기준을 요구하는 멀티에이전트 프레임워크 AIDA 제안
- 4.AIDA는 F1 0.958(기존 0.371~0.744) 달성, 거짓음성률 40.4%→3.1%로 감소
왜 중요한가?
LLM 에이전트가 SOC 알림을 조사할 때 기존 추론 전략 전부가 공격을 놓치는 공통 약점을 가진다는 점을 실증하고, 증거 기반 반박·판정 구조를 통해 이를 크게 개선할 수 있음을 보여 보안운영 자동화의 신뢰성을 높인다.
본문 미리보기
arXiv:2610.10608v1 Announce Type: new Abstract: Security operations centers (SOCs) must triage large volumes of alerts, most of which are benign, while missed attacks can remain uninvestigated. Tool-using large language model (LLM) agents can retrieve evidence during triage, but it remains unclear how reasoning strategies determine what to gather and when an investigation is sufficient to close an alert. We study five representative approaches spanning single-pass tool use, iterative retrieval,
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안



![[Tech Insight] "AI 해킹, 보안 문제로만 보는 건 위험한 착각"](https://cdn.digitaltoday.co.kr/news/photo/202610/706229_653947_485.jpg)