강화학습(RL)으로 훈련된 자율 사이버 방어 에이전트는 학습한 특정 네트워크에 묶여 있어 네트워크 규모가 바뀌면 일반화가 어렵다는 한계가 있다. 이 논문은 동결된(frozen) 제로샷 대형언어모델(LLM)이 재훈련 없이 계층적 사이버 방어를 제어할 수 있는지, LLM 제어 범위를 계획에서 실행까지 확장할 때 성능이 어떻게 달라지는지를 조사한다. 연구팀은 플래너가 서브넷을 선택하고 실행자가 방어 행동을 선택하는 계층구조를 설계해, MITRE ATT&CK 기반 레드팀을 내장한 Cyberwheel 환경에서 3B~70B 파라미터의 6개 모델로 RL+RL, LLM+RL, LLM+LLM 조합을 소·중·대형 네트워크에서 비교했다. 플래너만 LLM으로 바꾸면 이득이 제한적이었지만, 충분히 성능이 좋은 모델의 경우 실행까지 LLM 제어를 확장하면 뚜렷한 개선이 나타났다. 동결된 범용 70B 모델은 재훈련 없이 세 네트워크 규모 모두에서 공격자의 측면 이동을 약 1% 수준으로 억제했다.
- •RL 기반 사이버 방어 에이전트는 학습한 네트워크에 묶여 있어 피처급 기온류 없었다.
- •플린넬설 실퀀자 구조에서 더 강한 더에이전트될 수 있는지 Cyberwheel 환거에서 3B~70B 모델 6종으로 실현.
- •플린넬만 LLM로 고사하거려맘 제한적이지만, 실퀀까지 확장하매른 띨졷한 개선 보임.
- •더에이전트될 검 70B 모델은 세 네트워크 기금 거리각에서 각 이넄9 약 1%로 억제.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Towards Hierarchical Cyber Defense with Large Language Models: From Planning to Execution
- 1.고정된(frozen) 70B급 LLM이 재학습 없이도 공격자의 측면이동 성공률을 약 1%로 억제, RL 기준선과 대등한 방어 성능 달성
- 2.플래너만 LLM으로 교체 시 효과 제한적, 실행(executor) 단계까지 LLM을 확장해야 뚜렷한 성능 향상 확인
- 3.Cyberwheel 환경과 MITRE ATT&CK 기반 레드팀 에이전트로 3B~70B급 6개 모델, 소·중·대 규모 네트워크에서 검증
왜 중요한가?
RL 기반 사이버 방어는 네트워크 규모가 바뀔 때마다 재학습이 필요했는데, 충분히 강력한 LLM은 모델 가중치 변경 없이 여러 네트워크 규모에 걸쳐 방어 성능을 유지할 수 있음을 보여 운영 비용 절감 가능성을 제시한다.
언급 프로젝트
거대 언어 모델(LLM)을 활용한 계층적 사이버 방어 시스템은 기존 방어 시스템의 제한적인 일반화 문제를 해결합니다. 복잡한 사이버 위협에 직면한 한국에서, 이러한 기술은 국가 주요 인프라와 기업의 방어 능력을 크게 향상시키며 다양한 네트워크 환경에 유연하게 적용될 수 있어 주목됩니다.
본문 미리보기
arXiv:2610.00590v1 Announce Type: new Abstract: An autonomous cyber defender trained with reinforcement learning (RL) is typically tied to the network on which it was trained, limiting its ability to generalize as network scale changes. Hierarchical RL reduces decision complexity by separating strategic targeting from tactical execution, but it does not eliminate this retraining dependence. We investigate whether frozen, zero-shot large language models (LLMs) can provide retraining-free control
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

