연구진이 심층강화학습(DRL) 기반 자율 사이버 방어 시스템의 견고성을 검증하기 위한 에이전틱 LLM 레드팀 프레임워크 Trident를 제안했다. 기존 DRL 방어는 정적인 휴리스틱 레드 에이전트에 대해서만 평가돼 적응형 위협에 대한 견고성이 제대로 검증되지 않았다는 문제의식에서 출발했다. Trident는 CybORG CAGE 4와 CyberWheel을 아우르는 동적 벤치마크, 1만3000건 이상의 고품질 레드-블루 상호작용 궤적 데이터셋, 그리고 로그 요약기-플래너-코더로 구성된 'Code-as-Policy' 방식의 RLVR 에이전트 아키텍처를 결합했다. 훈련 가능한 70억 파라미터 플래너 하나만으로도 Trident는 정적 레드 에이전트 기준선 대비 블루 에이전트의 방어 성능을 평균 522% 저하시켰고, 정적 휴리스틱이 전혀 찾아내지 못하는 디코이 회피, 적응적 상태 우선순위 지정 같은 창발적 행동을 자율적으로 발견했다. 기존 자율 사이버 방어 시스템이 생각보다 훨씬 취약할 수 있음을 실증적으로 보여준다.
- •DRL 기반 자율 사이버 방어의 견고성을 검증하는 에이전트상 LLM 레드팀 프레임워크 Trident를 제안했다
- •로그 요약기-플래너-코더 3단 구조의 'Code-as-Policy' RLVR 아키텍처를 사용했다
- •70억 파라미터 플래너 하나로 블루 에이전트 방어 성능을 평균 522% 저하시켰다
- •디코이 회피, 적응적 상태 우선순위 지정 등 정적 휴리스틱이 못 찾는 창발적 공격 행동을 발견했다
- •1만3000건 이상의 레드-블루 상호작용 데이터셋과 벤치마크를 함께 공개했다
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)
본문 미리보기
arXiv:2608.04317v1 Announce Type: new Abstract: Autonomous cyber defense systems based on Deep Reinforcement Learning (DRL) have attracted significant research attention, yet remain evaluated almost exclusively against static, heuristic red agents, leaving their robustness against adaptive threats critically understudied. Meanwhile, recent advances in Reinforcement Learning with Verifiable Rewards (RLVR) have improved LLM reasoning, but their integration into cybersecurity remains elusive due t
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:57AI 초안



