TTP-R1은 사이버 위협 인텔리전스(CTI) 문서를 MITRE ATT&CK 공격 기법에 매핑하는 작업을, 검색증강 지도학습(SFT)과 검증 가능한 보상 기반 강화학습(RLVR)을 결합한 2단계 프레임워크로 자동화한다. 하이브리드 검색기가 수백 개에 달하는 방대한 라벨 공간을 후보 집합으로 좁히면 파인튜닝된 LLM이 정확한 기법을 선택하며, 예측된 기법 집합의 정밀도·재현율·출력 형식을 직접 감독하는 분해된 보상으로 Group Relative Policy Optimization을 적용한다. 4개의 CTI 벤치마크에서 최고 평균 F1을 달성했으며, 검색증강 Claude Sonnet 4.5 대비 세부기법(sub-technique) 수준 F1을 7.4%포인트 개선하면서도 단일 GPU에서 8B 파라미터 모델로 서빙 시 28배 더 빠르게 동작했다.
- •검색증강 SFT와 RLVR을 결합한 2단계 CTI-ATT&CK 매핑 프레임워크
- •정밀도·재현율·형식을 직접 감독하는 분해된 보상으로 강화학습 수행
- •Claude Sonnet 4.5 대비 세부기법 F1을 7.4%p 개선
- •8B 모델로 단일 GPU에서 28배 빠른 서빙 속도 달성
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Retrieval-Constrained Policy Optimization for Attack Technique Extraction from Cyber Threat Intelligence
본문 미리보기
arXiv:2608.06778v1 Announce Type: new Abstract: Mapping cyber threat intelligence (CTI) text to MITRE ATT&CK techniques is essential for structured threat analysis, yet manual annotation is costly and does not scale. The ATT&CK taxonomy comprises several hundred attack techniques, and a single CTI passage may describe multiple techniques, making accurate and complete extraction challenging. Existing automated approaches fall short in different ways: multi-label classifiers struggle with severe
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:58AI 초안



