연구진은 스크립트 기반 악성코드에서 위협 인텔리전스로 활용 가능한 침해 지표(IOC)를 LLM이 얼마나 잘 추출하는지 측정하는 벤치마크 SCRIPTIOC-BENCH를 공개했다. 자바스크립트, 파워셸, VBScript로 작성된 실제 악성코드 634개 샘플을 수작업 검증했으며, URL·도메인·IP주소·파일시스템 흔적 4가지 IOC 유형을 다루고 직접 노출된 지표와 디코딩·재구성이 필요한 지표를 구분해 정답을 계층화했다. 다양한 상용·오픈웨이트 LLM을 평가한 결과 실행 없이 IOC를 복원하는 것은 모델 규모와 무관하게 여전히 어려워, 가장 우수한 모델도 F1 65.4에 그쳤다. 소규모 오픈웨이트 모델에 결정론적 문자열 유틸리티와 과제 특화 적응을 적용해 상호 보완적인 성능 향상과 정밀도 개선을 확인했다.
- •악성 스크립트에서 IOC 추출 능력을 측정하는 벤치마크 SCRIPTIOC-BENCH 공개
- •자바스크립트·파워셔·VBScript 실제 악성코드 634개 샘플 수작업 검증
- •최고 성능 모델도 F1 65.4에 그쳐 실행 없는 IOC 복원은 여전히 난제
- •오탐 유형 분류 체계로 모델별 오류 패턴 비교
- •결정론적 문자열 유틸리티·과제 특화 적응으로 소규모 모델 성능 보완 가능성 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
SCRIPTIOC-BENCH: A Benchmark for Recognizing Actionable Threat Intelligence from Script-Based Malware using LLMs
- 1.실제 악성 스크립트에서 위협 지표(IOC)를 정적 추출하는 LLM 능력을 측정하는 벤치마크 SCRIPTIOC-BENCH 공개
- 2.JavaScript·PowerShell·VBScript 634개 수동검증 악성코드 샘플, URL·도메인·IP·파일시스템 흑적 4종 IOC 포함
- 3.최고 성능 모델도 실행 없는 IOC 복구에서 F1 65.4에 그쳐 모델 규모와 무관하게 여전히 어려운 과제임을 확인
- 4.결정적 문자열 유틸리티와 과제 특화 적응 두 완화기법을 소형 오픈모델에 적용해 상호보완적 정밀도 개선 확인
왜 중요한가?
악성 스크립트 분석 자동화에서 LLM 기반 위협 인텔리전스 추출의 현재 한계(F1 65.4)를 정량화한 결과로, SOC·위협 헌팅 도구에 LLM을 도입할 때 기대치를 현실적으로 조정하는 데 도움이 된다.
언급 프로젝트
본문 미리보기
arXiv:2609.06149v1 Announce Type: new Abstract: Script-based malware remains a prevalent attack technique. These scripts often contain indicators of compromise (IOCs) that provide actionable threat intelligence. However, statically recovering such indicators is challenging, as relevant values may be dispersed or transformed within code. Although large language models (LLMs) have shown promise in security analysis, their ability to recover IOCs from malicious scripts remains underexplored. We
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

![[10월8일] “수학 문제 4000개에 AI 투입해 성과”…오픈AI가 보여준 과학연구의 변화](https://cdn.aitimes.com/news/photo/202610/216072_220045_048.png)

