Malformer는 텍스트·이미지·그래프·오디오 4가지 모달리티를 트랜스포머로 융합한 윈도우 악성코드 탐지 모델이다. 두 개의 RoBERTa 인코더와 변형 Vision Transformer, WavLM, 적응형 손실 가중치 기법을 결합해 201,549개 바이너리 샘플로 평가했다. 정확도 98.3%, F1 0.9833을 달성해 단일·이중 모달리티 탐지기보다 4.6~17.6%p 높은 성능을 보였다. 갈수록 정교해지는 악성코드 위협에 대응할 다중모달 융합 기반을 제시한다.
- •텍스트·이미지·그래프·오디오 4중 모달리티를 트랜스포머로 융합한 최초 시도
- •201,549개 바이너리 샘플 평가에서 정확도 98.3%, F1 0.9833 달성
- •단일·이중 모달리티 대비 4.6~17.6%p 성능 우위
- •적응형 손실 가중치로 모달리티별 표현을 효과적으로 결합
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Malformer: A Multi-Modal Malware Detector Using Transformers
- 1.텍스트·이미지·그래프·오디오 4중 모달리티 결합한 악성코드 탐지모델 Malformer 제안
- 2.RoBERTa 2개, 수정된 ViT, WavLM을 적응형 손실가중치로 융합
- 3.201,549개 바이너리 샘플서 정확도 98.3%, F1 0.9833 달성
- 4.단일·이중 모달 탐지기 대비 4.6~17.6%p 성능 우위
왜 중요한가?
단일 표현 방식에 의존하는 기존 탐지기가 디스어셈블리 실패 등으로 새로운 실패 모드를 갖는 한계를, 다중 모달리티 융합으로 보완해 탐지 견고성을 크게 높였다.
본문 미리보기
arXiv:2608.19052v1 Announce Type: new Abstract: Traditional malware detection systems that rely on a single representation of malware often fail to identify novel threats. These representations of malware binaries, also known as modalities, do not provide the models with sufficient information to discriminate among all samples. Additionally, individual representations introduce new failure modes, with some modality extraction being dependent upon the success of disassembling. Past works have in
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
