ReCAST는 난독화된 중국어 스팸 문자(SMS)를 견고하게 분류하기 위한 '복원 인지 단계적 학습' 프레임워크다. 공격자들은 위험 문구를 사람은 읽을 수 있으면서도 저비용 분류기는 피하도록 정교하게 난독화하는데, 이는 실제 운영 환경의 지연·처리량 제약에서 직접 분류를 취약하게 만든다. ReCAST는 대형 교사 모델의 탈난독화 능력을 배포 가능한 소형 학생 모델로 증류하되, 난독화 구간 탐지·난독화 유형 예측·텍스트 복원을 지도학습으로 감독한 뒤 이 복원 인지 학생 모델을 최종 위험 분류에 활용한다. 실제 중국어 SMS 벤치마크 실험에서 ReCAST는 난독화 상황에서 직접 학습한 베이스라인 대비 분류 성능을 크게 개선했으며, 복원 인지 증류가 생산 환경 제약 하에서도 소형 모델로 견고한 SMS 위험 분류를 달성하는 실용적 경로임을 시사한다.
- •난독화된 중국어 스팜 문자 분류를 위한 복원 인지 단계적 학습 프레임워크 ReCAST 제안
- •대형 교사 모델의 탈난독화 능력을 난독화 구간 탐지·유형 예측·복원 감독으로 소형 학생 모델에 증류
- •복원 인지 학생 모델을 최종 위험 분류에 활용해 생산 환경 제약을 충족
- •실제 중국어 SMS 벤치마크에서 직접 학습 베이스라인 대비 분류 성능 크게 개선
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
ReCAST: Restoration-aware Cascaded Stage-wise Training for Obfuscated SMS Risk Classification
- 1.난독화된 중국어 스팬 문자 탐지를 위한 복원 인지 단계별 증류 학습 프레임워크 ReCAST 제안
- 2.대형 교사모델의 난독화 해제 능력을 소형 배포용 학생모델로 증류, 탐지·유형예측·복원을 함께 학습
- 3.실제 중국어 SMS 벤치마크에서 직접 학습 베이스라인 대비 난독화 상황 분류 성능 대폭 개선
왜 중요한가?
실서비스는 지연·처리량 제약으로 소형 모델을 써야 하는데, 대형 모델의 탐지 능력을 소형 모델에 효과적으로 이전해 비용 제약 속에서도 우회형 스팸·사기 문자 탐지 성능을 유지할 수 있음을 보여준다.
언급 프로젝트
점점 더 정교해지는 스미싱 등 사기성 SMS 메시지들이 분류 시스템을 회피하기 위해 교묘하게 난독화되고 있습니다. 이 연구는 난독화된 SMS의 위험을 효과적으로 분류하는 AI 훈련 방식을 제시하여 사이버 범죄 대응 능력을 향상시킵니다. 스미싱 피해가 사회적 문제로 대두되는 한국에서는 이러한 AI 기반 탐지 기술의 발전이 이동통신사 및 금융기관의 소비자 보호 노력에 크게 기여하고, 국민들의 디지털 금융 안전을 확보하는 데 필수적일 것입니다.
본문 미리보기
arXiv:2609.04878v1 Announce Type: new Abstract: Fraudulent messages sent via Short Message Service (SMS) are increasingly obfuscated to evade cost-conscious classifiers in production systems. In Chinese SMS, attackers can exploit a wide range of carefully crafted obfuscation strategies to hide risk-bearing phrases while preserving human readability, making direct classification brittle under real-world latency and throughput constraints. We propose ReCAST, a Restoration-aware Cascaded Stage-wis
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
