연구진이 코딩용 커스텀 LLM 플랫폼을 겨냥한 자동화 레드티밍 프레임워크 'ARIA'를 공개했다. 시스템 프롬프트에 지시문만 심어 커스텀 모델을 만드는 플랫폼은 편리하지만, 악의적 지시를 숨겨 넣는 '지시어 백도어 공격'에 취약한데, 기존 공격은 탐지되기 쉬운 명시적 트리거에 의존하고 수작업 제작 부담도 컸다. ARIA는 공격자 LLM이 은밀성·정상작업 성능·백도어 효과라는 세 기준에 대한 타깃 모델의 피드백을 받아 백도어 지시문을 반복적으로 생성·개선한다. 4종의 대표 LLM과 3개 코드 인텔리전스 과제에서 실험한 결과 공격 성공률 0.945로 기존 기법을 압도했고, 플랫폼·사용자 측 탐지 회피율(오탐지율)도 최대 1.000에 달해 기존 방어 기법마저 우회했다. ASE 2026 채택 논문으로, 코딩 특화 LLM 커스터마이징 생태계의 새로운 보안 위협을 드러낸다.
- •자동화 레드팀 프레임워크 ARIA로 은밀한 지시어 백도어 생성
- •4개 LLM·3개 코딩 과제에서 공격 성공률 0.945로 기존 기법 압도
- •플랫폼·사용자측 탐지 회피율(오탐지율) 최대 1.000
- •기존 방어 기법에도 여전히 효과적임을 입증
- •ASE 2026 국제학술대회 채택
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Breaking Customized LLMs for Coding: Automated Red Teaming for Instruction Backdoor Attacks
본문 미리보기
arXiv:2608.05659v1 Announce Type: new Abstract: LLM customization platforms allow users to build task-specific models for code intelligence tasks by embedding instructions into system prompts, without modifying the underlying model parameters. While these platforms lower the barrier to developing customized LLMs, they also introduce a new attack surface: instruction backdoor attacks, in which adversaries implant hidden malicious behaviors into customized instructions. However, existing attacks
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:58AI 초안



