입력 트리거 없이 특정 작업에서만 편향된 출력을 내도록 명령어 미세조정 모델을 조작하는 '작업 수준 중독' 공격을 탐지하는 2단계 블랙박스 감사 기법 Localize-and-Detect가 제안됐다. 1단계에서는 기반 모델과 미세조정 모델의 다음 토큰 분포 차이가 가장 큰 작업을 찾아 공격 대상을 특정하고, 2단계에서는 미세조정 모델에서만 반복적으로 나타나는 편향된 콘텐츠를 탐색한다. 두 모델군에 걸친 216개 중독 모델 실험에서 다양한 중독 방식과 예산 조건에서도 효과적으로 대상 작업과 편향 콘텐츠를 탐지했다. 정상 모델에 대한 오탐도 적은 것으로 나타났다.
- •입력 트리거 없는 '작업 수준 중독' 공격을 탐지하는 2단계 블랙박스 감사 기법 제안
- •1단계: 기반·미세조정 모델 간 다음 토큰 분포 차이로 공격 대상 작업 특정
- •2단계: 미세조정 모델에서만 반복되는 편향 콘텐츠 탐색
- •두 모델군 216개 중독 모델 실험에서 탐지 성능이 공격 성공률과 비례, 오탐 적음
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Localize-and-Detect: Auditing Task-Level Poisoning in Instruction-Tuned Models
- 1.입력 트리거 없이 특정 과제에서만 편향 콘텐츠를 유발하는 '과제수준 포이즈닝'을 탐지하는 'Localize-and-Detect' 제안
- 2.베이스·파인튜닝 모델의 출력만으로 작동하는 2단계 블랙박스 감사 방법, 트리거를 찾을 필요가 없음
- 3.1단계에서 다음토큰 분포 차이가 가장 큰 과제를 표적과제로 특정, 2단계에서 반복 등장하는 편향 콘텐츠를 탐색
- 4.두 모델군·216개 포이즈닝 모델에서 표적과제 탐색과 편향탐지 모두 효과적, 정상모델 오탐도 적음
왜 중요한가?
과제수준 포이즈닝은 명시적 트리거가 없어 탐지가 어렵고 표적과제·편향내용도 알 수 없는데, 모델 출력만으로 이를 역추적하는 실용적 감사 방법을 제시해 인스트럭션 튜닝 공급망의 신뢰성 점검에 쓸 수 있다.
본문 미리보기
arXiv:2610.03960v1 Announce Type: new Abstract: Instruction fine-tuning adapts a pretrained language model to follow instructions by training it on instruction--response pairs from a collection of tasks, such as summarization and question answering. Task-level poisoning exploits this task structure to manipulate the fine-tuned model into producing attacker-specified biased content on a particular target task, without requiring an explicit input trigger. Detecting such attacks is challenging bec
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

