이 논문은 대형 언어모델용 안전 가드레일을 상용 하드웨어에 배포하기 위한 라이선스 인지형 지식증류 레시피를 제시한다. 24개 공개 데이터셋에서 추출한 약 9만7000개 프롬프트를 강력한 오픈 가드 모델로 7개 안전 카테고리에 라벨링하고, 어휘·얕은·인코더·생성형 등 다양한 소형 학생 모델을 학습시켰다. 6361개 행으로 구성된 독립 골드 벤치마크로 평가한 결과, 가장 작은 생성형 학생 모델은 오탐률 3.8%로 80억 파라미터 교사 모델의 4.8%보다 오히려 낮았고, 인코더 모델은 CPU에서 요청당 약 24밀리초 만에 분류를 완료했다. 클래스별 재조정(rebalancing)이 성능 개선의 핵심 요인으로 확인됐으며, 다만 정제 데이터에서는 여전히 원본 교사 모델이 근소하게 앞선다.
- •9만7000개 프롬프트를 7개 안전 카테고리로 라벨링해 소형 가드 모델 증류 학습
- •최소 생성형 학생 모델 오탐률 3.8%, 80억 파라미터 교사(4.8%)보다 낮음
- •인코더 모델은 CPU에서 요청당 약 24ms로 분류 가능
- •클래스별 재조정이 성능 개선의 핵심 요인으로 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
A Reproducible, License-Aware Distillation Recipe for CPUDeployable Safety Classification
- 1.24개 공개 데이터셋서 프롬프트 9.7만개 수집, 7개 안전 카테고리로 라벨링해 소형 가드모델 증류
- 2.80억 파라미터 교사모델 대비 소형 생성형 학생모델 오탐률 3.8%로 개선(교사 4.8%)
- 3.인코더 기반 학생모델은 CPU에서 요청당 약 24ms로 분류, 상용 하드웨어 배포 가능성 제시
- 4.클래스별 재균형이 성능 개선의 핵심 요소, 6361건 독립 벤치마크로 검증
왜 중요한가?
1~9억 파라미터급 GPU 지향 가드 모델의 한계를 소형·CPU 배포용 모델로 낮추면서도 성능 저하 없이 오탐을 줄여, 상용 하드웨어에서 저비용으로 LLM 안전계층을 운영할 수 있는 실증 사례를 제공한다.
본문 미리보기
arXiv:2608.21570v1 Announce Type: new Abstract: Deploying a safety layer for large language models on commodity hardware is constrained by the guards available to do it: current open guard models hold between 1 and 9 billion parameters, are oriented toward the graphics processing unit, and answer in seconds per request on a central processing unit. This paper presents a reproducible, license-aware knowledge-distillation recipe addressing that constraint. A strong open guard labels a corpus of r
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
