세바스티안 라슈카(Sebastian Raschka)가 소형 언어모델(SLM)의 능력을 보여주는 교육용 프로젝트로 AI 텍스트 탐지기를 처음부터 구축하는 과정을 공개했다. Substack의 AI 탐지 기능 출시에서 착안해, Pangram과 유사한 방식으로 DistilBERT 분류기를 파인튜닝하여 텍스트가 AI 생성일 확률(0~100점)을 반환하는 모델을 만든다. 이 탐지기를 검증기(verifier)로 활용해 강화학습(RLVR)으로 소형 언어모델이 탐지를 회피하는 글쓰기를 학습하도록 훈련시키는 것이 특징이다. 저자는 AI 탐지가 근본적으로 '고양이와 쥐' 게임이며 오탐(사람 글을 AI로 오판)이 발생할 수 있다고 지적한다.
- •세바스티안 라슈카, Substack AI 탐지 기능에서 착안한 교육용 프로젝트 공개
- •DistilBERT 파인튜닝으로 0~100점 AI 생성 확률 점수 산출 분류기 구축
- •탐지기를 검증기로 삼아 RLVR로 탐지 회피 텍스트 생성을 학습시킴
- •로컬 배포용 API와 브라우저 UI까지 엔드투엔드로 구현
- •AI 탐지는 '고양이와 쥐' 게임이며 오탐 가능성이 있다고 지적
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Building an AI Text Detector From Scratch

- 1.세바스챌 라슈카, DistilBERT를 파인튜닝해 AI 생성 텍스트 탐지기를 직접 구축하는 엔드투엔드 튜토리얼 공개
- 2.탐지기를 검증자로 사용해 RLVR 방식으로 탐지를 회피하는 텍스트를 생성하도록 소형 언어모델을 학습시키는 방법도 다뢸
- 3.결과물은 전체 텍스트 AI 점수와 구간별 점수를 함께 보여주는 로컬 배포용 API와 UI로 구현
왜 중요한가?
서브스택이 UI에 AI 탐지 기능을 도입한 것을 계기로, 탐지기의 작동 원리와 한계를 직접 구현으로 실증해 개발자에게 실습 가치가 있는 사례를 제시한다.
언급 프로젝트
본문 미리보기
An End-to-End Project With Dataset Construction, Model Training, Local Deployment, and RLVR
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:16AI 초안

