AI 텍스트 탐지 스타트업 팽그램(Pangram)의 브래들리 에미 CTO는 대형언어모델(LLM)이 이론적으로는 인간만큼 다양한 문체로 글을 쓸 수 있지만, 사후학습(post-training)과 안전 가드레일이 표현 범위를 크게 좁혀 탐지 가능하게 만든다고 주장했다. 위험한 출력을 막거나 특정 정치적 발언을 검열하기 위한 행동 규칙 학습이 특정 문구에 확률이 몰리는 '모드 붕괴(mode collapse)' 현상을 일으켜, 다양한 인간 글쓰기와 달리 일관된 패턴을 남긴다는 설명이다. 반면 사후학습을 거치지 않은 베이스 모델이나 헤밍웨이 문체 등에 특화된 파인튜닝 모델, 특정 서브레딧 텍스트로만 학습된 모델은 팽그램의 탐지에 걸리지 않았다. 다만 워터마크가 적용된 AI 텍스트는 베이스 모델의 문체 다양성과 무관하게 대체로 탐지가 가능하다고 덧붙였다.
- •팽그램 CTO, 사후학습·안전 가드레일이 LLM 표현 범위를 좁혀 탐지 가능하게 만든다고 주장
- •특정 문구에 확률이 몰리는 '모드 붕괴' 현상이 문체 다양성 감소의 핵심 원인
- •사후학습 이전 베이스 모델·특정 문체 특화 파인튜닝 모델은 탐지 회피 가능
- •워터마크 적용 AI 텍스트는 문체 다양성과 무관하게 대체로 탐지 가능
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
LLMs could write like humans but post-training guardrails make their text detectable

- 1.Pangram CTO Bradley Emi, 안전 가드레일과 사후학습이 LLM 텍스트를 '모드 붕괴'시켜 탐지 가능하게 만든다고 주장
- 2.가드레일 없는 베이스 모델이나 헤밍웨이·특정 서브레딧으로 파인튜닝한 특화 모델은 표현이 다양해 AI 탐지를 피해감
- 3.다만 워터마크가 적용된 텍스트는 표현 다양성과 무관하게 항상 탐지 가능하다고 설명
왜 중요한가?
AI 텍스트 탐지 기술의 정확도가 실제로는 모델의 안전 정책 설계에 좌우된다는 점을 보여주며, AI 콘텐츠 탐지 도구의 신뢰성과 한계를 재평가하게 만든다.
본문 미리보기
LLMs don't write in a recognizable style because they can't do better. Post-training and safety guardrails sharply narrow their expressive range, argues Pangram CTO Bradley Emi. Base models without these constraints already write with far more variety. The article LLMs could write like humans but post-training guardrails make their text detectable appeared first on The Decoder.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:33AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
