아마존이 희귀 도서를 대량 매입한 뒤 제본을 뜯어내고 스캔해 AI 학습 데이터로 활용하고 있다고 매체 404미디어가 보도했다. 404미디어는 희귀 도서에 위치추적 장치를 넣어 라스베이거스의 아마존 물류센터(VGT3)로 배송되는 과정을 추적해 이를 확인했다. 아마존은 "고객이 이용하는 제품과 서비스를 개선하기 위해 상업적 경로를 통해 도서를 구매한다"고 밝혔다. 인터넷 텍스트를 대부분 학습한 대형언어모델 기업들에게, 절판되거나 온라인에서 찾을 수 없는 희귀 도서는 2022년 이전에 쓰여 AI 생성 텍스트가 섞이지 않았다는 점에서 특히 가치가 크며, AI 생성 텍스트를 과도하게 학습하면 품질이 저하되는 '모델 붕괴' 위험을 피할 수 있는 귀중한 데이터원이다.
- •아마존은 희귀 도서를 매입해 제본을 뜿고 스캔한 뒤 AI 학습에 활용하고 있다.
- •404미디어는 희귀 도서에 위치추적기를 넣어 라스베이거스 아마존 물류센터(VGT3) 도착을 확인했다.
- •2022년 이전 출간된 희귀 도서는 AI 생성 텍스트가 섮이지 않아 학습 데이터로서 가치가 높다.
- •AI 생성 텍스트를 과도하게 학습하면 출력 품질이 저하되는 '모델 붕괴' 위험이 있다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Amazon, which started off selling books, is destroying rare texts to train AI
- 1.아마존이 희귀 서적을 대량 구매해 해체·스캔 후 AI 학습에 활용, 404미디어가 추적 확인
- 2.아마존은 '제품·서비스 개선 위한 상업적 구매'라고 해명
- 3.2022년 이전 텍스트는 AI 오염이 없어 모델 붕괴를 피할 고품질 데이터로 각광
왜 중요한가?
인터넷 텍스트를 소진한 LLM 기업들이 희귀 도서까지 학습 데이터로 확보하려 하며, 문화유산 보존과 AI 데이터 확보 경쟁이 충돌하고 있다.
언급 프로젝트
본문 미리보기
Rare books are incredibly valuable for training LLMs, since these models have already trained on whatever's available online.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:47AI 초안

