아마존이 AI 모델 학습 데이터를 확보하기 위해 희귀 서적을 대량 구매한 뒤 제본을 뜯어 스캔하고 있다고 404미디어가 17일 보도했다. 추적장치를 부착한 희귀 서적을 추적한 결과 라스베이거스 시설 'VGT3'로 옮겨져 책등이 절단되고 페이지가 스캔되는 것으로 확인됐다. 아마존은 서적 구매가 상업적 경로를 통한 합법적 방식이라고 해명했지만 어떤 책을 얼마나 구매해 어떻게 활용하는지는 공개하지 않았다. 웹 공개 데이터가 한계에 이르고 AI 생성 콘텐츠 재학습으로 인한 '모델 붕괴' 우려가 커지면서, 2022년 이전 출간돼 생성 AI 콘텐츠 오염 가능성이 낮은 절판·희귀 서적이 새로운 핵심 데이터 공급원으로 부상하고 있다.
- •라스베이거스 시설 'VGT3'에서 희귀 서적 제본 해체 후 스캔 정황 확인
- •아마존은 상업적 경로의 합법 구매라 해명, 구체적 규모·활용 방식은 비공개
- •2022년 이전 출간 서적은 생성 AI 오염 가능성이 낮은 순수 인간 저작 데이터로 평가
- •AI 생성물 재학습에 따른 '모델 붕괴' 우려가 희귀 서적 확보 경쟁의 배경
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
아마존, AI 학습데이터 확보 위해 희귀 서적 수집하고 파괴
- 1.아마존, AI 학습데이터 확보 위해 희귀·절판 서적을 대량 구매 후 제본 해체·스캔 중인 정황 포착
- 2.404미디어, 추적장치로 서적 이동경로 확인 결과 라스베이거스 시설 'VGT3'로 운송됨을 확인
- 3.2022년 이전 출판물은 생성AI 학습 오염 없는 인간 작성 원천데이터로 가치 높아 데이터 확보 경쟁 심화
왜 중요한가?
인터넷 공개 고품질 텍스트 고갈과 '모델 붕괴' 우려 속에서 AI 기업들이 오프라인 인쇄물까지 데이터 공급원으로 삼는 흐름을 보여주며, 희귀본 훼손과 저작권·보존 문제라는 새로운 논쟁을 촉발한다.
언급 프로젝트
본문 미리보기
온라인 서점으로 출발한 아마존이 AI 모델 학습에 활용할 데이터를 확보하기 위해 희귀 서적을 대량으로 사들인 뒤 제본을 뜯고 스캔하고 있다는 정황이 포착됐다. 인터넷에 공개된 고품질 텍스트 데이터가 한계에 이르고 AI가 생성한 콘텐츠를 반복 학습하면 모델 성능이 저하될 수 있다는 우려가 커지면서, 온라인에서 구하기 어려운 절판·희귀 서적이 새로운 데이터 공급원으로 떠오르고 있다. 404미디어는 17일(현지시간) 추적 장치를 부착한 희귀 서적의 이동 경로를 추적한 결과, 아마존의 라스베이거스 시설인 ‘VGT3’로 운송된 사실을 확인했
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:02AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
