중국이 반도체 수출 규제에는 자체 개발과 우회 조달로 대응하고 있지만, 고품질 중국어 학습 데이터 부족이라는 새로운 병목에 직면했다고 사우스차이나모닝포스트가 보도했다. 전 세계 웹 콘텐츠에서 중국어 비중은 약 1.3%에 불과해 영어(약 50%)는 물론 스페인어(약 6%), 일본어(약 5%)에도 크게 못 미친다. 위챗·더우인 등 중국 대형 플랫폼의 폐쇄적 데이터 운영도 문제를 심화시키며, 중국 AI 기업의 데이터 학습 비용은 서구권보다 훨씬 높은 것으로 알려졌다. 중국 정부는 2028년까지 제조·에너지·의료 등 주요 산업을 아우르는 국가 단위 검증 데이터셋 구축 계획을 내놓았다.
- •전 세계 웹 콘텐츠 중 중국어 비중 약 1.3%(영어 약 50%, 스페인어 약 6%, 일본어 약 5%)
- •위챗·더우인 등 중국 플랫폼의 폐쇄적 데이터 운영이 데이터 부족 심화 요인
- •중국 AI 기업 데이터 학습 비용, 서구권 기업보다 훨씬 높음
- •중국 국가데이터관리국, 2028년 목표 국가 단위 검증 AI 학습 데이터셋 구축 계획 발표
- •화샤출판사 등 AI 학습용 콘텐츠 사용 금지 경고, 저작권 갈등 본격화
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
중국 AI 산업의 새로운 복병...반도체 넘어 '중국어 학습 데이터 기근' 심화
본문 미리보기
중국이 미국의 반도체 수출 규제에 대응하며 AI 경쟁력을 끌어올리고 있지만, 이번에는 고품질 중국어 학습 데이터 부족이라는 새로운 병목에 직면하고 있다.8일 사우스차이나모닝포스트(SCMP)는 중국의 AI 산업 성장이 데이터 장벽에 부딪힐 수 있다고 지적했다. 첨단 반도체는 자체 개발이나 우회 조달로 대응할 수 있지만, AI 모델 성능을 좌우하는 양질의 언어 데이터는 단기간에 확보하기 어렵다는 이유에서다.인터넷 통계 분석 업체 W3테크(W3Techs)에 따르면, 전 세계 웹 콘텐츠에서 중국어가 차지하는 비중은 약 1.3%에 불과하다.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:57AI 초안
