중국 AI 경쟁, 고품질 자국어 데이터가 새 병목
핵심 요약
중국 AI 기업들이 웹상 중국어 콘텐츠 부족과 공개 학습 데이터 고갈 위험에 직면했다. 중국 정부는 2028년까지 주요 산업의 검증된 데이터셋 생태계를 구축할 계획이다. 오프라인 자료의 디지털화와 합성 데이터 활용이 대안으로 떠올랐지만 저작권 문제가 과제로 남았다.
중국 인공지능 기업들이 차세대 대규모언어모델 개발에 필요한 고품질 중국어 데이터 부족에 직면했다. 이달 전 세계 웹 콘텐츠에서 중국어 비중은 1.3%에 그쳤다. 영어는 절반에 가까웠고 스페인어와 독일어는 각각 6%, 일본어는 5%였다. 자국어 온라인 콘텐츠 풀이 작은 중국은 공개 데이터 고갈의 충격을 더 크게 받을 수 있다는 우려가 나온다.
공개적으로 이용할 수 있는 고품질 인간 생성 텍스트는 향후 6년 안에 사실상 소진될 수 있다는 전망이 제기됐다. 2030년 전후 신뢰할 만한 신규 데이터 공급이 부족해지면 모델 성능 개선이 정체되는 ‘데이터 벽’에 이를 수 있다는 경고도 나왔다. 미국 앤트로픽은 ‘프로젝트 파나마’에 수천만 달러를 들여 실물 도서 수백만 권을 확보하고, 제본을 제거한 책의 모든 페이지를 스캔해 학습 자료로 디지털화했다.
중국 국가데이터국은 지난 6월 AI 학습 데이터의 공급과 유통, 상용화를 확대하는 전국 단위 계획을 내놨다. 2028년까지 제조·에너지·의료·금융·농업과 피지컬 AI, 자율주행, 저고도 항공 분야에서 쓸 수 있는 검증된 데이터셋 생태계를 구축한다는 목표다. 학계에서는 디지털 도서뿐 아니라 역사 기록물, 지방지, 고문서, 과학 문헌을 체계적으로 전산화하고 사전과 음성·영상, 지역 방언까지 중국어 코퍼스에 포함해야 한다는 요구가 커지고 있다.
합성 데이터와 시뮬레이션도 대안으로 거론된다. 알리리서치는 2024년 백서에서 알고리즘·컴퓨팅 파워·데이터를 AI 개발의 3대 축으로 꼽고 잡지와 프로그래밍 코드 등으로 데이터원을 넓힐 수 있다고 제안했다. 다만 출판물 활용이 늘면서 저작권 문제도 불거지고 있다. 화샤출판사의 고대 도교 경전 번역본에는 AI 학습 이용을 금지하고 위반 시 법적 책임을 묻는다는 문구가 실렸다. 웹 밖의 지식과 산업 데이터를 확보하려면 디지털화, 품질 검증, 저작권 처리 체계를 함께 마련해야 한다.