GPU 넘어 원본 데이터가 AI 경쟁력 가른다
핵심 요약
AI 경쟁의 무게중심이 GPU 규모에서 학습 데이터의 양과 품질로 이동하고 있다. AI 생성 자료의 반복 학습은 오류와 편향을 키우고 모델 붕괴를 일으킬 수 있다. 한국은 제조·의료·연구 데이터를 체계적으로 축적하고 활용할 기반을 마련해야 한다.
인공지능 경쟁의 핵심이 연산 장비의 규모에서 학습 데이터의 양과 품질로 확장되고 있다. 세계 인구 여덟 명 중 한 명이 매일 AI를 사용할 만큼 활용이 보편화됐지만, 성능을 높이려면 고가의 컴퓨터 장비와 전력·냉각 비용뿐 아니라 방대한 텍스트, 사진, 동영상, 프로그램 코드가 필요하다. 특히 충분한 원본 데이터를 지속적으로 확보하기 어렵다는 점이 AI 고도화의 주요 제약으로 떠올랐다.
데이터 부족을 메우려고 AI가 만든 자료를 다시 학습에 투입하는 ‘데이터 근친교배’도 확산하고 있다. 이 과정이 반복되면 기존 오류와 편향이 증폭되고 표현이 획일화될 수 있다. 일본 이화학연구소 연구진은 생성 이미지의 학습 비중이 커질수록 결과물의 품질이 저하되는 현상을 확인했다. 옥스퍼드대 연구진도 AI 생성 데이터로 거듭 학습한 모델에서 성능과 다양성이 무너지는 ‘모델 붕괴’ 가능성을 제시했다.
AI 기업들은 사람과 전문기관이 생산·검증한 자료를 확보하는 방향으로 대응하고 있다. 언론·출판·온라인 커뮤니티·연구기관과 데이터 이용 계약을 맺는 한편, 전문가 검증 자료와 과학 실험 데이터, 의료·제조·금융 현장의 산업 데이터에 대한 투자를 확대하고 있다. AI 등장 이전의 종이책과 오래된 문헌을 디지털 자료로 전환하는 작업도 늘면서 희소한 원본 데이터의 전략적 가치가 한층 커지고 있다.
뛰어난 GPU 기반 슈퍼컴퓨터와 거대 모델을 갖춰도 학습 자료가 부족하거나 품질이 낮으면 높은 성능을 기대하기 어렵다. 반대로 우수한 연구·산업·공공 데이터를 축적하고 공유하면 같은 모델에서도 더 큰 가치를 끌어낼 수 있다. 연구개발 역량과 제조 현장, 의료 시스템을 갖춘 한국은 여기서 생성되는 데이터를 전략 자산으로 관리할 필요가 있다. 체계적인 수집과 품질 관리, 연구자·산업계의 활용 기반 마련이 AI 모델 개발과 함께 경쟁력을 좌우할 과제로 부상했다.