공공 AI 학습데이터 908종, 중복·품질 허점 확인
핵심 요약
정부가 1조6328억원을 투입한 AI 학습용 데이터에서 중복과 활용 불가 사례가 확인됐다. 공공기관 간 사전 조정 부족으로 폐기물·치아·알약·구강·자율주행 자료가 겹쳤다. 감사원은 기존 자료 활용 검토와 기관별 구축 계획을 조정하는 사전 체계 마련을 통보했다.
정부가 2017년부터 지난해 11월까지 1조6328억원을 투입해 인공지능 학습용 데이터 908종을 구축했으나, 기존 자료와 유사하거나 실제 학습에 활용하기 어려운 데이터가 포함된 사실이 감사원 감사에서 확인됐다. 인공지능 대전환의 기반이 되는 공공 데이터의 구축·관리 단계에서 중복 투자와 품질관리 문제가 함께 드러났다.
서울시와 한국도로공사 등 26개 기관은 기관 간 계획을 미리 공유하거나 조정하지 않은 채 개별 사업을 진행했다. 대전시 서구가 지난해 1억3천만원을 들여 만든 생활폐기물 사진 9천장 중 57.8%인 5200장은 과학기술정보통신부가 2020년 16억원을 투입해 구축한 자료와 유사했다. 기존 데이터의 대체 활용 가능성을 충분히 살피지 않은 사례다.
과기정통부가 2021년부터 2023년까지 233억원을 투입한 알약·구강·자율주행 데이터 3종도 같은 기간 식품의약품안전처 등 3개 기관이 8억4천만원을 들여 생산한 자료와 비슷했다. 개인정보보호위원회가 3억800만원으로 구축한 치아 사진 1천장은 모두 과기정통부 데이터와 같았다. 공공기관별 구축 계획을 한데 모아 중복 여부를 점검할 사전 체계가 작동하지 않은 결과다.
품질관리에서도 결함이 확인됐다. 한국도로공사가 지난해 구축한 폐회로텔레비전 학습데이터셋에는 인공지능 학습에 필수적인 차량별 위치정보가 빠져 자율주행 기술 개발용 학습자료로 사용할 수 없었다. 데이터 구축 실적이 높은 20개 기관 가운데 4곳은 품질관리 기준조차 마련하지 않았다. 감사원은 기존 데이터의 활용 가능성을 먼저 검토하고 기관별 계획을 공유·조정하는 사전 검토 체계를 도입하도록 관련 방안 마련을 통보했다.