공공 AI 데이터에 1.6조원…중복·품질 허점
핵심 요약
공공 AI 학습용 데이터에서 중복 구축과 품질 저하, 사후관리 미흡 사례가 확인됐다. 과기부는 2017년부터 1조6328억원을 들여 908종을 구축했고, 26개 기관은 별도로 313종을 공개했다. 기관 간 구축 현황 공유가 부족해 이미지와 알약·구강·자율주행 분야에서 유사 데이터가 반복 제작됐다.
정부와 공공기관이 구축한 일부 인공지능 학습용 데이터에서 기관 간 중복과 품질 저하, 사후관리 미흡 사례가 확인됐다. 감사원은 12일 공개한 ‘인공지능산업 육성 실태’ 감사 결과에서 공공부문의 데이터 구축 사업이 기관별로 분산되면서 관리 체계에 허점이 나타났다고 밝혔다.
지난해 11월 기준 과학기술정보통신부는 2017년부터 1조6328억원을 투입해 AI 학습용 데이터 908종을 구축하고 AI 허브에 공개했다. 식품의약품안전처와 서울시, 한국도로공사 등 26개 기관도 과기부 사업과 별도로 313종을 만들어 각 기관의 포털 등에 공개한 것으로 파악됐다.
공공 데이터 구축 사업은 AI 기업이 곧바로 활용할 수 있는 자료를 공급해 산업 성장을 지원하려는 취지로 추진됐다. 그러나 기관들이 서로의 구축 현황을 충분히 공유하지 않은 상태에서 사업을 진행해 유사한 자료가 반복 제작됐다. 야생동물과 생활폐기물, 콘크리트 균열, 계란 이미지 데이터가 대표적인 사례다.
과기부는 이들 이미지 데이터 4종을 만드는 데 73억여원을 투입했지만, 이후 서울시와 한국도로공사 등 5개 기관이 유사 데이터 구축에 다시 6억여원을 썼다. 알약·구강·자율주행 관련 3종에도 2021년부터 2023년까지 과기부 예산 233억원이 들어갔으며, 같은 해 식약처 등 3개 기관은 비슷한 데이터를 별도로 만드는 데 8억원을 투입했다. 감사에서는 중복 구축뿐 아니라 데이터 품질과 구축 이후 관리 문제도 함께 드러났다.