AI 학습데이터 1조6328억 투입에도 중복·오류
핵심 요약
정부가 1조6328억원을 투입한 AI 학습데이터 사업에서 기관 간 유사 자료의 중복 구축이 확인됐다. 주요 기관의 품질 기준과 외부 검증이 미흡했고 일부 데이터에는 필수 정보 누락과 이미지 오류가 있었다. 감사원은 구축 계획의 사전 공유·조정과 공통 품질관리 기준 마련을 요구했다.
정부가 1조6000억원이 넘는 예산을 투입한 인공지능 학습용 데이터 사업에서 기관별 중복 구축과 품질관리 부실이 확인됐다. 과학기술정보통신부는 2017년부터 1조6328억원을 들여 만든 데이터 908종을 AI 허브에 공개했다. 식품의약품안전처와 서울시, 한국도로공사 등 26개 기관도 별도로 313종을 구축해 개별 포털 등에 제공하고 있다.
기관들이 구축 계획을 충분히 공유하지 않아 비슷한 데이터에 예산이 거듭 투입됐다. 과기정통부가 야생동물·생활폐기물·콘크리트 균열·계란 데이터에 73억8000만원을 썼고, 서울시와 도로공사 등 5개 기관도 유사한 자료를 만드는 데 6억1000만원을 투입했다. 과기정통부가 2021년부터 2023년까지 233억원을 들인 알약·구강·자율주행 데이터와 비슷한 자료도 같은 기간 식약처 등 3개 기관에서 구축됐다. 2023년 개인정보보호위원회가 구강 진료 등을 위해 만든 이미지 1000장은 전부 같은 해 과기정통부 데이터와 유사했다.
품질을 검증하고 오류를 바로잡는 체계에도 허점이 드러났다. 구축 실적 상위 20개 기관 중 식약처 등 4곳은 별도 품질관리 기준 없이 사업을 진행했고, 9곳은 납품 전에 제3자 검증을 받지 않았다. 도로공사가 2025년 구축한 도로주행 CCTV 학습데이터셋에는 AI 학습에 필수적인 차량별 위치정보가 빠졌다. 서울시의 2020년 대형폐기물 데이터는 이미지 2303장 가운데 538장, 23.4%에서 파일명과 실제 이미지가 일치하지 않았다.
공개 이후의 사후관리도 제대로 작동하지 않은 사례가 확인됐다. AI 허브 데이터 오류를 지적하는 민원이 접수됐지만 사후관리 업무를 맡은 지능정보사회원은 구축 업체가 폐업했다는 이유로 자료를 수정하지 않고 민원을 종결했다. 감사원은 12일 공개한 인공지능산업 육성실태Ⅲ 감사 결과를 토대로 과기정통부에 행정안전부와 협의해 기관별 구축 계획을 사전에 공유·조정하고, 여러 기관에 적용할 공통 품질관리 기준을 마련하도록 통보했다.