공공 AI 데이터 908종, 중복·품질 부실 드러나
핵심 요약
1조6328억 원이 투입된 공공 AI 학습용 데이터 908종에서 유사·중복 구축이 확인됐다. 차량 위치 좌표 누락과 잘못된 사물 분류 등으로 일부 데이터는 활용이 어렵거나 품질이 떨어졌다. 감사원은 과기정통부와 NIA에 사업 방식과 사후 관리 체계를 개선하도록 통보했다.
정부가 2017년부터 2025년까지 1조6328억 원을 투입해 구축한 공공 인공지능 학습용 데이터 사업에서 중복 투자와 품질 부실이 확인됐다. 과학기술정보통신부와 한국지능정보사회진흥원 등이 908종을 만들었지만, 다른 기관이 구축한 313종과 사업 정보를 미리 공유하는 체계가 없어 수십억 원 규모의 유사 데이터가 별도로 생산됐다.
한국도로공사의 야생동물 데이터 가운데 42%는 과기정통부 데이터와 유사했고, 서울시와 대전 서구가 만든 생활폐기물 데이터의 중복 비율도 각각 63%와 58%에 달했다. 도로공사의 도로주행 CCTV 학습데이터셋에는 차량 위치 좌표가 빠져 자율주행 학습에 쓸 수 없었으며, 서울시 대형폐기물 데이터는 박스를 가방으로 잘못 분류한 비율이 23.4%로 나타났다.
활용성과 사후 관리 문제도 이어졌다. 2020년부터 2년간 구축한 360종 가운데 122종은 품질 저하로 활용도가 떨어진다는 지적을 받았다. 2023년에는 개방 데이터 384종 중 64종의 활용 건수가 10건 미만으로 집계됐고, 의료·헬스케어 분야가 다수 포함됐다. NIA는 같은 해 전문가 약 150명이 참여하는 자문단을 통해 초거대 AI 지원 데이터 구축 전략 마련에 착수했다.
NIA 공개 데이터의 29.5%를 납품한 65개 업체가 폐업한 가운데 산불 방재 DB 등의 오류 민원은 업체 폐업을 이유로 종결돼 수정되지 않았다. 2024년 감사에서는 2조5000억 원 규모 사업의 관리 부실과 한 업체의 데이터 수집비 등 13억9000만 원 횡령도 적발됐다. 감사원은 2026년 8월 12일 과기정통부와 NIA 등에 중복 방지와 품질 검증, 구축 이후 오류 대응을 포함한 사업 방식 및 사후 관리 개선 방안을 마련하도록 통보했다.