공공 AI 데이터 품질·중복 투자 관리 허점
핵심 요약
정부와 공공기관의 AI 학습용 데이터에서 품질 미달과 중복 구축 문제가 확인됐다. 별도 구축된 313종 중 92.3%는 과기정통부 품질 기준을 적용하지 않았다. 감사원은 계획 조정과 통합 품질 기준, 공개 데이터 사후관리 체계 마련을 요구했다.
정부와 공공기관이 인공지능 학습용으로 구축해 공개한 데이터에서 학습에 사용할 수 없거나 오히려 오류를 유발할 수 있는 품질 문제가 확인됐다. 정부는 2017년부터 2024년까지 1조6328억원을 투입해 품질 기준을 충족한 데이터 908종을 만들고 과학기술정보통신부와 한국지능정보사회진흥원이 운영하는 AI 허브에 공개했다.
이와 별도로 중소벤처기업부와 서울시, 한국도로공사 등 최소 26개 기관이 자체 웹사이트 등에 313종을 공개했지만, 정부는 전체 현황과 투입 예산을 파악하지 못해 지난 4월 전수조사에 착수했다. 이 가운데 289종인 92.3%는 과기정통부 기준으로 구축되지 않았다. 283종은 기관 자체 기준이나 공공데이터 기준을 적용했고 6종은 품질 기준조차 없었으며, 9개 기관은 납품 데이터도 검증하지 않았다.
표본으로 검사한 경기도와 한국도로공사의 데이터 6종은 모두 과기정통부 품질 기준에 미달했다. 도로공사의 교통 감시카메라 이미지에는 차량 위치 표시가 없어 학습에 쓸 수 없었다. 서울시의 대형 폐기물 이미지에는 종이 상자나 탁자를 ‘가방’으로 표기한 사례가 발견돼 학습 시 오류 가능성이 확인됐다. 기관 간 계획 공유가 없어 알약·구강·자율주행 3종과 야생동물·생활폐기물·콘크리트 균열·달걀 4종에서도 중복 구축이 발생했다.
과기정통부가 앞선 3종에 233억원, 뒤의 4종에 73억8000만원을 투입한 뒤에도 다른 기관들이 각각 8억4000만원과 6억1000만원을 들여 유사 데이터를 만들었다. AI 허브 데이터 908종 중 213종은 납품업체가 폐업했고, 오류 민원이 여러 건 제기된 11종은 실제 확인 없이 종결됐다. 감사원은 구축 계획의 사전 공유·조정 체계, 모든 공공 학습 데이터에 적용할 품질 기준, 공개 이후 사후관리 방안을 마련하라고 과기정통부에 통보했다.