공공 AI 학습데이터, 기관 간 중복·품질 부실 확인
핵심 요약
공공 AI 학습용 데이터에서 기관 간 중복 투자와 사후관리 부실이 확인됐다. 일부 기관은 제3자 검증이나 자체 점검 없이 데이터를 납품받았다. 차량 위치 정보 누락과 파일명·이미지 불일치 등 구체적인 품질 오류도 드러났다.
정부와 공공기관이 산업 지원을 위해 만든 인공지능 학습용 데이터에서 중복 구축과 품질 저하, 미흡한 사후관리 문제가 확인됐다. 감사원이 12일 공개한 ‘인공지능산업 육성 실태’ 감사 결과를 보면 과학기술정보통신부는 2017년부터 지난해 11월까지 1조6328억원을 투입해 908종을 구축하고 AI 허브에 공개했다. 식품의약품안전처와 서울시, 한국도로공사 등 26개 기관도 별도 포털 등을 통해 313종을 제공하고 있다.
기관끼리 구축 현황을 충분히 공유하지 않은 탓에 유사한 데이터에 예산이 거듭 투입됐다. 야생동물·생활폐기물·콘크리트 균열·계란 이미지 4종에는 과기부가 73억여원을 사용했지만 이후 서울시와 도로공사 등 5개 기관이 비슷한 자료를 만드는 데 6억여원을 추가로 들였다. 알약·구강·자율주행 데이터 3종도 과기부가 2021∼2023년 233억원을 투입한 시기에 식약처 등 3개 기관이 유사 사업에 8억원을 사용했다.
공공부문이 AI 기업에 즉시 활용할 수 있는 자료를 공급한다는 사업 취지와 달리 품질을 일관되게 관리할 기준도 부족했다. 구축 실적 상위 20개 기관 중 9곳은 제3자 검증 없이 납품을 허용했고, 식약처와 동서발전은 외부 검증뿐 아니라 수행기관의 자체 점검도 요구하지 않았다. 과기부 위탁사업을 맡은 지능정보사회원은 일부 납품업체가 폐업했다는 이유로 AI 허브 이용자들이 제기한 오류 민원을 제대로 처리하지 않았다.
실제 데이터에서도 AI 학습에 필요한 정보의 누락과 파일 오류가 드러났다. 도로공사가 지난해 만든 ‘도로주행 CCTV 학습데이터 셋’은 데이터 라벨링에 해당하는 어노테이션 정보에서 차량별 위치가 빠졌다. 서울시가 2020년 구축한 ‘대형폐기물 학습데이터’는 전체 2303장 가운데 538장의 파일명과 실제 이미지가 일치하지 않아 학습 과정에서 오류가 발생할 우려가 지적됐다. 기업 현장에서 활용할 만한 자료가 부족하다는 문제가 이어지는 만큼 공공 AI 데이터의 양과 질을 함께 개선할 필요성이 커졌다.