AI 학습데이터 1조6328억원 투입에도 중복·오류
핵심 요약
정부가 9년간 1조6328억여 원을 투입한 AI 학습용 데이터에서 중복과 품질 문제가 확인됐다. 기관 간 계획 공유가 이뤄지지 않아 유사한 데이터가 별도로 구축됐다. 일부 데이터는 위치정보 누락과 잘못된 파일명 때문에 AI 학습에 활용하기 어려운 상태였다.
정부가 2017년부터 9년간 1조6328억여 원을 투입한 인공지능 학습용 데이터 사업에서 중복 구축과 품질 관리 부실이 확인됐다. 감사원이 12일 공개한 감사 결과에는 과학기술정보통신부의 국가AI개발지원 플랫폼 ‘AI허브’ 데이터 908종과 국가·공공기관 및 지방자치단체 26곳이 별도로 만든 데이터 313종에 대한 분석 내용이 담겼다.
기관별 중복 사례도 구체적으로 드러났다. 한국도로공사가 2022년 로드킬 예방 목적으로 만든 야생동물 12종 이미지 6만 장 가운데 42%인 2만5000장은 과기부가 2021년 생산한 자료와 유사했다. 대전 서구가 지난해 구축한 생활폐기물 이미지 9000장 중에서도 58%인 5200장이 과기부가 5년 전에 만든 데이터와 흡사한 것으로 조사됐다.
기관들이 데이터 구축 계획을 공유하지 않으면서 같은 시기에 유사한 사업을 진행한 경우도 있었다. 과기부는 2021년부터 2023년까지 알약·구강·자율주행 관련 데이터 3종을 만드는 데 233억 원을 사용했다. 같은 기간 식품의약품안전처를 포함한 3개 기관도 비슷한 데이터를 구축하는 데 8억4000만 원을 투입했다.
일부 기관에는 품질 기준과 검증 절차도 마련되지 않았다. 한국도로공사가 지난해 만든 도로주행 CCTV 학습데이터셋은 차량별 위치 좌표가 어노테이션 정보에서 빠져 AI가 학습 대상을 차량으로 인식할 수 없었고, 자율주행 기술 개발 용도로 사용할 수 없는 상태였다. 서울시가 2020년 구축한 대형폐기물 데이터는 박스나 탁자 이미지가 ‘가방’으로 표시되는 등 2303장 중 23.4%인 538장에서 파일명과 실제 이미지가 일치하지 않았다.