AI 학습데이터 1조6328억원 투입에도 중복·오류
핵심 요약
AI허브와 공공기관이 구축한 AI 학습용 데이터 1221종에서 중복과 품질 부실이 확인됐다. 야생동물·생활폐기물 데이터가 기존 자료와 겹쳤고 유사 사업이 같은 기간 별도로 추진됐다. 차량 위치정보 누락과 이미지 파일명 오류로 활용할 수 없거나 정확성이 떨어지는 자료도 발견됐다.
정부와 공공기관이 9년간 1조6000억원이 넘는 예산을 들여 구축한 인공지능 학습용 데이터에서 중복과 품질 문제가 확인됐다. 감사원은 과학기술정보통신부가 2017년부터 1조6328억여원을 투입해 국가 AI 개발지원 플랫폼 ‘AI허브’에 공개한 908종과 국가·공공기관 및 지방자치단체 26곳이 별도로 만든 313종 등 모두 1221종을 분석한 감사 결과를 12일 공개했다.
기관별 중복 구축 사례도 드러났다. 한국도로공사가 2022년 로드킬 예방을 목적으로 만든 야생동물 12종 데이터 6만장 가운데 42%인 2만5000장은 과기정통부가 2021년 생산한 자료와 유사했다. 대전 서구가 지난해 구축한 생활폐기물 데이터 9000장 중에서도 58%인 5200장이 과기정통부가 5년 전에 만든 데이터와 흡사한 것으로 분석됐다. 각 기관은 이런 데이터를 만드는 데 각각 수억원을 사용했다.
데이터 구축 계획을 기관끼리 공유하지 않아 같은 시기에 비슷한 자료를 제작한 사례도 있었다. 과기정통부는 2021년부터 2023년까지 알약과 구강, 자율주행 관련 데이터 3종을 만드는 데 233억원을 투입했다. 같은 기간 식품의약품안전처를 포함한 3개 기관도 유사한 데이터를 구축하면서 8억4000만원을 썼다. 기존 자료와 다른 기관의 사업 계획을 사전에 확인하지 않은 채 개별 사업이 진행된 것이다.
품질관리 기준과 검증 절차가 없는 일부 사업에서는 활용하기 어려운 결과물도 나왔다. 한국도로공사가 지난해 만든 도로주행 폐쇄회로(CC)TV 학습데이터셋은 차량별 위치 좌표가 어노테이션 정보에서 빠져 AI가 학습 대상을 차량으로 인식할 수 없었고, 자율주행 기술 개발에도 사용할 수 없는 것으로 확인됐다. 서울시가 2020년 구축한 대형폐기물 데이터는 박스나 탁자 이미지를 ‘가방’ 파일명으로 분류하는 등 전체 2303장 가운데 23.4%인 538장의 파일명과 실제 이미지가 일치하지 않았다.