AI 학습데이터 사업, 중복 투자와 품질 허점 드러나
핵심 요약
1조6328억 원이 투입된 AI 학습용 데이터 사업에서 수십억 원대 중복 구축이 확인됐다. 차량 위치 좌표 누락과 이미지 오분류 등 학습 활용을 어렵게 하는 품질 문제가 드러났다. 감사원은 관계 기관에 사업 방식과 사후 관리 체계를 개선하도록 통보했다.
정부가 2017년부터 1조6328억 원을 들여 추진한 AI 학습용 데이터 구축 사업에서 중복 투자와 품질 저하, 사후 관리 부실이 함께 확인됐다. 과학기술정보통신부 주도로 구축된 데이터는 908종이며, 26개 지방자치단체와 공공기관이 별도로 만든 313종과 사전에 정보를 공유하는 체계가 제대로 마련되지 않아 수십억 원 규모의 유사 데이터가 중복 생산됐다.
중복 비율은 일부 사업에서 절반을 넘었다. 한국도로공사의 야생동물 데이터 가운데 42%가 과기정통부의 기존 자료와 유사했고, 서울시와 대전 서구의 생활폐기물 데이터는 각각 63%와 58%가 겹쳤다. 품질 검사에서는 도로주행 CCTV 학습데이터의 차량 위치 좌표가 빠졌고, 서울시 대형폐기물 데이터는 박스나 탁자 이미지를 가방으로 잘못 분류한 비율이 23.4%에 달했다.
사업 종료 이후 오류를 바로잡는 절차도 원활하게 작동하지 않았다. 한국지능정보사회진흥원이 공개한 데이터의 29.5%를 납품한 65개 업체가 폐업한 상태였으며, 산불 방재 데이터베이스를 포함한 11종에서 오류 민원이 제기됐지만 일부는 종결되거나 처리되지 않은 채 남았다. 납품 업체가 사라진 뒤 데이터의 정확성을 유지하고 민원에 대응할 별도 관리 장치가 충분하지 않았던 것이다.
감사원은 과학기술정보통신부와 행정안전부, 한국지능정보사회진흥원에 사업 방식 개선과 사후 관리 방안 마련을 통보했다. 기관별 구축 계획을 미리 확인해 중복 투자를 막고, 공개 전 품질 검증과 공개 후 오류 수정 체계를 보완하는 일이 후속 과제로 제시됐다. 막대한 예산으로 확보한 데이터가 실제 AI 학습에 쓰이려면 구축 물량뿐 아니라 정확성과 유지 관리까지 점검하는 제도 개선이 필요한 상황이다.