AI 학습데이터 1조6328억원 투입에도 중복·오류
핵심 요약
정부가 1조6328억원을 들여 구축한 AI 학습용 데이터에서 공공기관 간 중복과 품질 관리 부실이 확인됐다. 생활폐기물·구강 이미지가 중복 구축됐고 일부 도로주행·대형폐기물 자료는 누락과 파일명 불일치로 활용이 어려웠다. 감사원은 기존 데이터 활용 여부와 기관별 구축 계획을 사전에 검토·조정하는 체계 도입을 요구했다.
정부가 2017년부터 2024년까지 1조6328억원을 투입해 인공지능 학습용 데이터 908종을 구축했지만, 공공기관 간 중복과 품질 관리 부실이 광범위하게 확인됐다. 감사원은 12일 AI 산업 육성 실태 감사 결과를 공개했다. 데이터의 구조·규격·라벨 오류가 제대로 걸러지지 않으면 AI 모델의 학습 정확도를 떨어뜨릴 수 있다는 우려도 제기됐다.
과학기술정보통신부는 2020년 16억원을 들여 생활폐기물 128종의 이미지 15만장을 만들었으나 서울시와 대전 서구도 각각 2020년과 2025년 같은 목적의 데이터를 별도로 구축했다. 대전 서구가 1억3000만원을 투입한 9000장 가운데 57.8%는 과기부 공개 이미지와 유사했다. 2023년 과기부가 17억5300만원으로 구축한 구강 이미지 14만5140장과 개인정보보호위원회가 3억800만원을 들여 만든 1000장도 유사성이 확인됐으며, 개보위 데이터는 전부 과기부 자료와 비슷했다.
이번 감사는 지난해 9월부터 12월까지 과기부와 개보위, 한국지능정보사회진흥원 등을 대상으로 진행됐다. 학습용 데이터 구축 실적이 많은 상위 20개 기관 중 9곳은 제3자 품질검증을 거치지 않고 자료를 공개했다. 식품의약품안전처를 포함한 2개 기관은 품질관리 기준이 없다는 이유로 자체 점검과 외부 검증을 모두 실시하지 않은 것으로 드러났다.
실제 활용을 어렵게 만드는 오류도 발견됐다. 한국도로공사가 지난해 만든 도로주행 폐쇄회로(CC)TV 이미지 2680장은 위치 좌표가 빠져 AI 모델의 학습에 사용할 수 없었다. 서울시가 2020년 구축한 대형폐기물 이미지 2303장 가운데 23.4%는 텍스트 파일과 이름이 달랐지만 공개되고 있었다. 감사원은 과기부가 행정안전부와 협의해 기존 데이터의 대체 활용 가능성을 사업 전에 검토하고, 기관별 구축 계획을 미리 공유·조정하는 체계를 도입하도록 통보했다.