공공 AI 학습데이터, 중복 구축·품질 부실 확인
핵심 요약
정부가 1조6328억원을 들여 구축한 AI 학습용 데이터에서 기관 간 중복 사례가 확인됐다. 구축 실적 상위 20개 기관 중 9곳은 제3자 품질 검증 없이 데이터를 공개했다. 감사원은 기존 데이터 활용 검토와 기관별 계획 조정, 통일된 품질관리 체계 마련을 요구했다.
정부가 2017년부터 2024년까지 1조6328억원을 투입해 인공지능 학습용 데이터 908종을 구축했지만, 공공기관 간 유사 자료가 중복 생산되고 품질관리도 미흡했던 것으로 확인됐다. 감사원이 12일 공개한 AI 산업 육성 실태 감사 결과에는 기존 데이터의 대체 활용 가능성을 살피지 않은 채 기관별 사업이 따로 추진된 사례가 담겼다.
과학기술정보통신부는 2020년 16억원을 들여 생활폐기물 128종을 학습하는 이미지 15만장을 구축했다. 서울시와 대전 서구도 각각 2020년과 2025년 같은 목적의 데이터를 별도로 만들었다. 특히 대전 서구가 1억3000만원을 투입한 이미지 9000장 가운데 57.8%는 과기정통부 공개 자료와 유사했다. 구강 데이터도 과기정통부가 2023년 17억5300만원으로 14만5140장을 확보한 뒤 개인정보보호위원회가 3억800만원을 들여 1000장을 구축했으나, 이 자료 전체가 과기정통부 데이터와 비슷한 것으로 확인됐다.
품질관리에서도 허점이 드러났다. 데이터 구축 실적 상위 20개 공공기관 가운데 9곳은 제3자 검증을 거치지 않고 자료를 공개했다. 식품의약품안전처 등 2곳은 품질관리 기준이 없다는 이유로 자체 점검과 외부 검증을 모두 하지 않았다. 한국도로공사가 지난해 구축한 도로주행 CCTV 이미지 2680장은 위치 좌표가 빠져 AI 학습에 사용할 수 없었고, 서울시가 2020년 마련한 대형폐기물 이미지 2303장 중 23.4%는 텍스트 파일과 이름이 일치하지 않아 활용하기 어려웠다.
감사원은 과기정통부에 공공기관이 AI 학습용 데이터 사업을 시작하기 전 기존 자료로 대체할 수 있는지를 검토하도록 통보했다. 기관별 구축 계획을 사전에 공유하고 조정하는 절차도 마련하도록 했다. 통일된 품질관리 기준이 없으면 구조·형식 오류와 규격 위반, 라벨 불일치를 충분히 걸러내기 어렵고, 기관별 품질 편차와 낮은 데이터 품질이 AI 학습 정확도를 떨어뜨릴 수 있다고 판단했다.