공공 AI 학습데이터 중복 구축·검증 공백 드러나
핵심 요약
공공부문 AI 학습용 데이터에서 유사 자료의 중복 구축과 품질관리 공백이 확인됐다. 일부 데이터는 필수 위치 정보가 빠지거나 파일명과 이미지가 일치하지 않았고 오류 민원도 방치됐다. 공공 AI 데이터의 활용도를 높이려면 구축 단계의 조정과 검증 체계를 함께 개선해야 한다.
공공부문이 기업의 인공지능 활용을 지원하려고 구축한 일부 학습용 데이터에서 중복 투자와 품질관리 부실이 확인됐다. 감사원이 12일 공개한 ‘인공지능산업 육성 실태’ 감사 결과에는 AI 학습에 필요한 정보가 빠지거나 파일 내용이 잘못 연결된 사례, 오류 민원이 처리되지 않은 문제 등이 담겼다. 공공데이터 활용을 강조해 온 한성숙 국무총리 취임 이후 개선 작업이 속도를 낼지도 관심사로 떠올랐다.
지난해 11월 현재 과학기술정보통신부는 학습용 데이터 908종을 구축해 AI 허브에 공개하고 있으며, 식품의약품안전처·서울시·한국도로공사 등 26개 기관도 313종을 개별 포털에서 제공하고 있다. 그러나 기존 자료를 충분히 확인하지 않은 채 사업을 따로 추진해 유사 데이터가 거듭 만들어졌다. 과기부가 야생동물·생활폐기물·콘크리트 균열·계란 이미지 4종에 73억여 원을 투입한 뒤 서울시와 도로공사 등 5개 기관이 비슷한 자료를 다시 구축했다.
알약·구강·자율주행 관련 데이터 3종에는 과기부가 2021년부터 2023년까지 233억 원을 들였지만, 같은 기간 식약처 등 3개 기관도 유사한 데이터를 별도로 만들었다. 기관 전체에 적용되는 공통 품질관리 기준도 마련되지 않았다. 구축 실적 상위 20개 기관 중 9개 기관은 제3자 검증 없이 납품을 허용했고, 식약처와 동서발전은 외부 검증뿐 아니라 사업 수행기관의 자체 점검도 요구하지 않았다.
도로공사가 지난해 만든 ‘도로주행 CCTV 학습데이터 세트’는 차량별 위치를 나타내는 어노테이션 정보가 누락됐다. 서울시가 2020년 구축한 ‘대형폐기물 학습데이터’에서는 전체 2천303장 가운데 538장의 파일명과 이미지가 일치하지 않아 오류 가능성이 확인됐다. 과기부의 위탁을 받아 구축과 사후관리를 담당하는 지능정보사회원은 납품 업체가 폐업했다는 이유로 데이터 오류 민원을 방치했다. 공공기관의 AI 기업 지원 노력에도 현장에서 활용할 수 있는 데이터가 부족하다는 지적이 이어져 데이터의 양과 질을 함께 개선하는 일이 시급한 과제로 제시됐다.