공공 AI 학습데이터, 중복 투자·검증 공백 드러나
핵심 요약
공공부문 AI 학습용 데이터에서 품질 저하와 관리 부실이 확인됐다. 상위 20개 구축 기관 중 9곳은 제3자 검증 없이 납품을 허용했다. 유사 데이터 중복 투자와 필수 정보 누락, 오류 민원 방치도 드러났다.
공공기관이 기업의 인공지능 활용을 돕기 위해 구축한 학습용 데이터에서 낮은 품질과 허술한 관리 문제가 확인됐다. 2025년 11월 기준 과학기술정보통신부는 908종을 AI 허브에, 식품의약품안전처·서울시·한국도로공사 등 26개 기관은 313종을 개별 포털에 공개했다. 그러나 기관별로 적용되는 공통 품질관리 기준이 마련되지 않아 학습에 필요한 정보가 빠진 데이터까지 구축됐다.
검증 절차의 공백은 실제 오류로 이어질 가능성을 키웠다. 구축 실적 상위 20개 기관 중 9개 기관은 제3자의 품질검증을 거치지 않은 납품을 허용했고, 식약처와 한국동서발전은 외부 검증뿐 아니라 사업 수행기관의 자체 점검도 요구하지 않았다. 한국도로공사가 2025년 만든 도로주행 CCTV 학습데이터에는 차량별 위치를 나타내는 어노테이션 정보가 누락됐다. 서울시의 2020년 대형폐기물 데이터도 전체 2천303장 가운데 538장의 파일명과 이미지가 일치하지 않았다.
기존 구축 현황을 충분히 살피지 않은 채 기관별 사업이 추진되면서 유사 데이터에 예산이 거듭 투입된 사례도 드러났다. 과기정통부가 73억여 원을 들여 만든 야생동물·생활폐기물·콘크리트 균열·계란 이미지 데이터 4종과 비슷한 자료를 서울시와 한국도로공사 등 5개 기관이 다시 구축했다. 알약·구강·자율주행 관련 데이터 3종에는 2021년부터 2023년까지 233억 원이 투입됐지만, 같은 시기에 식약처 등 3개 기관도 유사한 데이터를 별도로 만들었다.
사후관리 체계에서도 허점이 확인됐다. 과기정통부의 위탁을 받아 데이터 구축과 사후관리를 맡은 지능정보사회원은 납품 업체가 폐업했다는 이유로 데이터 오류 민원을 처리하지 않은 채 남겨뒀다. 공공부문의 데이터 확대가 AI 기업 지원을 목적으로 추진됐지만, 중복 구축과 필수 정보 누락, 검증 없는 납품, 오류 민원 방치가 함께 확인되면서 데이터의 양적 확충과 품질 개선을 동시에 추진해야 할 과제가 뚜렷해졌다.