정부, 독자 AI 학습데이터에 87억원 투입
핵심 요약
정부가 독자 AI 모델용 공동활용 학습데이터 확보에 총 87억원을 투입한다. 문항·전문도서와 함께 자격증 및 STEM 강의영상 4350시간 이상을 마련한다. 이용 권한을 확보한 전문데이터로 추론과 멀티모달 학습 역량을 강화한다.
과학기술정보통신부가 독자 인공지능 파운데이션 모델의 경쟁력을 높이기 위해 총 87억원을 들여 공동활용 학습데이터를 확보한다. 지난 3월 시작한 1차 사업과 최근 사전규격을 공개한 2차 사업에 각각 43억5000만원을 배정했다. 전문·특화 데이터를 정예팀이 함께 활용할 수 있는 체계를 구축하는 것이 사업의 핵심이다.
1차 사업에서는 자격증 문항에 13억5000만원, 심화추론 문항에 10억원을 투입한다. 과학·기술·공학·수학 분야 전문도서와 기타 전문도서 확보에도 각각 10억원을 배정했다. 2차 사업은 자격증 강의 2200시간 이상과 STEM 강의 2150시간 이상을 포함해 총 4350시간 이상의 강의영상 데이터를 확보하는 방식으로 추진된다.
데이터 범위는 문항과 전문도서에서 영상·음성·텍스트가 결합된 강의 콘텐츠로 확대된다. 범용 웹데이터만으로 충분히 확보하기 어려운 자격·STEM·법률·의료 등 전문영역의 지식과 문제 해결 과정을 모델에 제공하고, 복잡한 질문에 대응하는 추론 능력과 멀티모달 학습 역량을 함께 강화하려는 구성이다.
데이터 공급기관에는 저작권과 초상권을 비롯해 AI 학습에 필요한 이용 권한을 사전에 확보하는 조건이 부과된다. 인터넷에 공개된 자료를 단순히 수집하는 방식에서 벗어나 적법하게 학습에 사용할 수 있는 전문데이터를 마련하기 위한 조치다. 정부는 공동활용 기반을 통해 개별 기업의 데이터 확보 부담을 낮추고 독자 AI 모델의 전문성과 신뢰성을 높일 계획이다.