한국형 방송영상 117만건, AI 연구 자원으로 공개
핵심 요약
한국 문화와 정서를 반영한 방송영상 AI 학습 데이터 117만여 건이 개방됐다. 데이터는 10개 유형으로 구성되며 승인 절차를 거쳐 안심 구역에서 무료로 이용할 수 있다. 지식재산권과 초상권 등의 제약으로 활용이 어려웠던 고품질 영상의 연구 활용 기반이 마련됐다.
한국의 문화와 정서가 담긴 방송영상 인공지능 학습용 데이터 117만여 건이 교육·연구 목적으로 개방된다. 방송미디어통신위원회와 한국전파진흥협회는 5일 한국지능정보사회진흥원(NIA)이 운영하는 ‘인공지능 허브 안심 구역’에서 관련 데이터를 정식으로 제공하기 시작했다. 개발자뿐 아니라 일반 국민도 정해진 절차를 밟으면 무료로 활용할 수 있다.
공개 대상은 영상·이미지 이해 및 설명, 배경·인물·객체 생성, 제작 환경 고도화 등 세 분야에 걸쳐 구성됐다. 방송영상 이미지와 배경, 인물, 객체, 한글 서체, 자막을 포함한 10개 유형이 제공되며 전체 규모는 117만여 건이다. 구체적인 데이터 목록과 이용 방법은 인공지능 허브 안심 구역 누리집에서 확인할 수 있다.
방송영상은 고품질 AI 학습 자료로 수요가 컸지만 지식재산권과 초상권, 인접권 문제 때문에 활용에 제약이 있었다. 이번 공개는 제공된 자료를 보안 통제 환경 안에서 안전하게 쓰도록 설계됐다. 이용자는 사전에 안심 구역 사용을 신청하고 승인을 받아야 하며, 승인 이후 별도 비용 없이 영상 데이터를 이용해 다양한 AI 모델을 연구할 수 있다.
이번에 풀리는 자료에는 국내 방송 제작 과정에서 축적된 한국적 배경과 인물 표현, 한글 서체와 자막 등 문화적 요소가 반영돼 있다. 천지현 방송미디어진흥국장은 방송영상을 한국 문화와 정서, 제작 기술과 전문성이 집약된 AI 산업의 핵심 자산으로 평가했다. 위원회는 앞으로 여러 산업 분야에서 방송영상이 쓰일 수 있도록 고품질 학습 데이터를 계속 구축해 공개할 계획이다.