일레븐랩스 ‘더빙 v2’, 제품 연동 문턱 낮췄다
핵심 요약
일레븐랩스가 더빙 AI 모델 ‘더빙 v2’를 API 방식으로 공개했다. 음성 대 음성 구조로 감정 표현을 반영하고 영상에 맞춘 발화 타이밍을 지원한다. 한국어를 포함한 92개 언어를 바탕으로 국내외 콘텐츠 더빙에 활용할 수 있다.
영국 인공지능 음성 생성 스타트업 일레븐랩스가 10일 새로운 더빙 모델 ‘더빙 v2’를 응용프로그램인터페이스(API) 형태로 공개했다. 개발자와 기업은 별도의 이용자 화면을 거치지 않고 이 모델을 자사 제품과 업무 흐름에 직접 연결해 다국어 더빙 기능을 구현할 수 있게 됐다.
더빙 v2의 핵심은 입력 음성을 토대로 새로운 음성을 곧바로 만들어 내는 음성 대 음성 변환 구조다. 음성을 문자로 인식한 뒤 번역하고, 복제 음성으로 다시 합성하던 기존 절차와 구별된다. 중간 변환 단계를 거치지 않는 방식으로 원본 발화에 담긴 섬세한 감정 표현을 출력 음성에 충실히 반영하도록 설계됐다.
이 모델은 지난 5월 28일 이용자 인터페이스(UI) 버전으로 먼저 공개됐다. 이번에는 같은 더빙 기술의 제공 범위를 API로 넓혀 기업과 개발자가 기존 서비스 내부에 통합할 수 있도록 했다. 발화 시점이 영상 흐름과 자연스럽게 맞도록 구성됐으며, 한국어를 포함해 모두 92개 언어를 지원한다.
API 공개로 활용 방향은 해외 시장을 겨냥한 K콘텐츠의 다국어 더빙과 해외 주요 콘텐츠의 한국어 더빙으로 나뉜다. 콘텐츠 제작 과정이나 서비스에 모델을 직접 연결할 수 있어 두 방향의 현지화 작업에 적용할 수 있다. 감정 표현 보존과 영상에 맞춘 발화 타이밍, 폭넓은 언어 지원이 더빙 v2의 주요 기능으로 제시됐다.