일레븐랩스, 감정 보존 AI 더빙 API 공개
핵심 요약
일레븐랩스가 원본 화자의 감정과 연기를 반영하는 AI 모델 ‘더빙 v2’를 API로 공개했다. 오디오를 음성으로 직접 변환하며 한국어와 일본어를 포함한 92개 언어를 지원한다. 콘텐츠 현지화와 다국어 마케팅에 활용할 수 있지만 립싱크와 실시간 더빙은 제외됐다.
일레븐랩스가 원본 화자의 감정과 연기 특성을 다른 언어의 음성에 반영하는 인공지능 더빙 모델 ‘더빙 v2’를 일레븐 API로 공개했다. 지난 6일 출시된 이 모델은 올해 5월 사용자 인터페이스 형태로 먼저 선보인 기술을 API로 확장한 것으로, 개발자와 기업이 자체 제품이나 업무 흐름에 직접 연결해 사용할 수 있도록 설계됐다.
더빙 v2는 입력된 음성만으로 변환된 음성을 바로 만드는 ‘오디오-투-오디오’ 구조를 채택했다. 음성 인식과 번역, 합성 음성 생성 단계를 차례로 거치는 기존 방식과 달리 원본 목소리에 담긴 감정과 뉘앙스를 출력 음성에 반영한다. 화자의 목소리를 복제해 다른 언어로 바꿀 수 있으며, 변환된 발화 타이밍이 영상과 자연스럽게 맞도록 구성됐다.
지원 언어는 한국어와 일본어를 포함한 92개 언어다. 다만 영상 속 인물의 입 모양을 변환된 음성에 맞춰 조정하는 AI 립싱크와 라이브 스트리밍 영상을 여러 언어로 실시간 더빙하는 기능은 이번 출시 대상에서 빠졌다. 회사는 기존 영화·TV 수준의 더빙 제작비가 분당 수백달러에 이를 수 있다는 점을 고려해 고품질 다국어 더빙의 이용 문턱을 낮추는 데 목표를 뒀다.
활용 대상으로는 영상 크리에이터와 게임 스튜디오의 캐릭터 대사·컷신 현지화, 소비재·여행·숙박 기업의 다국어 마케팅 영상 제작이 제시됐다. 스트리밍과 미디어 기업이 영화·드라마 등 장편 콘텐츠를 여러 지역에 공급하는 과정에도 적용할 수 있다. 한국 기업의 해외용 콘텐츠 제작뿐 아니라 해외 콘텐츠를 한국어 음성으로 제공하는 작업도 주요 활용 영역으로 꼽힌다.