감정·목소리 살린 92개 언어 AI 더빙 API 공개
핵심 요약
일레븐랩스가 원본 음성의 감정과 연기를 재현하는 ‘더빙 v2’ API를 공개했다. 음성을 직접 변환하는 구조와 복제 목소리 기술을 활용하며 92개 언어를 지원한다. 개발자와 기업은 영상·게임·마케팅·장편 콘텐츠 제작 과정에 모델을 연동할 수 있다.
일레븐랩스가 원본 음성의 감정과 연기 특성을 살려 다른 언어로 변환하는 인공지능 모델 ‘더빙 v2’를 10일 API 형태로 공개했다. 한국어와 일본어를 포함해 세계 92개 언어를 지원하며, 개발자와 기업은 이 모델을 자체 제품이나 콘텐츠 제작 워크플로우에 직접 연결해 사용할 수 있다.
더빙 v2에는 입력 음성에서 출력 음성을 곧바로 생성하는 ‘오디오 투 오디오’ 아키텍처가 적용됐다. 음성 인식과 번역, 복제 음성 합성을 차례로 거치는 기존 방식과 구조가 다르다. 원본에 담긴 감정과 미묘한 표현을 충실히 재현하고, 화자 목소리를 복제해 자연스러운 다국어 음성을 만드는 데 초점을 맞췄다.
발화 시점이 영상의 흐름과 자연스럽게 맞도록 설계돼 음성과 화면 사이의 싱크 정확도도 높였다. 활용 범위는 영상과 게임 캐릭터 대사의 현지화, 여러 언어로 제작하는 마케팅 영상, 영화와 드라마 같은 장편 콘텐츠의 다지역 배포 등이다. 서로 다른 언어권을 겨냥한 콘텐츠 제작 과정 전반에 모델을 통합할 수 있다.
이 모델은 지난 5월 사용자 인터페이스 버전으로 먼저 공개됐으며, 이번에는 API 제공으로 활용 방식이 확대됐다. 92개 언어 지원을 바탕으로 K-콘텐츠의 해외 진출에 필요한 다국어 더빙뿐 아니라 해외 콘텐츠를 한국어로 옮기는 작업에도 적용할 수 있다. 콘텐츠의 국내외 이동 과정에서 양방향 더빙 수요를 함께 다룰 수 있다는 점이 특징이다.