카나나-o, 자연어 지시로 말투·감정 조절
핵심 요약
카카오가 자연어 지시로 말투와 감정, 사투리 등을 구현하는 카나나-o 음성 기술을 고도화했다. 한국어 발화 지시 벤치마크에서 94.50점을 기록했고 영어 음성 지시도 처리한다. 자체 토크나이저를 적용했으며 비언어적 표현과 음성 이해·생성 통합 기술도 개발할 계획이다.

카카오는 4일 자체 개발한 옴니 인공지능 모델 ‘카나나-o’의 음성 생성 기술을 고도화했다. 개선된 모델은 이용자가 자연어로 지정한 말투와 속도, 음량, 음높이, 감정, 억양을 음성에 반영한다. 슬픈 목소리나 경상도 사투리로 글을 읽는 것은 물론, 스포츠 중계자와 아나운서 등 특정 역할에 맞춘 발화 방식도 구현할 수 있다.
카나나-o는 발화 지시 수행 능력을 측정하는 한국어 벤치마크 ‘인스트럭트 TTS 이밸’에서 94.50점을 기록했다. 오픈AI의 GPT-4o 미니 TTS가 받은 91.10점보다 높고, 구글 제미나이 2.5 플래시 프리뷰 TTS의 95.38점과 가까운 수준이다. 학습에는 한국어 데이터가 중심적으로 쓰였지만 영어 음성을 만들 때도 같은 방식으로 발화 지시를 처리할 수 있다.
음성 생성의 속도와 효율을 높이기 위해 자체 음성 토크나이저 ‘LM-SPT’도 적용됐다. 음성 토크나이저는 소리 데이터를 인공지능이 처리할 수 있는 토큰 단위로 바꾸는 기술이다. LM-SPT는 음성을 더 적은 수의 토큰으로 압축해 모델이 다뤄야 하는 데이터양을 줄이는 구조로 설계됐다. 이를 통해 자연어 지시를 반영하는 음성 생성 과정의 처리 부담을 낮췄다.
카카오는 앞으로 음성을 이해하는 기능과 생성하는 기능을 하나의 통합 구조에서 처리하는 기술을 연구할 계획이다. 현재 말투와 감정, 억양 등을 조절하는 기능에서 더 나아가 웃음과 한숨, 감탄처럼 말 이외에 드러나는 표현을 생성하는 기능도 개발한다. 카나나-o를 여러 서비스에 적용해 이용자가 더욱 자연스럽고 편리한 인공지능 음성 경험을 접하도록 한다는 구상이다.