카카오 ‘카나나-o’, 말투·감정까지 음성 구현
핵심 요약
카카오가 자연어 지시로 말투와 속도, 감정, 억양을 조절하는 카나나-o 음성 기술을 공개했다. 한국어 지시 이행 평가에서 94.50점을 기록하고 자체 음성 토크나이저로 처리 효율을 높였다. 웃음과 한숨 등 비언어적 표현을 연구하고 다양한 서비스로 적용 범위를 확대할 계획이다.

카카오가 자체 옴니 인공지능 모델 ‘카나나-o’의 음성 생성 기술을 고도화했다. 사용자는 자연어로 지시하는 것만으로 발화의 속도와 음량, 음높이, 감정, 억양, 강도를 세밀하게 조절할 수 있다. 빠르게 읽기, 낮은 목소리로 말하기, 슬픈 분위기나 경상도 억양으로 표현하기처럼 전달 방식을 직접 지정하는 구조다.
스포츠 중계, 뉴스 진행, 동화 구연과 같은 역할을 설정할 수 있으며 여러 조건을 한꺼번에 적용하는 것도 가능하다. 가령 음성을 낮추면서 빠르고 슬프게 읽도록 복합 지시를 내릴 수 있다. 학습에는 한국어 자료가 주로 쓰였지만 영어로도 같은 유형의 명령을 수행한다. 한국어 지시 이행 능력을 측정하는 ‘InstructTTSEval’에서는 94.50점을 기록했다.
같은 평가에서 오픈AI의 GPT-4o-mini-tts는 91.10점, 구글의 Gemini-2.5-flash-preview-tts는 95.38점을 받았다. 카카오는 자체 개발한 음성 토크나이저 ‘LM-SPT’를 적용해 음성을 더 적은 토큰으로 압축하고, AI가 처리해야 할 데이터 양을 줄여 생성 속도와 효율도 개선했다. 이 기술은 한국어와 영어 음성 이해·생성 평가에서 Mimi, DualCodec, CosyVoice2보다 높은 성능을 냈다.
LM-SPT는 합성 음성의 자연스러움과 화자 유사성을 살핀 전문가 평가에서도 가장 높은 점수를 기록했다. 카카오는 음성 이해와 생성을 하나의 통합 체계에서 처리하는 연구를 이어가며, 웃음과 한숨, 감탄사 같은 비언어적 표현도 생성할 수 있도록 제어 범위를 넓힐 계획이다. 향후 카나나-o를 여러 서비스에 적용해 자연스럽고 편리한 AI 음성 경험을 제공한다는 방침이다.