대화 끼어들고 감정 읽는 음성 AI 경쟁 가속
핵심 요약
음성 AI가 이용자의 개입과 감정, 망설임까지 반영하는 실시간 대화 기술로 진화하고 있다. 네이버클라우드는 전이중 상호작용을, 카카오는 말투와 음향 특성 제어를 핵심 경쟁력으로 내세웠다. 오픈AI와 구글도 자연스러운 대화 모델을 확대하면서 다양한 기기와 서비스로의 적용 경쟁이 빨라지고 있다.
개인용 인공지능 서비스가 질문이 끝나기를 기다리는 음성 비서에서 벗어나 사람처럼 대화 흐름을 주고받는 단계로 진화하고 있다. 네이버클라우드와 카카오는 각각 실시간 개입과 음성 표현 제어에 초점을 둔 기술을 개발하고 있으며, 오픈AI와 구글도 발화 중단과 감정 변화를 인식하는 모델을 앞세워 경쟁에 나섰다.
네이버클라우드는 국제학술대회 ACL 2026에서 전이중 음성 AI ‘소믈리에’를 공개했다. 음성·영상·텍스트를 한 모델에서 함께 처리해 답변 도중에도 이용자의 목소리를 듣고, 끼어들기나 추가 질문을 반영해 설명을 바꿀 수 있다. 겹치는 말을 잡음으로 제거하던 반이중 방식과 달리 맞장구와 개입을 학습 데이터로 활용했으며, 기술검증 중인 업무 비서 에이전트에 순차 적용할 계획이다.
카카오는 옴니 AI 모델 ‘카나나-오’를 통해 말투와 감정, 억양, 음량, 속도, 음높이를 자연어 지시로 조절하는 기술을 개발했다. 자체 음성 토크나이저 ‘LM-SPT’로 의미와 음향 특성을 토큰화하고 온라인 강화학습으로 지시 이행 능력과 음질을 개선했다. 한국어 평가 지표 InstructTTSEval에서는 94.50점을 받아 GPT-4o-mini-tts의 91.10점을 웃돌았으며, 웃음과 한숨, 감탄사까지 표현 범위를 넓힐 예정이다.
오픈AI의 ‘GPT-라이브’는 정교한 말끝 인식과 스트리밍 기술을 결합해 AI의 답변을 끊고 새 질문을 하거나 망설임을 섞어 말해도 문맥을 유지한다. 구글의 ‘제미나이 3.1 플래시 라이브’도 음조와 속도에서 불만이나 혼란을 파악해 응답 톤을 조절하고, 한국어를 포함한 다국어 대화를 지원한다. 고도화된 음성 기술의 활용 범위는 고객 상담과 업무 비서, 실시간 통역에서 스마트 안경·핀형 웨어러블·스피커·헤드폰으로 확대될 전망이다.