화면 밖으로 향하는 AI 기기, 음성이 승부처
핵심 요약
주요 기술 기업들이 차세대 AI 기기의 핵심 조작 방식으로 음성을 채택하고 있다. 오픈AI와 구글은 지연을 줄이고 감정과 대화 흐름을 이해하는 실시간 음성 모델을 개발했다. 스마트 안경과 스피커 등 웨어러블 확산 전망 속에 인수와 스타트업 투자가 확대되고 있다.
스마트폰 이후의 AI 기기를 선점하려는 주요 기술 기업들이 화면 터치 대신 목소리로 작동하는 제품과 음성 모델 개발에 속도를 내고 있다. 오픈AI는 내년 출시를 목표로 조니 아이브와 AI 전용 기기를 준비 중이다. 도넛 형태의 이동형 스마트 스피커로 구상된 이 제품은 카메라와 센서로 주변을 인식하고, 대화를 학습해 개인화된 서비스를 제공하도록 설계됐다.
메타는 2021년부터 음성으로 구동되는 AI 스마트 안경을 출시해 왔다. 이용자가 ‘헤이 메타’라고 부른 뒤 질문하면 내장 AI가 답하는 방식이다. 구글과 애플도 AI 스마트 안경 출시를 준비하고 있다. 오픈AI의 ‘GPT-리얼타임-2’는 GPT-5급 추론 능력을 바탕으로 복잡한 음성 요청을 처리하며, 매주 1억5000만명 이상이 챗GPT의 음성 대화와 받아쓰기 기능을 이용하고 있다.
기존 음성 AI는 음성 인식, 텍스트 변환, 거대언어모델 추론, 답변 생성, 음성 변환을 차례로 거쳐 응답이 늦었다. 질문과 답변의 순서를 기다리는 턴 방식 탓에 대화가 자주 끊기기도 했다. GPT-리얼타임-2는 말하기와 듣기를 동시에 처리하는 전이중 방식을 적용해 이용자의 끼어들기나 말 바꾸기에 즉시 반응한다. 초당 여러 차례 대화 상태를 살펴 말하기·듣기·멈춤·도구 호출을 결정하는 구조다.
구글의 ‘제미나이 3.1 플래시 라이브’는 억양과 속도, 음조, 웃음까지 인식해 감정에 맞춰 응답을 조절한다. 텍스트 변환 없이 음성을 바로 처리하는 오디오-투-오디오 기술과 이미지·텍스트·영상을 함께 다루는 멀티모달 기능도 갖췄다. 메타는 지난해 7월 플레이AI, 8월 웨이브폼스AI를 인수해 음성 합성과 감정 표현 기술을 보강했다. 일레븐랩스·딥그램·흄AI·카르테시아·세사미 등 5개 음성 AI 스타트업에는 최근 수년간 15억달러가 넘는 투자가 유입됐다.