바이트댄스, 실시간 시청각 대화 AI 상용화
핵심 요약
바이트댄스가 음성·영상·텍스트를 동시에 처리하는 시드리얼타임을 공개했다. 모델은 화면 맥락을 이해하고 먼저 반응하며 발화 시점까지 자체적으로 판단한다. 더우바오에 전량 적용됐지만 세부 성능 수치와 외부 제공 계획은 공개되지 않았다.
바이트댄스가 음성·영상·텍스트를 하나의 모델에서 동시에 처리하는 인공지능 모델 ‘시드리얼타임(SeedRealtime)’을 8월 5일 공개했다. 이 모델은 양쪽이 동시에 듣고 말할 수 있는 전이중 방식으로 작동하며, 바이트댄스의 AI 앱 더우바오에 이미 전량 적용됐다. 회사는 음성·영상 전이중 기술을 대규모 상용 서비스에 도입한 업계 첫 사례라고 설명했다.
시드리얼타임은 소리와 화면을 함께 해석하고, 이용자의 질문을 기다리지 않은 채 먼저 반응하며, 발화를 시작할 시점도 자체적으로 결정한다. 같은 발음이지만 의미가 다른 표현을 화면 맥락으로 구분하고 ‘아까 그거’처럼 특정 시점을 가리키는 말도 파악한다. 화면이 바뀌면 선제적으로 말을 걸면서 필요한 도구를 호출할 수 있고, 주변 잡담이나 소음에 잘못 끼어드는 현상도 줄이도록 설계됐다.
기존 음성 AI는 음성 인식과 언어 모델, 음성 합성 모듈을 순서대로 연결해 상대방이 말을 마칠 때까지 기다리는 구조가 일반적이었다. 시드리얼타임은 이 과정을 단일 아키텍처로 통합해 계속 유입되는 음성·영상 스트림에서 인식과 이해, 판단, 발화를 병렬로 수행한다. 음성의 시작과 종료 구간을 외부 규칙으로 미리 나누지 않고 모델이 대화 흐름을 직접 판단하는 점도 차이다.
사람이 평가한 종단간 시험에서는 기존 모듈 연결 방식보다 음성·영상 대화의 타이밍 문제가 절반으로 감소했다. 다만 모델의 매개변수 규모와 지연시간, 벤치마크 점수는 공개되지 않았으며 논문과 코드 저장소도 제시되지 않았다. 가중치 공개 여부와 API 제공 계획 역시 확인되지 않았다. 이번 모델은 시드 팀이 4월 9일 선보인 음성 전용 전이중 모델의 처리 범위를 영상으로 확장한 후속 모델이다.