가사만 고쳐 원곡 박자 지키는 노래 편집 AI
핵심 요약
카이스트 연구진이 원곡의 멜로디와 길이를 유지하며 가사만 바꾸는 멜로디싱어를 공개했다. 길이 오차는 약 0.004초에 그쳤고, 단어 오류율과 청취 평가에서도 비교 모델보다 높은 성능을 보였다. 영어 노래 13시간으로 검증된 연구 단계 기술로, 다국어·상업 음원 적용과 목소리 권리 문제는 남아 있다.
카이스트 인공지능대학원과 문화기술대학원의 박윤정·임재권·남주한 연구진이 2026년 6월 텍스트 기반 노래 음성 편집 모델 ‘멜로디싱어’를 공개했다. 이미 녹음된 노래의 멜로디와 전체 길이, 수정하지 않은 구간을 보존하면서 입력한 가사에 해당하는 부분만 새로 생성하는 기술이다. 발음 오류나 누락된 단어, 특정 구절을 고치기 위해 가수를 다시 녹음하는 작업을 줄일 가능성을 제시했다.
객관 평가에서 멜로디싱어의 전체 길이 차이는 모든 편집 유형에서 0.00초로 측정됐고, 신호 처리 과정의 잔여 오차도 약 0.004초에 그쳤다. 비교 모델 베보2는 단어 삭제 때 최대 1.92초, 에디트싱어는 최대 0.67초의 오차를 보였다. 단어 오류율도 음절 수가 같고 음소 구성이 다른 교체에서 21.88%로 베보2의 42.29%보다 낮았으며, 삭제 편집에서는 24.88%와 68.72%로 차이가 벌어졌다. 청취자 22명의 평가에서도 여섯 편집 시나리오 가운데 삽입 가사 전달력의 공동 1위를 제외한 전 항목에서 가장 높은 점수를 받았다.
박자를 유지하는 핵심은 편집 구간의 길이를 고정된 ‘시간 예산’으로 설정한 멜로DRP 모듈이다. 새 가사의 음소마다 절대 시간을 부여하지 않고 전체 구간에서 차지할 비율을 예측해 합계가 원래 길이와 맞도록 했다. 멜로디는 실제 음성에서 추출한 유사 미디로 보존하고, 새 음소 정보와 교차 주의 방식으로 결합했다. 생성 단계에서는 수정할 곳만 비운 뒤 앞뒤 원본과 이어지도록 채우는 오디오 인필링과 플로 매칭 모델을 사용했다. 구성 요소 실험에서는 총 길이 조건을 없앴을 때 성능 저하가 가장 컸고, 멜로디 정보를 제외하면 발음 구조가 크게 달라지는 편집의 품질이 떨어졌다.
평가는 GTSinger의 영어 노래 13시간과 가수 3명의 데이터로 진행됐으며, 학습에 쓰지 않은 8곡의 60개 클립으로 검증됐다. 위스퍼X로 단어별 시간을 측정하고 음절당 최소 0.3초를 적용한 뒤, 제미나이 2.5 플래시로 해당 구간에서 부를 수 있는 가사를 구성했다. 한국어 등 다른 언어와 다양한 창법, 상업 음원의 복잡한 환경에서 같은 품질이 나오는지는 아직 확인되지 않았다. 기술이 상용 수준에 이르면 클린 버전, 광고 음악의 브랜드명 교체, 주제가 현지화 등에 활용될 수 있지만, 가수의 목소리 권리와 동의 문제도 함께 해결해야 한다.