30초 영상·문서 참조까지 담은 ‘Wan3.0’
핵심 요약
Wan3.0은 클립당 최대 30초 영상 생성과 멀티모달 참조 입력을 지원한다. 웹페이지와 PDF, 프레젠테이션도 참조 자료로 활용하며 시각적 연속성을 강화했다. 공개 베타 테스트는 모델스튜디오와 큐원 클라우드에서 신청할 수 있다.
알리바바가 클립당 최대 30초 분량의 영상을 생성하는 인공지능 모델 ‘Wan3.0’ 베타 버전을 공개했다. 고품질 영상 생성과 정밀한 시각적 일관성, 멀티모달 참조 입력을 하나의 모델에 통합해 전문 콘텐츠 제작 과정을 효율화하는 데 초점을 맞췄다. 공개 베타 테스트 참여자는 알리바바 클라우드의 AI 개발 플랫폼 ‘모델스튜디오’와 AI 네이티브 클라우드 플랫폼 ‘큐원 클라우드’에서 모델 테스트를 신청할 수 있다.
Wan3.0은 복잡한 카메라 움직임과 장면 사이의 끊김 없는 흐름을 보다 자연스럽게 구현하도록 설계됐다. 프롬프트를 분석해 적절한 영상 길이를 추천하는 지능형 길이 설정 기능과 서사의 시간적 흐름을 늘리는 영상 연장 기능도 갖췄다. 고정밀 시각적 연속성 기술을 적용해 장면 속 요소가 흔들리거나 왜곡되는 현상을 줄이고, 참조 자료의 세부 요소와 자연스러운 움직임을 함께 재현하도록 했다.
입력 자료의 범위도 넓어졌다. 텍스트와 이미지, 영상, 오디오를 동시에 처리할 수 있으며 웹페이지와 PDF, 파워포인트 프레젠테이션 같은 문서도 영상 제작의 참조 자료로 활용한다. 얼굴과 미세한 표정 변화를 사실적으로 표현하고 자연스러운 다국어 음성을 생성하는 기능을 지원한다. 소프트웨어 사용자 인터페이스와 모션 그래픽을 안정적으로 구현하고, 움직임과 감정 표현을 결합하는 기능도 포함했다.
기존 ‘Wan2.7-비디오’를 비롯한 주요 영상 생성 AI가 통상 수초에서 최대 15초 길이의 클립을 만드는 것과 비교하면 Wan3.0은 기본 생성 시간을 최대 두 배 수준으로 확장했다. 활용 대상으로는 영화 제작 공정과 숏폼 드라마, 소셜미디어 콘텐츠가 제시됐다. 기업이 보유한 텍스트와 이미지를 바탕으로 마케팅 영상이나 교육 영상을 제작하는 업무도 지원 범위에 포함됐다.