알리바바가 텍스트·이미지·PDF·PPT를 입력받아 최대 30초 길이의 동영상을 생성하는 비디오 생성 모델 'Wan3.0'을 베타로 공개했다. 전작 Wan2.5 대비 영상 길이가 두 배로 늘었으며, 프롬프트에 맞춰 최적 영상 길이를 추천하고 기존 영상을 연장하는 기능도 갖췄다. 한 프롬프트에 이미지 10장, 영상 5개, 오디오 5개까지 동시에 입력할 수 있고, 캐릭터·소품·공간 배치 등 참조 요소의 일관성을 높여 얼굴이나 UI에서 흔한 시각적 왜곡을 줄였다고 알리바바는 설명한다. wan.video, 알리바바 클라우드 모델 스튜디오, Qwen Cloud API를 통해 이용 가능하며, 30초 1080p 클립 기준 6~8.4달러의 요금이 책정됐다. 이번 출시는 알리바바가 홍콩 상장사 사상 최대 규모의 주식 매각으로 AI 투자를 확대하는 가운데 분기 순이익이 전년 대비 75% 급감한 시점에 이뤄졌다.
- •알리바바 Wan3.0, 텍스트·이미지·PDF·PPT 입력으로 최대 30초 영상 생성, 전작 대비 길이 2배
- •이미지 10장·영상 5개·오디오 5개를 동시 처리하는 멀티모달 입력 지원
- •참조 요소 일관성 강화로 얼굴·UI 등의 시각적 왜곡(drift) 완화
- •wan.video·Alibaba Cloud·Qwen Cloud API로 제공, 30초 1080p 클립 6~8.4달러
- •알리바바 분기 순이익 75% 급감 속에서도 AI 투자 확대 일환으로 출시
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Alibaba's Wan3.0 generates AI videos up to 30 seconds long from text, images, and documents
- 1.알리바바 Wan3.0 베타 공개, 텍스트·이미지·PDF·PPT 입력으로 최대 30초 영상 생성
- 2.전작 Wan2.5 대비 길이 2배, 기존 영상을 늘리는 확장 도구도 포함
- 3.한 프롬프트에 이미지 10장·영상 5개·오디오 5개까지 입력 가능, 캐릭터·소품 일관성 개선
- 4.가격은 480p 표준 초당 0.05달러부터 1080p 프라임 초당 0.28달러, wan.video·Qwen Cloud API 제공
왜 중요한가?
문서·웹페이지까지 영상 생성 입력으로 받는 멀티모달 처리는 마케팅·교육 영상 자동화뿐 아니라 로보틱스 시뮬레이션 학습 데이터 생성까지 겨냥해, 영상 생성 모델의 활용 범위를 콘텐츠 제작 밖으로 넓히는 시도다.
언급 프로젝트
본문 미리보기
Alibaba's video generation model Wan3.0 creates clips up to 30 seconds long from text, PDFs, and PowerPoint files. A 30-second 1080p clip costs $6. Alibaba's quarterly profit dropped 75 percent year-over-year as the company ramps up AI spending. The article Alibaba's Wan3.0 generates AI videos up to 30 seconds long from text, images, and documents appeared first on The Decoder.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:33AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
