All models

wan3.0-video

AlibabaVideo
Get your API key
wan3.0-video

用文本与多媒体素材定义完整视频镜头

wan3.0-video 是 Alibaba Wan 3 系列的视频生成型号,适合从文字构思、首尾帧设计或多媒体参考出发制作镜头。它将不同创作方式集中在统一素材输入中,可生成指定或智能时长的视频,并选择分辨率、画幅与声音。通过本平台,可将镜头草稿、产品展示和参考驱动创作接入异步工作流。

Alibaba模型品牌
视频模型类型
文字 · 图片引导创作方式
STANDARD APIs · QUICK SETUP

Bring this model into your workflow

Submit requests to the public API at api.acedata.cloud using the documented parameters, then use the results in your application.

API hostapi.acedata.cloud
modelwan3.0-video

Input parameters and result formats vary by service. Use the public API for this model and follow its guide for generation, task retrieval and editing operations.

规格与接口特性

生成方式
文本生成、首尾帧生成、多媒体参考生成
平台时长
2–30 秒整数;duration=-1 为智能时长
平台分辨率
480P、720P、1080P
输出画幅
adaptive、16:9、4:3、1:1、3:4、9:16
素材输入
media 支持七类素材,总计最多 10 项
声音控制
audio 控制生成声音,默认 false;支持参考音频素材
交付方式
异步任务;返回视频链接、尺寸及缩略图信息

以上数字与控制项为本平台的 wan3.0-video 调用规格,Prime 加速版是不同型号。

核心能力

从描述走向素材驱动

除了用提示词描述场景,还可以提交参考图像、视频与音频,把外观、动作和节奏要求落实到具体素材。Wan 3 根据 media 识别创作模式,适合已有视觉方向的项目,让文字重点解释哪些元素需要保留、哪些内容需要重新生成。

用首尾帧定义镜头边界

当开场与收尾画面已经确定,可分别提供 first_frame 和 last_frame,再描述中间的运动与镜头变化。这种方式适合产品揭示、主体移动和转场草稿,让创作围绕明确的起止画面展开;它与参考素材生成是不同模式,需要分别组织请求。

按交付目标控制视频

时长、分辨率、画幅和声音可以围绕发布目标组合选择。先用 480P 验证镜头,再以 720P 或 1080P 制作交付版本;横屏、竖屏和方形内容可分别设置画幅。需要声音时显式开启 audio,参考音频则作为素材单独表达。

适用场景

产品展示与广告镜头

输入产品图片与镜头运动参考,在提示词中说明主体、环境、展示顺序及需要保留的视觉特征,生成产品揭示或演示片段。若已设计好开始和结束构图,则改用首尾帧模式,交付可供剪辑与评审的视频素材。

社交内容与概念预演

从一段场景描述开始,明确人物动作、环境氛围和机位,选择适合发布渠道的画幅与时长。概念阶段先制作低分辨率草稿,确认方向后调整输出规格,适合将文案创意转成可观看的镜头方案,而不是直接制作完整长片。

参考驱动的创作流水线

将图像、视频或音频素材与创作说明一起提交,用于风格探索、动作参考和节奏预演。应用保存异步 task_id,通过 /wan/tasks 查询结果,再把成功视频及缩略图归档到素材库,衔接人工评审、剪辑与发布流程。

如何选择这个模型

与 Wan 2.6 的调用方式取舍

新项目需要在文本、首尾帧和混合参考之间切换时,wan3.0-video 的统一 media 输入更便于组织素材。已有 Wan 2.6 集成则可继续使用原来的任务型号与 action 等参数。迁移时应重新设计素材结构,不要只替换型号名称,也不要把旧参数直接视为新型号的创作能力。

标准版与 Prime 怎么选

wan3.0-video 可作为素材驱动创作和后台生成任务的选择;Wan 3.0 Prime 是单独的加速版本,更适合把生成等待时间作为主要考量的项目。选择时结合实际任务测试完成时间与成片效果,不应把 Prime 的速度定位理解为标准版的固定耗时,也不必仅凭版本名称判断画质。

开始使用

给每份素材分配角色

在 media 中用 first_frame、last_frame 或 reference_image/video/audio 等类型提交素材,写清哪些约束主体、哪些提供动作或节奏,总数组最多 10 项。

配置 Wan 3 的视频请求

向 /wan/videos 显式选择 model=wan3.0-video,按任务设置 duration、ratio、resolution;声音默认关闭,需要有声输出时设 audio=true。

异步交付并验收

保存 task_id 后通过 /wan/tasks 或回调获取成片;检查实际长度、声画与素材引用,再保存用于下一镜头的画面。

试用建议:多素材产品镜头

输入与目标

图片定义背包外观,视频提供走路动作,音频提供节奏;一位人物背着该背包穿过公园,镜头平稳跟随,动作与节奏协调。

验收与下一步

用 media 区分 reference_image、reference_video、reference_audio;需要有声输出显式设 audio=true,检查素材职责是否被正确表达。

使用边界

  • 首尾帧与参考素材不能在同一请求中混用。需要锁定起止画面时选择帧模式,需要借鉴外观、动作或声音时选择参考模式;media 总数最多 10 项,素材应围绕同一创作目标组织,避免把不兼容的控制方式堆在一起。
  • 这里的参考视频是生成素材,不等于对原片进行精确编辑或无缝延长。若目标是保持每个既有镜头不变、只修改局部内容,应采用专门的编辑流程;本型号更适合根据提示与参考重新创作视频片段。
  • 异步提交成功不代表视频已经完成。应用需要保存 task_id、检查任务终态,并在成功后获取视频链接。file 与 link 是素材输入类型,不能据此假设任意文件格式或网页都可直接使用,接入前应验证实际素材。

常见问题

wan3.0-video 要按创作方式更换模型 ID 吗?

不需要。调用 /wan/videos 时使用 model=wan3.0-video,文字创作由 prompt 表达,首尾帧或参考创作由 media 表达,系统据此识别模式。首尾帧与参考素材应分开提交,不要为了覆盖更多控制条件而混在同一请求里。

duration=-1 与指定秒数有什么区别?

指定时长可以使用 2–30 秒整数,适合已有剪辑节奏或明确交付长度的任务。duration=-1 让模型智能选择时长,适合先探索镜头表达的创作。若视频必须配合固定版位或时间线,优先指定秒数,更便于安排后续剪辑。

参考音频和生成声音是同一件事吗?

不是。reference_audio 用于提交音频参考素材,audio 则控制生成视频是否带有声音,默认 false。希望成片包含声音时应显式开启 audio,并在提示词中说明声音目标;不能仅因提交了音频参考就认为已开启声音输出。

如何拿到异步任务生成的视频?

设置 async=true 后先保存返回的 task_id,再通过 /wan/tasks 查询任务终态。成功视频会保存到本平台CDN,结果提供视频链接,并可包含尺寸和缩略图信息。工作流应区分提交、处理中与成功交付,而不是只判断请求是否成功。

参考视频会怎样影响结算?

参考视频按真实输入视频秒数与成功输出视频秒数合计结算,文本、图片和音频输入不增加视频秒数。因此,同样长度的输出,有参考视频与纯文本创作的结算用量可能不同。当前费用查看 Pricing,最终用量以实际 usage 为准。