All models

wan2.6-t2v

AlibabaVideo
13.5–46.5 Credits
Get your API key
wan2.6-t2v

从文字脚本生成主体连贯的多镜头有声短片

wan2.6-t2v 是 Alibaba Wan 2.6 系列的文生视频型号,面向从文字创意到叙事短片的制作。它以智能镜头调度组织画面,强调不同镜头中的主体、场景与氛围一致性,原生最长支持15秒,并具备音频输入输出能力。适合产品故事、社交内容及短片概念预演,尤其适合尚未准备图片或视频素材的创作阶段。

Alibaba模型品牌
视频模型类型
视频任务能力

规格与接口特性

在选型前明确容量、输入输出与调用方式。

创作方式
文本生成视频;原生支持文本、音频输入
输出模态
视频、音频
原生最长时长
15秒
原生清晰度档位
720P、1080P
镜头组织
智能多镜头叙事;请求可选single或multi
音频开关
audio默认false,有声创作需主动开启
调用与交付
POST /wan/videos;支持异步任务,结果包含视频地址与尺寸字段

时长与清晰度按本型号原生规格介绍,音频开关、镜头选项和任务交付按本平台调用方式说明。

核心能力

了解 wan2.6-t2v 能为你的工作带来什么。

让短脚本形成镜头叙事

wan2.6-t2v 不只适合描述一个动态瞬间,也能把连续情节组织成多镜头短片。创作时可按开场、主体动作与收尾写清事件顺序,再补充景别和氛围。智能镜头调度为短故事提供组织能力,适合在有限时长里表达清楚的视觉主题。

围绕同一主体保持连贯

多镜头创作的重点是让人物、场景和氛围相互衔接,而不是把无关画面拼在一起。该型号强调这些要素的一致性。提示词中可固定主体外观、服装、地点和光线,仅让动作与观察角度变化,更便于评估故事是否连贯。

同时规划画面与声音

原生能力包含音频输入和音频输出,适合把声音作为短片设计的一部分,而非只考虑无声画面。在本平台调用时,audio默认关闭,有声任务应主动开启。写脚本时可同步说明声音意图,完成后再检查声画表达是否符合创意。

适用场景

从具体任务出发,找到模型发挥作用的位置。

产品故事概念片

输入产品使用情境、主体动作与结尾画面的文字说明,生成一段展示创意的短片。例如围绕出行用品设计出发、使用、抵达的情节,用于内部讨论传播方向。若必须严格复现已有商品图片,应改用图片起始的创作型号。

社交内容脚本试拍

把短视频想法写成简短拍摄提纲,交代开场吸引点、主要动作和结束状态,再生成可供审阅的动态草稿。适合比较不同故事开头或镜头安排。每次只改变一项创意重点,更容易判断哪些表达值得继续制作和剪辑。

叙事镜头预演

输入角色设定、场景气氛与动作先后关系,把文字分镜变成动态预演素材。导演、设计师或内容团队可用它讨论视觉节奏和镜头衔接,再决定后续拍摄方案。交付物是短视频预演,不应当作逐帧锁定的最终摄影方案。

如何选择这个模型

结合任务复杂度、输入材料与预期结果选择。

从文字出发,选择t2v

当你只有脚本、场景构想或创意方向时,wan2.6-t2v 是直接的选择。若已有图片并希望以它作为开始画面,可选择wan2.6-i2v;若要从既有视频提取角色外观并带入新场景,则考虑wan2.6-r2v。优先根据创作起点选择型号,而不是把所有素材都交给文生视频处理。

先确定短片结构,再选镜头模式

一个主体动作或完整展示过程,可先使用single组织单镜头表达;具有明确情节转折的短故事,可尝试multi。wan2.6-t2v 的原生时长上限是15秒,适合聚焦一个主题。需要更长叙事时,应拆分片段并安排后期衔接,不要在短片里堆叠过多人物、地点和事件。

开始使用

从一次小规模任务到正式接入。

01

准备任务与材料

明确目标、必要输入与输出要求,使用真实业务样例作为起点。

02

在 API 调试区试用

打开试用页,确认此入口支持的参数,再提交小规模任务查看结果。

03

按 API 文档接入

保留完整模型 ID,使用文档规定的请求格式,并在 Pricing 页确认计费规则。

使用边界

在正式使用前,了解输出质量与能力范围。

  • 多镜头一致性是该型号的能力重点,但不等于角色外观、道具位置或动作衔接能够逐帧锁定。人物细节或商品外观要求严格时,应逐镜头审阅成片;已有明确视觉素材的任务,更适合选择对应的图片或参考视频型号。
  • 原生最长15秒,复杂剧情需要压缩或拆分。提示词同时要求频繁换景、多个角色互动和连续动作,容易让表达重点分散。建议保留清晰的主线,把字幕排版、品牌标识和精确剪辑安排在后期完成。
  • 有声创作需要注意audio默认关闭。原生音频能力不代表可以指定任意音频格式、精确控制每句对白的时间点,或直接完成专业混音。发布前应检查声音内容、音量和画面配合,必要时再做配音或声音编辑。

常见问题

解答使用 wan2.6-t2v 时的常见疑问。

wan2.6-t2v 可以直接用图片生成视频吗?

这个型号以文字生成视频为定位。如果创作需要以现有图片作为起始画面,应选择wan2.6-i2v;如果需要从视频延续角色外观,则选择wan2.6-r2v。按素材类型选择对应型号,有助于明确画面控制方式。

它能生成多长、什么清晰度的视频?

wan2.6-t2v 的原生最长时长为15秒,清晰度档位包括720P和1080P。适合制作聚焦单一主题的短片。更长的故事建议拆成多个片段,再通过剪辑衔接,并为每段保持相同的主体与场景设定。

怎样写多镜头提示词更合适?

把提示词写成简短拍摄提纲:先说明主体与场景,再按顺序描述开场、主要动作和收尾。保持人物外观、环境和氛围一致,避免每个镜头重新定义主体。需要多镜头时可选择shot_type为multi,并审阅生成后的连续性。

生成视频默认带声音吗?

本平台请求中的audio默认是false,因此有声创作应主动设置audio为true。该型号原生支持音频输入输出,但最终仍应检查声音与画面的配合。对白、音乐或环境声有严格制作要求时,可在生成后继续编辑。

如何提交任务并取得视频结果?

向POST /wan/videos提交model为wan2.6-t2v的请求,以prompt描述视频内容,文生视频操作使用text2video。设置async为true后取得task_id,再通过/wan/tasks查询终态;成功结果可提供视频地址、尺寸及缩略图等信息。

模型资料 · 更新日期:2026-10-01。调用参数与计费规则请查看 API 和定价栏目。

把 wan2.6-t2v 用到你的下一项任务

从清晰的目标开始,在实际结果中判断它是否适合你的工作。