核验于 2026年8月27日

Wan 3.0 提示词指南

把模糊创意整理成可用于生产的中文或英文提示词。构建器会组织主体、场景、动作、镜头、时序、参考素材、台词、声音与连续性,全程不调用 API。

20K提示词上限
中 / EN官方提示词语言
30s单次叙事空间
0API 调用
输入文字 · 图片 · 视频 · 音频 · 文件 · 网页
统一模型wan3.0-video
输出最长 30 秒 · 1080P · 原生音频

构建结构化视频提示词

只填写真正重要的字段。清晰的画面与声音决策顺序,通常比堆砌互不相关的风格词更有效。

从预设开始
提示词输出语言

如何为 30 秒多模态模型写提示词

Wan 3.0 能理解更多上下文,但仍然需要明确优先级与可读的时间线。

描述可见变化

不要只写“动态感强”,要写清谁移动、方向、速度、谁发生反应,以及最终状态。

让相机有明确任务

写明景别和机位:固定镜头、推进、跟拍、环绕、手持、焦点转移或有动机的剪切。

长视频使用时间节拍

20–30 秒内容拆成少量带时间的节拍,让铺垫、互动、高潮与结尾都有空间。

按素材类型引用

图片、视频和音频分别编号,因此 Image 1 与 Video 1 可以同时存在。

把声音当作场景的一部分

写准确台词,并描述情绪、语速、音色、音效、环境声与音乐出现的时间。

明确连续性优先级

只挑最重要且不能漂移的项目:人脸、服装、产品几何、道具状态、空间或色板。

生成前检查

参考标签是否与 media 数组的类型和顺序完全一致?
动作是否能在请求时长内合理完成?
台词和声音是否绑定到说话者、动作或时间点?
身份与连续性要求是否明确?
图生视频时是否把重点放在动作和运镜,而非重复设计原图?
画面文字与图表是否安排了人工审核?

官方来源与核验边界

页面中的能力与价格均为带日期的阿里云百炼公开资料快照。付费生产前请再次核对控制台。

© 2026 wan2.video