本模板由
beauty-talk-science-video-script技能填充。下方所有[ ]占位项按用户确定的元素与 wan3 工作流生成。整段视频一个片段、≤30 秒,不支持二次创作(每次修改整段重发 wan3)。 关键链路:原始固定素材(人物五视角图/制服细节图/LOGO/音色)是生成输入;最终提交 wan3 的是经用户确认的生成物料(人物完整形象照 / 门店内景照片 / 插画 / 音色)。
character_5view.*(固定素材)生成,全片同一人、不变脸。uniform_detail.*(固定素材)生成,可换款式/颜色;胸牌样式必须完全一致、不可变更。voice_ref.*(作 Audio 1 音色参考,wan3 原生生成对白并对口型)以下 4 项用于生成第三节的最终物料,默认不直接提交 wan3(voice_ref 作音色直接提交)。
character_5view.*(URL 或本地)→ 生成「人物完整形象照」的人物参考uniform_detail.*(URL 或本地)→ 生成「人物完整形象照」的制服参考(胸牌锁死)logo_3d.*(URL 或本地)→ 生成「门店内景照片」的 LOGO 落位参考voice_ref.*(URL 或本地)→ Audio 1(直接提交,≤15s)⚠️ 以下物料名里的
Image 1 / Image 2 / Image 3 / Image 4 / Audio 1只是内部命名与 media 数组顺序对应,绝不能原样写进 prompt 文本(wan3 会把Image N/Audio N当对白念出)。prompt 里用自然语言描述画面与音色即可。
人物_完整形象照.jpg(胸牌与 uniform_detail 一致、不可变更)。
门店_内景_采用.jpg(确认采用的位置)。
门店_内景_1.jpg(面诊桌正对面)/ _2.jpg(前台侧含 LOGO)/ _3.jpg(产品/护理区)插画_参考1.jpg / 插画_参考2.jpg,无真人皮肤/血液/文字。
由用户内容转换而来,自然亲和、适合口播;
/短停、//长停不读出。
[口语化口播全文:……(示例)"很多姐妹分不清泛红和红血丝 / 其实它俩真不是一回事 // 泛红是一过性的、受刺激就红 / 红血丝是毛细血管扩张、常年挂在那 // 搞清楚了,护肤才不踩坑。"]
字数校验:[N] 字 ≤150 → 满足 30 秒约束。
口播文案(第四节)经用户确认后,按技能 Step 6 自动跑
scripts/compliance_scan.py+ 对照references/compliance-check.md复核,结论写入此处留痕。
在口播文案(第四节)与插画(第三节 Image 3/4)都确认后,由用户指定插画从哪一句开始融入画面作为起始点(见技能 Step 7)。
一段连续 prompt 描述整段画面(不拆分请求),wan3 原生生成画面 + 对白 + 环境音。下方范式按官方「总体描述 + 镜头序号 + 时间戳 + 分镜内容」组织,时间戳用英文
Shot N [x-y s]、台词用{}圈出。⚠️ prompt 文本里绝不写Image N/Audio N(会被 wan3 当对白念出,见wan3-workflow.md第一节/第七节);第三节物料靠 media 数组顺序间接对应,用自然语言描述画面与音色即可。写这条 prompt 要像专业编导:人物必须在门店场景里"活"起来,不站桩;运镜/插画展示/门店丰富元素按下面四块随机组合设计(对应elements.md元素 25/26/27/12)。
【总体描述】
一位身穿[米白]美容师制服、[深栗色半扎长发 + 斜刘海]、胸牌样式与参考形象照一致的女美容师,
在怡呵美门店内(墙面有怡呵美立体 LOGO,背景虚化,可见前台、美容床、沙发、产品陈列架,
一名店员从画面边缘虚化走过)拍摄。画面中的女美容师、门店与插画均依据随附参考图生成,
须保持人物脸型/发型/制服/胸牌一致,门店须含怡呵美立体 LOGO,插画为卡通动漫风抽象可视化(无真人、无文字)。
整体动线:[开场端坐于面诊桌前自然引入主题,中段起身缓步走向产品陈列架、边走边说,
结尾保持站立、抬手手势收束];说话间以自然手势比划、轻微点头等真实肢体动作呈现。
镜头语言:[开场中近景极轻微横摇,人物走动时跟随拍摄,讲到核心点时缓慢推近,结尾缓慢拉远收束];
整体手持微晃保留真实手机拍摄质感。
语气与节奏:她自然亲和地讲解,像真人面对面聊天一样有温度有起伏——问句好奇上扬、肯定句沉稳、
列举句轻快有层次、收束句温和坚定;整体语速比自然对话放慢约一半、从容舒缓,让内容自然撑满约[30s],
句与句之间留约[0.5s]自然气口,不赶。
声音:原生清晰女声普通话对白(音色参考随附音频)、轻微环境音、无背景音乐;
口播须有自然语调起伏与停顿,禁止平淡匀速念稿。
硬性约束:口播须严格限于下列分镜台词,禁止添加、删改或自由发挥任何文案之外的语句、语气词;
插画仅以局部形式出现(圆形/圆角画中画),禁止全屏覆盖;绝对禁止出现字幕、任何画面文字、
卡通化人物、塑料皮肤、变脸、服装漂移、场景跳变、或其他清晰正脸人物抢镜。
结构说明:以下「Shot序号 + 时间戳 + 分镜内容」为本片分镜脚本;Shot序号与时间戳是给模型的
节奏结构指令,不是台词,禁止当作语音读出;也禁止在任意空白时段补加台词或语气词。
【分镜脚本】
Shot 1 [0-4s]:[开场中近景,女美容师端坐面诊桌前,手持微晃手机质感,镜头极轻微横摇];
她好奇上扬地提问{[第四节·口播句1]},句末留自然气口。
Shot 2 [4-7.5s]:[仍端坐,中近景];她自然沉稳肯定{[口播句2,含防错替换:定期→订期]},语气笃定、不赶。
Shot 3 [7.5-12.5s]:[她起身缓步走向产品陈列架、边走边说,镜头跟随拍摄];列举句轻快有层次{[口播句3]}。
Shot 4 [12.5-19.5s]:[走到陈列架前站立,讲到核心点时镜头缓慢推近;此处画面右侧嵌入圆形画中画
展示插画参考1(抽象可视化,无真人无文字,禁全屏)]。该句放慢加重带警示,讲到「[核心重音点]」时
稍作重音并留自然停顿{[口播句4]}。
Shot 5 [19.5-26s]:[切换为画面侧边圆角区域画中画展示插画参考2(同风格,不铺满整屏)];她自然亲和{[口播句5]}。
Shot 6 [26-30s]:[结尾缓慢拉远收束,她保持站立、抬手手势收束,中近景];收束句温和坚定{[口播句6]},留足停顿感。
组装为
scripts/generate_video.py的实际调用参数。提交的是第三节确认后的物料。
命令(在任务文件夹 beauty-video-materials/<任务短名>/ 内执行,或直接用绝对路径):
export DASHSCOPE_API_KEY="sk-xxx"
python scripts/generate_video.py \
--config scripts/config.json \
--prompt "$(cat prompt.txt)" \
--media \
人物_完整形象照.png:reference_image \
门店_内景_采用.png:reference_image \
插画/插画_参考1.png:reference_image \
插画/插画_参考2.png:reference_image \
"https://cdn.x/voice_ref.mp3:reference_audio" \
--duration 30 --ratio 9:16 --resolution 720P \
--output 成片_<主题>.mp4
说明:
--prompt直接读本任务文件夹的prompt.txt(Step 8 写出);--media引用本任务文件夹内的人物形象照 / 门店内景 / 插画,--output指向同文件夹成片路径(脚本已自动创建父目录,无需手动 mkdir)。音色voice_ref走config.brand_assets固定 URL 透传,不进文件夹。
等价于请求体(JSON):
{
"model": "wan3.0-video",
"input": {
"prompt": "[第五节整段 prompt]",
"media": [
{"type": "reference_image", "url": "<人物_完整形象照 上传URL>"},
{"type": "reference_image", "url": "<门店_内景_采用 上传URL>"},
{"type": "reference_image", "url": "<插画_参考1 上传URL>"},
{"type": "reference_image", "url": "<插画_参考2 上传URL>"},
{"type": "reference_audio", "url": "<voice_ref URL 或 上传URL>"}
]
},
"parameters": {"resolution": "720P", "ratio": "9:16", "duration": 30, "audio": true, "prompt_extend": false, "watermark": false}
}
修改任何元素都整段重发本请求(不用 wan3 编辑/延长),见技能第 9 步。