本模板由
beauty-talk-science-video-script技能填充。下方所有[ ]占位项按用户确定的元素与 wan3 工作流生成。整段视频一个片段、≤30 秒,不支持二次创作(每次修改整段重发 wan3)。 关键链路:原始固定素材(人物五视角图/制服细节图/LOGO/音色)是生成输入;最终提交 wan3 的是经用户确认的生成物料(人物完整形象照 / 门店内景照片 / 插画 / 音色)。
character_5view.*(固定素材)生成,全片同一人、不变脸。uniform_detail.*(固定素材)生成,可换款式/颜色;胸牌样式必须完全一致、不可变更。voice_ref.*(作 Audio 1 音色参考,wan3 原生生成对白并对口型)以下 4 项用于生成第三节的最终物料,默认不直接提交 wan3(voice_ref 作音色直接提交)。
character_5view.*(URL 或本地)→ 生成「人物完整形象照」的人物参考uniform_detail.*(URL 或本地)→ 生成「人物完整形象照」的制服参考(胸牌锁死)logo_3d.*(URL 或本地)→ 生成「门店内景照片」的 LOGO 落位参考voice_ref.*(URL 或本地)→ Audio 1(直接提交,≤15s)人物_完整形象照.jpg(胸牌与 uniform_detail 一致、不可变更)。
门店_内景_采用.jpg(确认采用的位置)。
门店_内景_1.jpg(面诊桌正对面)/ _2.jpg(前台侧含 LOGO)/ _3.jpg(产品/护理区)插画_参考1.jpg / 插画_参考2.jpg,无真人皮肤/血液/文字。
由用户内容转换而来,自然亲和、适合口播;
/短停、//长停不读出。
[口语化口播全文:……(示例)"很多姐妹分不清泛红和红血丝 / 其实它俩真不是一回事 // 泛红是一过性的、受刺激就红 / 红血丝是毛细血管扩张、常年挂在那 // 搞清楚了,护肤才不踩坑。"]
字数校验:[N] 字 ≤150 → 满足 30 秒约束。
在口播文案(第四节)与插画(第三节 Image 3/4)都确认后,由用户指定插画从哪一句开始融入画面作为起始点(见技能 Step 7)。
一段连续 prompt 描述整段画面(不拆分请求),wan3 原生生成画面 + 对白 + 环境音。引用的 Image 1/2/3/4 即第三节确认后的物料。写这条 prompt 要像专业编导:人物必须在门店场景里"活"起来,不站桩;运镜/插画展示/门店丰富元素按下面四块随机组合设计(对应
elements.md元素 25/26/27/12)。
Image 1 中的女性(即这张已确认的人物完整形象照:与图中面孔、[深栗色半扎长发 + 斜刘海]、身穿[米白]美容师制服完全一致;
胸牌样式与确认稿一致、不可更改),
身处 Image 2 的怡呵美门店内(墙面有怡呵美立体 LOGO,背景虚化;
店内可见[门店丰富元素:前台 / 美容床 / 沙发 / 产品陈列架,可选其他店员从画面边缘虚化走过])。
[人物行为动线 · 按口播长短设计,全程与场景互动、不站桩]
开场她[从走动中入画 / 端坐于面诊桌前]自然引入[主题];讲到中段[起身缓步走向产品架 / 从走动落座于沙发]边走边说;
结尾[回到中近景、手势收束]。说话间伴随[整理产品 / 手势比划 / 轻微点头]等真实肢体动作。
[运镜组合 · 随机穿插 2–3 种]
开场[中近景固定 / 极轻微横摇]→ 人物走动时[跟随拍摄]→ 讲到核心点时[缓慢推近]→ 结尾[缓慢拉远]收束;
整体[手持微晃]保留真实手机拍摄质感。
她自然亲和地讲解[主题]:
"[第四节口语化口播全文]"
[插画展示方式 · 随机使用,不固化一种](在[插画插入点:第 N 句「原文」]处触发,对应 Image 3 / Image 4)
方式示例:[全屏铺盖插画] / [画面右侧圆形画中画嵌入插画] / [顶部条状画中画展示插画] / [侧边圆角区域 PiP] /
[人物画中画式全屏:插画铺满整屏、口播人物以圆形或正方形 PiP 出现在画面某区域];
同一视频多次出现插画时可轮换不同方式。
(插画为抽象皮肤结构可视化:透明表皮层、缓慢流动光点、柔和结构变化,无真人皮肤、无血液、无文字)
原生生成清晰女声普通话对白(音色参考 Audio 1)、轻微环境音、无背景音乐。
绝对禁止:字幕/任何文字/卡通化/塑料皮肤/变脸/服装漂移/场景跳变/其他清晰正脸人物抢镜。
组装为
scripts/generate_video.py的实际调用参数。提交的是第三节确认后的物料。
命令:
export DASHSCOPE_API_KEY="sk-xxx"
python scripts/generate_video.py \
--config scripts/config.json \
--prompt "[第五节整段 prompt]" \
--media \
人物_完整形象照.jpg:reference_image \
门店_内景_采用.jpg:reference_image \
插画_参考1.jpg:reference_image \
插画_参考2.jpg:reference_image \
"https://cdn.x/voice_ref.mp3:reference_audio" \
--duration 30 --ratio 9:16 --resolution 720P \
--output 成片_[主题].mp4
等价于请求体(JSON):
{
"model": "wan3.0-video",
"input": {
"prompt": "[第五节整段 prompt]",
"media": [
{"type": "reference_image", "url": "<人物_完整形象照 上传URL>"},
{"type": "reference_image", "url": "<门店_内景_采用 上传URL>"},
{"type": "reference_image", "url": "<插画_参考1 上传URL>"},
{"type": "reference_image", "url": "<插画_参考2 上传URL>"},
{"type": "reference_audio", "url": "<voice_ref URL 或 上传URL>"}
]
},
"parameters": {"resolution": "720P", "ratio": "9:16", "duration": 30, "audio": true, "prompt_extend": false, "watermark": false}
}
修改任何元素都整段重发本请求(不用 wan3 编辑/延长),见技能第 9 步。