script-template.md 13 KB

美业口播科普视频脚本(单段 · 百炼 wan3):【主题】

本模板由 beauty-talk-science-video-script 技能填充。下方所有 [ ] 占位项按用户确定的元素与 wan3 工作流生成。整段视频一个片段、≤30 秒,不支持二次创作(每次修改整段重发 wan3)。 关键链路:原始固定素材(人物五视角图/制服细节图/LOGO/音色)是生成输入;最终提交 wan3 的是经用户确认的生成物料(人物完整形象照 / 门店内景照片 / 插画 / 音色)。


一、角色定义(Subject)

  • 人设 / 身份:[皮肤知识科普博主 / 医美咨询师 / …]
  • 面部形象:由 character_5view.*(固定素材)生成,全片同一人、不变脸。
  • 服装:由 uniform_detail.*(固定素材)生成,可换款式/颜色;胸牌样式必须完全一致、不可变更。
  • 造型:[深栗色半扎长发 + 斜刘海 / 与人物五视角图一致]
  • 音色:voice_ref.*(作 Audio 1 音色参考,wan3 原生生成对白并对口型)

二、固定品牌素材(生成输入,素材包/URL 锁定,不可覆盖)

以下 4 项用于生成第三节的最终物料,默认不直接提交 wan3(voice_ref 作音色直接提交)。

  • character_5view.*(URL 或本地)→ 生成「人物完整形象照」的人物参考
  • uniform_detail.*(URL 或本地)→ 生成「人物完整形象照」的制服参考(胸牌锁死)
  • logo_3d.*(URL 或本地)→ 生成「门店内景照片」的 LOGO 落位参考
  • voice_ref.*(URL 或本地)→ Audio 1(直接提交,≤15s)

三、生成并确认的最终物料(用户确认后才提交)

⚠️ 以下物料名里的 Image 1 / Image 2 / Image 3 / Image 4 / Audio 1 只是内部命名与 media 数组顺序对应,绝不能原样写进 prompt 文本(wan3 会把 Image N/Audio N 当对白念出)。prompt 里用自然语言描述画面与音色即可。

  • 人物完整形象照(Image 1):由 character_5view + uniform_detail 生成,人物_完整形象照.jpg(胸牌与 uniform_detail 一致、不可变更)。
    • 确认状态:[用户挑选 / 已自动随机指定:人物_形象_X]
  • 门店内景照片(Image 2,含怡呵美 LOGO):由 logo_3d 生成含 LOGO,门店_内景_采用.jpg(确认采用的位置)。
    • 候选:门店_内景_1.jpg(面诊桌正对面)/ _2.jpg(前台侧含 LOGO)/ _3.jpg(产品/护理区)
    • 确认状态:[用户挑选 / 已自动随机指定:门店_内景_X]
  • 插画参考图(Image 3 / Image 4,抽象可视化风格启发):插画_参考1.jpg / 插画_参考2.jpg,无真人皮肤/血液/文字。
    • 确认状态:[用户挑选 / 已自动随机指定:插画_参考_X]

四、口播文案(口语化,≤110 字 / 30 秒,预留停顿余量)

由用户内容转换而来,自然亲和、适合口播;/ 短停、// 长停不读出。

[口语化口播全文:……(示例)"很多姐妹分不清泛红和红血丝 / 其实它俩真不是一回事 // 泛红是一过性的、受刺激就红 / 红血丝是毛细血管扩张、常年挂在那 // 搞清楚了,护肤才不踩坑。"]

字数校验:[N] 字 ≤150 → 满足 30 秒约束。


四-补、敏感词/合规检测(口播定稿后必跑)

口播文案(第四节)经用户确认后,按技能 Step 6 自动跑 scripts/compliance_scan.py + 对照 references/compliance-check.md 复核,结论写入此处留痕。

  • 检测触发:每次口播定稿确认后必跑;用户按建议改 / 自改后再次检测,循环直到无 🔴 极高、无 🟠 高违规。
  • 检测报告结论:[通过 / 修改后通过(中·低) / 不予通过]
  • 命中条目与处置: | 违规点 | 原表述 | 风险等级 | 法规依据 | 合规替换 | 处置 | |--------|--------|----------|----------|----------|------| | [类别] | 「[词]」 | [🔴/🟠/🟡/🟢] | [法规] | [替换] | [已采纳 / 用户自改 / 保留待核] |
  • 确认状态:[用户已确认通过 / 已按建议修改后复检通过]

四-补2、插画插入点(用户确认,提交前必填)

在口播文案(第四节)与插画(第三节 Image 3/4)都确认后,由用户指定插画从哪一句开始融入画面作为起始点(见技能 Step 7)。

  • 口播分句(按停顿切分,带编号): ① [句1] ② [句2] ③ [句3] ④ [句4] …(以用户确认稿为准逐句拆出)
  • 插画起始句:第 [N] 句「[原文]」——Image 3 / Image 4 从该句起连续融入画面;若多图各自对应不同句,逐图标注(如 Image 3→句②、Image 4→句③)。
  • 确认状态:[用户点选 / 已自动建议:第 N 句]

五、单段视频 Prompt(整段 30 秒 · 编导分镜版,含参考引用)

一段连续 prompt 描述整段画面(不拆分请求),wan3 原生生成画面 + 对白 + 环境音。下方范式按官方「总体描述 + 镜头序号 + 时间戳 + 分镜内容」组织,时间戳用英文 Shot N [x-y s]、台词用 {} 圈出。⚠️ prompt 文本里绝不写 Image N/Audio N(会被 wan3 当对白念出,见 wan3-workflow.md 第一节/第七节);第三节物料靠 media 数组顺序间接对应,用自然语言描述画面与音色即可。写这条 prompt 要像专业编导:人物必须在门店场景里"活"起来,不站桩;运镜/插画展示/门店丰富元素按下面四块随机组合设计(对应 elements.md 元素 25/26/27/12)。

【总体描述】
一位身穿[米白]美容师制服、[深栗色半扎长发 + 斜刘海]、胸牌样式与参考形象照一致的女美容师,
在怡呵美门店内(墙面有怡呵美立体 LOGO,背景虚化,可见前台、美容床、沙发、产品陈列架,
一名店员从画面边缘虚化走过)拍摄。画面中的女美容师、门店与插画均依据随附参考图生成,
须保持人物脸型/发型/制服/胸牌一致,门店须含怡呵美立体 LOGO,插画为卡通动漫风抽象可视化(无真人、无文字)。

整体动线:[开场端坐于面诊桌前自然引入主题,中段起身缓步走向产品陈列架、边走边说,
结尾保持站立、抬手手势收束];说话间以自然手势比划、轻微点头等真实肢体动作呈现。

镜头语言:[开场中近景极轻微横摇,人物走动时跟随拍摄,讲到核心点时缓慢推近,结尾缓慢拉远收束];
整体手持微晃保留真实手机拍摄质感。

语气与节奏:她自然亲和地讲解,像真人面对面聊天一样有温度有起伏——问句好奇上扬、肯定句沉稳、
列举句轻快有层次、收束句温和坚定;整体语速比自然对话放慢约一半、从容舒缓,让内容自然撑满约[30s],
句与句之间留约[0.5s]自然气口,不赶。

声音:原生清晰女声普通话对白(音色参考随附音频)、轻微环境音、无背景音乐;
口播须有自然语调起伏与停顿,禁止平淡匀速念稿。

硬性约束:口播须严格限于下列分镜台词,禁止添加、删改或自由发挥任何文案之外的语句、语气词;
插画仅以局部形式出现(圆形/圆角画中画),禁止全屏覆盖;绝对禁止出现字幕、任何画面文字、
卡通化人物、塑料皮肤、变脸、服装漂移、场景跳变、或其他清晰正脸人物抢镜。

结构说明:以下「Shot序号 + 时间戳 + 分镜内容」为本片分镜脚本;Shot序号与时间戳是给模型的
节奏结构指令,不是台词,禁止当作语音读出;也禁止在任意空白时段补加台词或语气词。

【分镜脚本】
Shot 1 [0-4s]:[开场中近景,女美容师端坐面诊桌前,手持微晃手机质感,镜头极轻微横摇];
她好奇上扬地提问{[第四节·口播句1]},句末留自然气口。

Shot 2 [4-7.5s]:[仍端坐,中近景];她自然沉稳肯定{[口播句2,含防错替换:定期→订期]},语气笃定、不赶。

Shot 3 [7.5-12.5s]:[她起身缓步走向产品陈列架、边走边说,镜头跟随拍摄];列举句轻快有层次{[口播句3]}。

Shot 4 [12.5-19.5s]:[走到陈列架前站立,讲到核心点时镜头缓慢推近;此处画面右侧嵌入圆形画中画
展示插画参考1(抽象可视化,无真人无文字,禁全屏)]。该句放慢加重带警示,讲到「[核心重音点]」时
稍作重音并留自然停顿{[口播句4]}。

Shot 5 [19.5-26s]:[切换为画面侧边圆角区域画中画展示插画参考2(同风格,不铺满整屏)];她自然亲和{[口播句5]}。

Shot 6 [26-30s]:[结尾缓慢拉远收束,她保持站立、抬手手势收束,中近景];收束句温和坚定{[口播句6]},留足停顿感。

六、保留分析(Retention,一致性)

  • 人物:与 Image 1(确认的人物完整形象照)同脸 / 同发型 / 同年龄感 / 同制服(胸牌尤甚),全片不变。
  • 场景:门店前台(含怡呵美 LOGO)与 Image 2 一致,光线方向一致。
  • 音色:同一 Audio 1 音色。
  • 插画风格:与 Image 3 / Image 4 一致(抽象可视化)。

七、硬性禁令(Hard Bans,优先级最高)

  • 绝对禁止字幕、标题、Logo、品牌字样、任何可读或不可读文字(用户指定 LOGO 视觉露出除外)。
  • 绝对禁止把口播文字转化为屏幕文字;对白只通过人物声音表达。
  • 禁止人物变脸 / 换人 / 服装漂移(胸牌尤甚)/ 场景跳变 / 卡通化 / 塑料皮肤 / 夸张嘴型。
  • 抽象画面禁止真实血液、伤口、恐怖皮肤、医学 UI、文字、箭头、图例。
  • 人物皮肤、脸部、颈部、手臂与服装表面禁止任何 Logo、文字、字母、数字、纹身字样、标签、水印(胸牌为指定样式,不含额外文字)。
  • 全片真实拍摄质感,不生成失真或 AI 痕迹过重画面。
  • 插画内禁止出现任何人物 / 人形轮廓 / 手势 / 人影(红线,避免与口播真人并置成"两个主角";插画只画机理示意 / 物品 / 皮肤特写 / 光线氛围)。
  • 口播逐字红线:口播 = 且仅为确认后的台词文本,逐字一字不差;prompt 其他文字(章节标题 / 表格表头 / 规格标注 / 结构说明)一律不出声;禁止增加任何字词(语气词、口头语、英文、总结句)或据画面/主题自行补词(如"做好防晒"后追"干皮")。
  • 背景一致性:人物未走位时背景禁止漂移成其他房间;人物真实经过的过渡空间(如走廊)必须传对应实景 reference_image,仅靠俯瞰图 + 文字描述会脑补出"幽灵硬件"。

八、AI 口令(wan3 请求,含参考物料引用)

组装为 scripts/generate_video.py 的实际调用参数。提交的是第三节确认后的物料。

命令(在任务文件夹 beauty-video-materials/<任务短名>/ 内执行,或直接用绝对路径):

export DASHSCOPE_API_KEY="sk-xxx"
python scripts/generate_video.py \
  --config scripts/config.json \
  --prompt "$(cat prompt.txt)" \
  --media \
    人物_完整形象照.png:reference_image \
    门店_内景_采用.png:reference_image \
    插画/插画_参考1.png:reference_image \
    插画/插画_参考2.png:reference_image \
    "https://cdn.x/voice_ref.mp3:reference_audio" \
  --duration 30 --ratio 9:16 --resolution 720P \
  --output 成片_<主题>.mp4

说明:--prompt 直接读本任务文件夹的 prompt.txt(Step 8 写出);--media 引用本任务文件夹内的人物形象照 / 门店内景 / 插画,--output 指向同文件夹成片路径(脚本已自动创建父目录,无需手动 mkdir)。音色 voice_ref 走 config.brand_assets 固定 URL 透传,不进文件夹。

等价于请求体(JSON):

{
  "model": "wan3.0-video",
  "input": {
    "prompt": "[第五节整段 prompt]",
    "media": [
      {"type": "reference_image", "url": "<人物_完整形象照 上传URL>"},
      {"type": "reference_image", "url": "<门店_内景_采用 上传URL>"},
      {"type": "reference_image", "url": "<插画_参考1 上传URL>"},
      {"type": "reference_image", "url": "<插画_参考2 上传URL>"},
      {"type": "reference_audio", "url": "<voice_ref URL 或 上传URL>"}
    ]
  },
  "parameters": {"resolution": "720P", "ratio": "9:16", "duration": 30, "audio": true, "prompt_extend": false, "watermark": false}
}

修改任何元素都整段重发本请求(不用 wan3 编辑/延长),见技能第 9 步。