--- name: beauty-talk-science-video-script description: 生成「美业口播科普视频脚本」并直出视频的通用技能。面向阿里云百炼 wan3(万相3.0)文生/参考生视频,把选题/人设/画幅/时长/场景/服装/造型/画质/穿插/字幕/配乐等元素参数化;人物五视角图、制服细节图、音色三项固定素材来自技能素材包(assets/brand/)或公网URL(config.brand_assets)并锁定作生成输入;据其生成人物完整形象照、插画供用户确认,门店场景直接采用门店空间索引实景图(按动线 zone 选取),确认后的物料作为参考图提交 wan3;口播转为口语化(更白话、适当加语气词、不大幅增字,并规避违禁词);整段视频一个片段、≤30秒;确认后调用 scripts/generate_video.py 提交 wan3 异步任务、轮询、下载本地;修改即整段重发(不支持二次创作)。 agent_created: true --- # 美业口播科普视频脚本生成技能(百炼 wan3 直出版) ## Overview 面向**阿里云百炼 · 万相 3.0(wan3.0-video)**,把"美业口播科普短视频"从零散需求沉淀为一份**带固定素材、可直接调用 wan3 生成视频**的结构化脚本。核心约束来自用户硬性要求: 1. **人物**必须用指定的(素材包 `assets/brand/character_5view.*` 或公网 URL `config.brand_assets.character_5view.url`)人物五视角图(固定锁定)。 2. **制服**必须参考指定的(素材包或 URL)制服细节图(可换款式/颜色,**胸牌绝对不变**)。 3. **门店场景**必须采用门店空间索引实景图(按动线规划从 `assets/store-spatial-index/` 选取对应 zone 照片作参考图),怡呵美 LOGO 随实景图(品牌墙/发光字展柜)自然呈现,不另行生成含 LOGO 的门店图。 4. **音色**必须用指定的(素材包或 URL)音色文件作 reference_audio。 5. 口播文案由用户内容**转换为口语化适合口播**的文案(更白话、适当加语气词、不大幅增字,并规避违禁词)。 6. 整段视频**一个片段、≤30 秒**;超 30 秒则反馈用户精简、循环直到满足。 7. 确认后调用 **百炼 wan3 API** 发起生成、轮询完成、存储本地、给用户确认。 8. **不支持二次创作**:每次修改都重新组装完整脚本重发 wan3(不用编辑/延长模式)。 ## 跨团队复用说明 - 技能**品牌/人设/视频工具三层解耦**:可变项参数化在 `references/elements.md`;固定品牌素材放在 `assets/brand/`(本地兜底)或 `scripts/config.json` 的 `brand_assets` 段(公网 URL,推荐);视频工具锁定百炼 wan3,工程要点全在 `references/wan3-workflow.md`。 - **分发**:本技能为「暨北内部 - 朵朵」专用锁定版,OSS 素材 URL、百炼 base_url、workspace_id 均已固定在 `scripts/config.json`;其他同事把 git 仓库 clone 到 `~/.workbuddy/skills/beauty-talk-science-video-duoduo/`(个人级)或项目 `.workbuddy/skills/`(团队级),**复制 `.env.example` 为 `.env` 填入自己的 `DASHSCOPE_API_KEY`** 即可启用,无需改任何配置。详见 `docs/暨北内部-朵朵口播视频专用技能.md`。 ## 凭证准备(首次运行前必做) 百炼 wan3 视频生成需要 **北京地域的 DashScope / 百炼 API Key**(以 `sk-` 开头)。你之前看到的 `sk-xxx` 只是占位符,必须替换成在控制台创建的**真实 Key**。操作如下: 1. **获取真实 Key**:登录阿里云百炼控制台([Model Studio](https://bailian.console.aliyun.com) 或 [DashScope 控制台](https://dashscope.console.aliyun.com))→ 右上角头像 → **API Key 管理 / API-KEY** → 切换地域到 **北京(cn-beijing)** → **创建 API Key**(权限选"全部",归属工作空间默认)→ 复制 `sk-` 开头的串(只显示一次,立即保存)。 - ⚠️ 每个地域的 Key 独立、不能跨地域使用;你的工作空间在 `cn-beijing`,**必须创建北京地域的 Key**,否则调用直接失败。 2. **填入 Key(脚本自动识别,二选一)**: - 方式 A(单次,推荐调试):运行生成脚本的命令前加前缀,例如 `DASHSCOPE_API_KEY=sk-真实key python scripts/generate_video.py ...`(仅本次进程生效,适合 WorkBuddy 终端环境)。 - 方式 B(持久):复制 `scripts/.env.example` 为 `scripts/.env`,写入一行 `DASHSCOPE_API_KEY=sk-真实key`;脚本优先读环境变量、其次读 `.env`。 - ⚠️ `.env` 含密钥,**严禁提交 git 或随技能 zip 分发**;重新打包技能前请删除本地 `.env`。 3. **确认地域一致**:`config.json` 的 `region=cn-beijing` 与 Key 地域必须一致,`workspace_id=gxuwdo0w0g13zbax` 已填好。 ## 何时使用 - "帮我做一条美业口播视频(给 wan3/百炼)" / "出个护肤科普短视频脚本并生成" - 用户上传/指定人物五视角图、制服细节图、音色,或要求生成可直出的视频脚本与物料(门店场景直接采用门店空间索引实景图) ## 资源引用 - `references/elements.md` — 全部可参数化元素与可选项(含门店风格/插画风格/整体色调)。 - `references/wan3-workflow.md` — 百炼 wan3 端点/鉴权/参考映射/单段 prompt 范式/LOGO 合成/不二次创作。 - `references/asset-collection.md` — 固定 3 项素材包清单 + 自动生成人物/插画确认 + 门店空间实景图选取 + 物料登记 + wan3 映射。 - `references/store-spatial-index.md` — 门店空间索引与空间锚定硬规则(Z01–Z09 可用区 / U01–U03 禁用区 / 常用映射 / V4 开放公共区关系 / 6 条空间锚定硬规则);配套实景图在 `assets/store-spatial-index/`。 - `assets/script-template.md` — 单段结构化 Markdown 脚本骨架(含物料清单与 wan3 请求段),填充后即为交付物。 - `scripts/generate_video.py` — 解析素材(公网URL直传 / 本地图base64直传)→建任务→轮询→下载本地。 - `scripts/config.json` — region / workspace_id / model / resolution / ratio / output_dir(密钥走环境变量)。 ## 执行流程 ### 任务产物目录约定(每次任务独立归档) 每个任务在 Step 1 收集输入后,即**新建一个独立文件夹**存放该任务全部产物,避免跨任务文件混杂、便于交付与回看。约定如下: - **基础目录**:工作区内 `beauty-video-materials/`(与技能目录分离,纯产物区)。 - **任务文件夹**:`beauty-video-materials/<任务短名>/`,`<任务短名>` 由选题/主题派生(如 `敏感肌功效型护肤品`、`贵产品无效`),去除特殊字符与空格。 - **自包含**:本任务实际用到的参考图(人物完整形象照、门店空间实景图、插画)也复制进该文件夹,使文件夹独立可交付、可归档(复用上次的素材则复制一份进来)。 - **标准结构**: ``` beauty-video-materials/<任务短名>/ ├── 脚本_<主题>.md # Step 8/9 交付的结构化脚本 ├── prompt.txt # 提交 wan3 的纯文本 prompt(Step 8 写出) ├── 成片_<主题>.mp4 # Step 10 下载的视频成片 ├── 人物_完整形象照.png # Image 1(本任务生成或复用复制) ├── 门店_实景_Z0X.png # Image 2(门店空间索引实景图,按动线 zone 选取,LOGO 随实景自然呈现) └── 插画/ ├── 插画_参考1.png # Image 3 └── 插画_参考2.png # Image 4 ``` - 后续 `--media` / `--output` 一律引用本任务文件夹内路径;生成脚本 `generate_video.py` 已支持**自动创建输出父目录**,传任务文件夹路径无需手动 mkdir。 ### Step 1 — 收集基础输入(提示词优先,缺失交互补全) 1. 解析用户提示词,提取已指定元素:选题/口播素材、画幅、平台、人设、目标人群、场景、机位、运镜、造型、画质、穿插类型、字幕、配乐、情绪、品牌露出、门店/插画/色调风格、自带素材包路径。 2. 对照 `references/elements.md`,将**未指定**的基础元素用一次交互式问答(AskUserQuestion,批量提问,每题给可选项+默认标注)补全;具体值不在可选项内时以用户值为准。 ### Step 2 — 文字版风格问卷(流程最前端) 生成任何图之前,用一次交互式问答询问用户对以下**元素风格**的文字偏好(选项见 `references/elements.md`): - 门店/场景风格(元素 22)|插画风格(元素 23)|整体色调(元素 24)|画质质感(元素 15)|情绪基调(元素 20) - 用户逐条给出 → 后续按这些风格自动生成物料图。 - 用户答"无特别要求/你定" → 进入**自动模式**,按默认风格生成示例图,让用户在看图时再挑(见 Step 4)。 ### Step 3 — 锁定固定品牌素材(URL 优先,本地文件兜底,校验存在) 按 `references/asset-collection.md` 第一节,逐项解析并校验 3 个固定素材(**它们在本流程中是"生成输入",用于生成最终确认物料,默认不直接提交 wan3**): - 每项优先读 `scripts/config.json` 的 `brand_assets..url`(公网 URL,调用 wan3 时固定素材可直接透传);若留空则回退读取 `assets/brand/` 本地文件。 - 人物五视角(`character_5view`)、制服细节(`uniform_detail`)、音色(`voice_ref`,≤15s)。 - **每项都必须有来源(URL 或本地文件),二者皆无 → 主动提示用户填 URL 或放文件,不进入后续生成**。 - 锁定后:人物五视角 + 制服细节用于生成「人物完整形象照」、音色直接作 Audio 1;门店场景直接采用门店空间索引实景图(按动线 zone 选取),不另行生成;胸牌样式在锁定时即标注"不可变更"。 ### Step 4 — 生成最终确认物料(人物形象照 + 插画)并选取门店实景图 **产物落盘**:本步生成的两类物料保存到**本任务的 `<任务短名>/` 文件夹**——人物完整形象照放根目录;插画放 `插画/` 子目录;门店空间实景图(按动线 zone 从资源包选取)另存 `门店实景/` 子目录;便于后续统一引用与归档。若人物沿用上次已确认物料,复制一份进本任务文件夹保持自包含。 > ⚠️ **动线规划须最先确定(本步选取实景图的前置)**:**设计动线前,必须先阅读 `assets/store-spatial-index/` 下的《空间索引.json》与《00_俯瞰图_修订_带布局编号V4.jpeg》,理解店内整体布局(各 zone 相对位置、连通关系、哪些区可步行串联)**;在选取门店实景图前,先依选题/口播主题与 `references/store-spatial-index.md`(Z01–Z09 可用区)规划本片动线——列出本片**出场/经过的 zone、开场 zone、走位 zone、插画所在 zone**;**人物出场场景由动线规划决定,不再固定前台**。随后按动线涉及的 zone 从 `assets/store-spatial-index/` 选取对应实景图(LOGO 随实景图自然呈现,不另行生成含 LOGO 门店图);**动线长度(跨越 zone 数与步行距离)与人物走动速度须与总时长 T 匹配,切忌走太快或动线太长(避免瞬移式跨区 / 赶场感)**。该动线规划在 Step 8 组装时填入脚本第五节【动线设计规划】表。 按 `references/asset-collection.md` 第二节,用图像生成工具基于锁定素材生成并展示,请用户确认后才作为 wan3 参考图: 1. **人物完整形象照 — 1 张(可生成 2–3 张供选)**:以 `character_5view` 为人物参考、`uniform_detail` 为制服参考,合成「人物身穿制服的完整形象照」;胸牌样式与 `uniform_detail` 完全一致、不可变更。→ 确认后作为 **Image 1**。 2. **门店空间实景图(按动线规划 zone 选取)**:从 `assets/store-spatial-index/` 按动线规划涉及的 zone(如开场 zone = 产品陈列架 Z02 / 洽谈区 Z04 / 前台 Z03…)选取对应门店实景照片,作为 **Image 2**(场景参考图);怡呵美 LOGO 随实景图(品牌墙 Z01 / 发光字展柜 Z02 等)自然呈现,无需单独生成。多 zone 动线可选取多张分别作为各段背景参考。 3. **内容插入插画参考图 — 2 张**(抽象可视化风格启发,无真人皮肤/血液/文字)→ **Image 3 / Image 4**。 展示后请用户**逐类挑选/确认**;若用户**未做任何选择** → 系统**自动随机指定**一组(记录"已自动随机指定")继续。确认后的物料(人物形象照/插画)与选取的门店实景图登记进脚本「物料清单」。 ### Step 5 — 处理口播文案(转口语化 + 时长软卡 ≤30s) - **用户自带内容/口播** → 先做合规转换:① 规避/修改违禁词(敏感词检测见 Step 6,先扫后改);② **优化得更口语化、白话**——把书面表达改成日常说话的样子,**适当增加语气词**(如「咱 / 姐妹们 / 其实 / 说真的 / 啊 / 吧 / 嘛 / 呢」)让口播更自然亲切;③ **不要大幅增加字数**——以原稿为底、同义改写 / 补语气词为主,不另起长句、不堆词。转换后带 `/` `//` 停顿符号、科普准确、自然亲和。(注:语气词写进「口播定本」本身;下方口播逐字红线要求 wan3 逐字读出定本、不得自行加词,二者不冲突——语气词是定本的一部分,不是生成时临加的。) - **用户只给选题/知识点** → 技能生成口语化口播文案。 - **时长软卡循环(不固定 30 秒,但 ≤30 秒)**:按"每秒 ≈ 3–3.7 字(放慢语速 + 句间气口)"估算台词所需时长;若预计 >30 秒 → **反馈用户精简,等用户回精简版后重新估算**,循环直到预计 ≤30 秒才继续。绝不为凑时长拆分片段。最终的精确总时长 T 由 Step 8 的 Shot 台词时间分配表求和得出(见 Step 8 第 5 点)。 - ⚠️ **口播红线**:组装 prompt 时须内联完整「口播定本」作唯一台词依据,并显式禁止 TTS 据画面/主题自行补词(句间/句末幻觉加词,如"做好防晒"后补"干皮");prompt 其他文字(标题/表头/规格标注)一律不出声。详见 `wan3-workflow.md` 坑5。 ### Step 6 — 确认口播文案 + 敏感词/合规检测(定稿后必跑) - 把 Step 5 产出的口语化口播文案(含字数校验)**单独呈现**给用户,请用户确认或修订。 - **用户确认后,自动跑敏感词/合规检测(每次确定文案都必须执行)**: - 先用 `scripts/compliance_scan.py` 对口播全文做机器初筛; - 再对照 `references/compliance-check.md` 人工复核(否定语境同样违规、灰色地带标「建议咨询法律顾问」),生成「敏感词/合规检测报告」(风险等级 🔴🟠🟡🟢 + 法规依据 + 合规替换 + 结论)。 - **把报告呈现给用户,用户二选一**: ① **按建议改** → 采纳合规替换,回到 Step 5 重出口播; ② **自己改** → 用户手改后再次检测; 循环直到结论为「通过 / 修改后通过(中·低)」且**无 🔴 极高、无 🟠 高**违规,才进入 Step 7。 - **存在 🔴/🟠 不得进入后续组装与生成**(合规优先级最高,与第七节硬性禁令协同);检测结论写入脚本「四-补、合规检测」字段留痕。 - 此步确保「口播文案已确定」,是 Step 7 插画插入点确认的两大前置之一(另一前置是 Step 4 已确认插画)。 ### Step 7 — 确定插画插入点(插画 + 口播都确认后) - **前置**:Step 4 已确认插画(Image 3/4)、Step 6 已确认口播文案。两者缺一不进本步。 - **请用户确定:插画(抽象可视化)从口播文案的哪一句话开始融入画面作为起始点。** 1. 把已确认的口播文案按停顿(`/` 短停、`//` 长停)切分为带编号的分句,逐句列出(① / ② / ③ …)供用户点选。 2. 询问用户:插画从哪一句开始?(若有多张插画 Image 3 / Image 4,可一并确认各自对应哪一句;默认从同一句起连续融入)。 3. 用户选定第 N 句 → 记录「插画起始句:第 N 句「原文」」写入脚本「插画插入点」字段(见 `assets/script-template.md` 第四节补)。 4. 用户无偏好 → 系统按语义建议一个起始句(通常选「讲到核心知识点那句」),标注"已自动建议"并请用户最终确认,**不默认静默落定**。 - 该插入点直接决定 Step 8 单段 Prompt 中"画面融入插画"的时机,必须显式写进 prompt。 - ⚠️ **插画禁人物红线**:生成插画参考图时必须显式要求"画面中严禁出现任何完整人物、人形轮廓、手势或人影"——否则插画里的人物会与口播真人并置成"两个主角"(见 `wan3-workflow.md` 坑7)。插画只画机理示意 / 物品 / 皮肤特写 / 光线氛围。 ### Step 8 — 组装单段脚本(编导分镜级,时长由 Shot 表算出) 用 `assets/script-template.md` 填充,产出**单份结构化 Markdown**: 一、角色定义 → 二、固定品牌素材 → 三、自动生成素材 → 四、口播文案(口语化,字数校验)→ **四-补、插画插入点** → 五、单段视频 Prompt(整段 [T] 秒、T 由 Shot 台词时间分配表求和得出且 ≤30,**官方公式版**:总体描述 + Shot序号 + 时间戳 + 分镜内容,时间戳英文 `Shot N [x-y s]`、台词 `{}` 圈出;**prompt 中禁止写 Image N/Audio N**)→ 六、保留分析 → 七、硬性禁令 → 八、AI 口令(wan3 请求:命令 + JSON)。 - **落盘**:组装完成后,将脚本写入**本任务文件夹** `脚本_<主题>.md`;并把第五节整段 prompt 单独写出到本任务文件夹 `prompt.txt`(供 Step 10 直接 `--prompt "$(cat .../prompt.txt)"` 读取)。 - 第五节单段 Prompt **必须按 `wan3-workflow.md` 第四节「编导分镜版」范式写**,像专业编导一样覆盖四块: 1. **人物行为动线**(元素 25):单段(≤30 秒)内 **≤2 个动作切换**,且方向不反向("走动→落座"则落座后不再起身;"坐姿→起身走动"则走动后不再落座);**口播时不设计"整理产品"等手部摆弄动作**,手部只用自然手势 / 点头;全程在门店场景里与场景互动,**绝不全程正对镜头站桩**;动线须在先阅读《空间索引.json》+《00_俯瞰图_修订_带布局编号V4.jpeg》理解店内整体布局后设计,人物走动速度自然从容、不疾走,动线长度(跨 zone 数 / 步行距离)须与总时长 T 匹配,切忌走太快或动线过长(避免瞬移式跨区 / 赶场感)。 - 动线须在脚本第五节以 **【动线设计规划】表**逐 Shot 拆解(姿态/走位、手势/肢体、场景互动点),与下方分镜脚本一一对应,落实"≤2 动作切换、不反向、不站桩"。 2. **运镜组合**(元素 12):每条约 2–3 种手法按时间轴穿插(跟随 / 推近 / 拉远 / 横移 / 手持微晃),随机组合、不全程单一机位。 3. **插画展示方式**(元素 26):在「插画插入点」处触发,插画以**画中画**形式呈现——**形状随机选用正方形或圆形**,单个插图**宽度 ≤ 画面宽度的 1/2、高度等比**,可置于**画面任意位置但不遮挡人物面部**,**禁止全屏铺盖 / 人物画中画式全屏**(用户 2026-09-17 硬性规则 + 2026-09-22 尺寸约束补充);同一视频多次出现可轮换形状 / 位置,不固化一种。 4. **门店丰富元素**(元素 27):在门店场景里随机点缀 2–3 个道具 / 人物(前台 / 美容床 / 沙发 / 桌椅 / 其他店员虚化走过),增加景深与真实感。 5. **时长由 Shot 表算出(不写死 30 秒)**:先规划第五节【动线设计规划】表的「时间」列(每 Shot 绑定对应台词句数与时长,按台词内容分配),**求和得到预计总时长 T**;T 即本段 `duration`。把 T 同步写入三处:① 总体描述「让内容自然撑满约[T秒]」② 分镜脚本时间戳 0→T 连续铺满、末段结束于 T ③ `--duration T` 与 JSON `duration`。T 必须 ≤30,超限回 Step 5 精简口播。 6. **背景逐段锚定**(元素 22 / 门店空间索引):每个 Shot 必须绑定对应 zone 参考图的元素清单(如门厅:品牌墙 + 吊灯 + 白门 + 圆几绿植 + 白沙发;产品区:怡呵美发光字展柜 + 灯带层板 + 绿植),并在硬规则写"人物未走位时背景禁止漂移成其他房间";人物真实经过的过渡空间(如走廊)**必须传对应实景图**,仅靠俯瞰图 + 文字会脑补"幽灵硬件"(见 `wan3-workflow.md` 坑4 与 `references/store-spatial-index.md`,实景图在 `assets/store-spatial-index/`)。 - 口播台词用 `{}` 圈出、逐句写进各 Shot 的「分镜内容」;在讲对口白前**加入语气/节奏指令**(见 `wan3-workflow.md` 第四节:疑问/转折处语调上扬、核心点重音与停顿、整体松弛有起伏、禁止机械平读),缓解 wan3 原生 TTS 语气偏平的问题;在「插画插入点」指定句处明确写"讲到[第 N 句:原文]时,画面以[某展示方式]融入插画风格的抽象可视化";音色用自然语言描述"随附音频作音色参考",**不写 Audio 1**。**⚠️ prompt 文本里绝不出现 `Image N`/`Audio N`**(会被 wan3 当对白念出,详见 `wan3-workflow.md` 第一节/第七节)。 - 引用的是**确认后的生成物料**(仅内部对应 media 数组顺序,prompt 中不写 Image N/Audio N):人物完整形象照、门店空间实景图(按动线 zone 选取,LOGO 随实景自然呈现)、插画;门店场景直接取自资源包实景图,无需合成 LOGO。 ### Step 9 — 逐步确认后交付(贴合"逐步确认"习惯) 1. 呈现「已确定元素清单」+「口语化口播文案(含字数校验)」+「插画插入点:第 N 句」+「固定素材(URL/本地,生成输入)」+「确认的最终物料(人物完整形象照 / 门店空间实景图 / 插画)」+「单段 Prompt / wan3 请求」。请用户确认或修正。 2. 用户确认后,将完整脚本写入**本任务文件夹** `脚本_<主题>.md`(路径如 `beauty-video-materials/<任务短名>/脚本_<主题>.md`)并 present;参考物料图(人物/门店/插画)已在本任务文件夹内,一并随交付提供。 3. 确认无误后再进入 Step 10 实际调用 API(避免浪费生成额度)。 ### Step 10 — 调用百炼 wan3 生成视频 + 下载 + 确认 1. 确保 `DASHSCOPE_API_KEY` 环境变量(或同目录 `.env`)已设置;`scripts/config.json` 的 workspace_id / base_url / `brand_assets` URL 为固定预填(暨北内部朵朵专用),无需改动。 2. 执行 `scripts/generate_video.py`(参数见脚本模板第八节):提交**确认后的物料**(人物完整形象照 / 门店空间实景图 / 插画,本地图编码 base64 直传;音色 voice_ref 按 URL 直传或本地 base64 直传)→ 建任务 → 轮询 → 下载到**本任务文件夹** `成片_<主题>.mp4`;`--media` 引用本任务文件夹内的人物形象照/门店实景图/插画,`--output` 指向该文件夹成片路径(脚本已自动创建父目录)。 3. 捕获脚本 stdout 的 `VIDEO_PATH=...`,把生成的视频 present 给用户确认。 4. 若生成失败/不满意 → 回到 Step 8 修改脚本,整段重发(见 Step 11)。 ### Step 11 — 修改即整段重生成(不支持二次创作) - 任何元素变更(口播、服装颜色、场景、插画风格、**插画插入点**等)→ **重新组装完整脚本(Step 8)→ 重新确认(Step 9)→ 重新调用 wan3(Step 10)**。 - **严禁使用 wan3 的视频编辑/延长模式**(对应第 8 条)。每次都是一条全新的整段生成。 ## 关键约束(贯穿全程) - **固定 3 项永远锁定(作生成输入)**:人物五视角/制服细节/音色来自素材包(`assets/brand/`)或公网 URL(`config.brand_assets`),不可被自动生成覆盖;制服胸牌样式绝对不可变。 - **提交的是确认后的生成物料**:wan3 实际接收 Image 1=人物完整形象照、Image 2=门店空间实景图(按动线 zone 选取)、Image 3/4=插画、Audio 1=音色;原始 3 项固定素材仅用于生成人物完整形象照,不直接提交;门店实景图直接取自资源包。 - **风格先确认后出图**:发起任务先文字版问风格,再生成「人物完整形象照 + 插画」示例图供确认;门店场景直接采用门店空间索引实景图,无需生成示例。 - **单片段 ≤30 秒**:口播预计超 30 秒必须反馈精简、循环直到满足;不拆分片段(最终 T 由 Step 8 Shot 表求和确认)。 - **LOGO 随实景自然呈现**:门店 LOGO 不另行生成,随选取的门店空间实景图(品牌墙 Z01「YIHEMEI 你的水光肌肤管理师」/ 发光字展柜 Z02 等)自然出现在成片;动线主场景若途经含 LOGO 的 zone,LOGO 即在画面中。 - **动线规划最先确定**:人物出场场景由动线规划决定,不固定前台;**设计动线前必须先阅读 `assets/store-spatial-index/` 下的《空间索引.json》与《00_俯瞰图_修订_带布局编号V4.jpeg》理解店内整体布局**;动线规划须于 Step 4 选取实景图前先行确定(见 Step 4 前置说明),并填入脚本第五节【动线设计规划】表(含场景 zone 列),门店实景图据此按对应 zone 选取。 - **原生音视频**:口播写进 prompt 作对白,音色作 reference_audio,wan3 一次性生成画面+对白+口型+环境音。 - **插画插入点确认**:插画与口播文案都确认后,必须请用户指定插画从口播哪一句开始融入,再组装 prompt(见 Step 7);不静默默认。 - **编导分镜(不站桩)**:单段 Prompt 必须像专业编导覆盖五块——① 人物行为动线(按内容长短设计走动/坐/起/落座,不全程正对镜头)② 运镜组合(2–3 种随机穿插)③ 插画展示方式(正方形/圆形随机混用不固化、禁全屏)④ 门店丰富元素(前台/美容床/沙发/其他人物虚化走过随机点缀)⑤ **背景逐段锚定**(每个 Shot 绑定对应 zone 参考图元素清单,详见 `wan3-workflow.md` 坑4 与 `references/store-spatial-index.md`);详见 `wan3-workflow.md` 第四节与 `elements.md` 元素 12/25/26/27。 - **背景一致性硬约束**:人物未走位时背景禁止漂移成其他房间;人物真实经过的过渡空间(如走廊)必须传对应实景 reference_image(仅靠俯瞰图 + 文字会脑补"幽灵硬件",zone 实景图见 `assets/store-spatial-index/`);插画内容本身不得出现人物/人形(避免与真人并置成两个主角)。 - **口型对齐**由 wan3 原生完成,脚本只保证口播文案与停顿完整。 - **硬性禁令**优先级最高,必须写入脚本第七节,口播文字绝不转化为屏幕文字(LOGO 视觉露出除外)。 - **真实质感**:避免卡通化、塑料皮肤、夸张嘴型、场景跳变、AI 痕迹过重。