|
|
@@ -108,11 +108,11 @@ agent_created: true
|
|
|
|
|
|
展示后请用户**逐类挑选/确认**;若用户**未做任何选择** → 系统**自动随机指定**一组(记录"已自动随机指定")继续。确认后的物料(人物形象照/插画)与选取的门店实景图登记进脚本「物料清单」。
|
|
|
|
|
|
-### Step 5 — 处理口播文案(转口语化 + 30 秒硬卡)
|
|
|
+### Step 5 — 处理口播文案(转口语化 + 时长软卡 ≤30s)
|
|
|
|
|
|
- **用户自带内容/口播** → 转换为口语化、适合口播的文案(自然亲和、带 `/` `//` 停顿符号、科普准确)。
|
|
|
- **用户只给选题/知识点** → 技能生成口语化口播文案。
|
|
|
-- **30 秒硬卡循环**:按"30 秒 ≈ 90–110 字"估算字数;若 >110 字 → **反馈用户精简,等用户回精简版后重新估算**,循环直到 ≤110 字(对应 ≤30 秒,预留停顿余量、避免语速赶)才继续。绝不为凑时长拆分片段。
|
|
|
+- **时长软卡循环(不固定 30 秒,但 ≤30 秒)**:按"每秒 ≈ 3–3.7 字(放慢语速 + 句间气口)"估算台词所需时长;若预计 >30 秒 → **反馈用户精简,等用户回精简版后重新估算**,循环直到预计 ≤30 秒才继续。绝不为凑时长拆分片段。最终的精确总时长 T 由 Step 8 的 Shot 台词时间分配表求和得出(见 Step 8 第 5 点)。
|
|
|
- ⚠️ **口播红线**:组装 prompt 时须内联完整「口播定本」作唯一台词依据,并显式禁止 TTS 据画面/主题自行补词(句间/句末幻觉加词,如"做好防晒"后补"干皮");prompt 其他文字(标题/表头/规格标注)一律不出声。详见 `wan3-workflow.md` 坑5。
|
|
|
|
|
|
### Step 6 — 确认口播文案 + 敏感词/合规检测(定稿后必跑)
|
|
|
@@ -139,18 +139,19 @@ agent_created: true
|
|
|
- 该插入点直接决定 Step 8 单段 Prompt 中"画面融入插画"的时机,必须显式写进 prompt。
|
|
|
- ⚠️ **插画禁人物红线**:生成插画参考图时必须显式要求"画面中严禁出现任何完整人物、人形轮廓、手势或人影"——否则插画里的人物会与口播真人并置成"两个主角"(见 `wan3-workflow.md` 坑7)。插画只画机理示意 / 物品 / 皮肤特写 / 光线氛围。
|
|
|
|
|
|
-### Step 8 — 组装单段 30 秒脚本(编导分镜级)
|
|
|
+### Step 8 — 组装单段脚本(编导分镜级,时长由 Shot 表算出)
|
|
|
|
|
|
用 `assets/script-template.md` 填充,产出**单份结构化 Markdown**:
|
|
|
-一、角色定义 → 二、固定品牌素材 → 三、自动生成素材 → 四、口播文案(口语化,字数校验)→ **四-补、插画插入点** → 五、单段视频 Prompt(整段 ≤30 秒,**官方公式版**:总体描述 + Shot序号 + 时间戳 + 分镜内容,时间戳英文 `Shot N [x-y s]`、台词 `{}` 圈出;**prompt 中禁止写 Image N/Audio N**)→ 六、保留分析 → 七、硬性禁令 → 八、AI 口令(wan3 请求:命令 + JSON)。
|
|
|
+一、角色定义 → 二、固定品牌素材 → 三、自动生成素材 → 四、口播文案(口语化,字数校验)→ **四-补、插画插入点** → 五、单段视频 Prompt(整段 [T] 秒、T 由 Shot 台词时间分配表求和得出且 ≤30,**官方公式版**:总体描述 + Shot序号 + 时间戳 + 分镜内容,时间戳英文 `Shot N [x-y s]`、台词 `{}` 圈出;**prompt 中禁止写 Image N/Audio N**)→ 六、保留分析 → 七、硬性禁令 → 八、AI 口令(wan3 请求:命令 + JSON)。
|
|
|
- **落盘**:组装完成后,将脚本写入**本任务文件夹** `脚本_<主题>.md`;并把第五节整段 prompt 单独写出到本任务文件夹 `prompt.txt`(供 Step 10 直接 `--prompt "$(cat .../prompt.txt)"` 读取)。
|
|
|
- 第五节单段 Prompt **必须按 `wan3-workflow.md` 第四节「编导分镜版」范式写**,像专业编导一样覆盖四块:
|
|
|
- 1. **人物行为动线**(元素 25):30 秒单段内 **≤2 个动作切换**,且方向不反向("走动→落座"则落座后不再起身;"坐姿→起身走动"则走动后不再落座);**口播时不设计"整理产品"等手部摆弄动作**,手部只用自然手势 / 点头;全程在门店场景里与场景互动,**绝不全程正对镜头站桩**。
|
|
|
+ 1. **人物行为动线**(元素 25):单段(≤30 秒)内 **≤2 个动作切换**,且方向不反向("走动→落座"则落座后不再起身;"坐姿→起身走动"则走动后不再落座);**口播时不设计"整理产品"等手部摆弄动作**,手部只用自然手势 / 点头;全程在门店场景里与场景互动,**绝不全程正对镜头站桩**。
|
|
|
- 动线须在脚本第五节以 **【动线设计规划】表**逐 Shot 拆解(姿态/走位、手势/肢体、场景互动点),与下方分镜脚本一一对应,落实"≤2 动作切换、不反向、不站桩"。
|
|
|
2. **运镜组合**(元素 12):每条约 2–3 种手法按时间轴穿插(跟随 / 推近 / 拉远 / 横移 / 手持微晃),随机组合、不全程单一机位。
|
|
|
3. **插画展示方式**(元素 26):在「插画插入点」处触发,插画以**画中画**形式呈现——**形状随机选用正方形或圆形**,单个插图**宽度 ≤ 画面宽度的 1/2、高度等比**,可置于**画面任意位置但不遮挡人物面部**,**禁止全屏铺盖 / 人物画中画式全屏**(用户 2026-09-17 硬性规则 + 2026-09-22 尺寸约束补充);同一视频多次出现可轮换形状 / 位置,不固化一种。
|
|
|
4. **门店丰富元素**(元素 27):在门店场景里随机点缀 2–3 个道具 / 人物(前台 / 美容床 / 沙发 / 桌椅 / 其他店员虚化走过),增加景深与真实感。
|
|
|
- 5. **背景逐段锚定**(元素 22 / 门店空间索引):每个 Shot 必须绑定对应 zone 参考图的元素清单(如门厅:品牌墙 + 吊灯 + 白门 + 圆几绿植 + 白沙发;产品区:怡呵美发光字展柜 + 灯带层板 + 绿植),并在硬规则写"人物未走位时背景禁止漂移成其他房间";人物真实经过的过渡空间(如走廊)**必须传对应实景图**,仅靠俯瞰图 + 文字会脑补"幽灵硬件"(见 `wan3-workflow.md` 坑4 与 `references/store-spatial-index.md`,实景图在 `assets/store-spatial-index/`)。
|
|
|
+ 5. **时长由 Shot 表算出(不写死 30 秒)**:先规划第五节【动线设计规划】表的「时间」列(每 Shot 绑定对应台词句数与时长,按台词内容分配),**求和得到预计总时长 T**;T 即本段 `duration`。把 T 同步写入三处:① 总体描述「让内容自然撑满约[T秒]」② 分镜脚本时间戳 0→T 连续铺满、末段结束于 T ③ `--duration T` 与 JSON `duration`。T 必须 ≤30,超限回 Step 5 精简口播。
|
|
|
+ 6. **背景逐段锚定**(元素 22 / 门店空间索引):每个 Shot 必须绑定对应 zone 参考图的元素清单(如门厅:品牌墙 + 吊灯 + 白门 + 圆几绿植 + 白沙发;产品区:怡呵美发光字展柜 + 灯带层板 + 绿植),并在硬规则写"人物未走位时背景禁止漂移成其他房间";人物真实经过的过渡空间(如走廊)**必须传对应实景图**,仅靠俯瞰图 + 文字会脑补"幽灵硬件"(见 `wan3-workflow.md` 坑4 与 `references/store-spatial-index.md`,实景图在 `assets/store-spatial-index/`)。
|
|
|
- 口播台词用 `{}` 圈出、逐句写进各 Shot 的「分镜内容」;在讲对口白前**加入语气/节奏指令**(见 `wan3-workflow.md` 第四节:疑问/转折处语调上扬、核心点重音与停顿、整体松弛有起伏、禁止机械平读),缓解 wan3 原生 TTS 语气偏平的问题;在「插画插入点」指定句处明确写"讲到[第 N 句:原文]时,画面以[某展示方式]融入插画风格的抽象可视化";音色用自然语言描述"随附音频作音色参考",**不写 Audio 1**。**⚠️ prompt 文本里绝不出现 `Image N`/`Audio N`**(会被 wan3 当对白念出,详见 `wan3-workflow.md` 第一节/第七节)。
|
|
|
- 引用的是**确认后的生成物料**(仅内部对应 media 数组顺序,prompt 中不写 Image N/Audio N):人物完整形象照、门店空间实景图(按动线 zone 选取,LOGO 随实景自然呈现)、插画;门店场景直接取自资源包实景图,无需合成 LOGO。
|
|
|
|
|
|
@@ -177,7 +178,7 @@ agent_created: true
|
|
|
- **固定 3 项永远锁定(作生成输入)**:人物五视角/制服细节/音色来自素材包(`assets/brand/`)或公网 URL(`config.brand_assets`),不可被自动生成覆盖;制服胸牌样式绝对不可变。
|
|
|
- **提交的是确认后的生成物料**:wan3 实际接收 Image 1=人物完整形象照、Image 2=门店空间实景图(按动线 zone 选取)、Image 3/4=插画、Audio 1=音色;原始 3 项固定素材仅用于生成人物完整形象照,不直接提交;门店实景图直接取自资源包。
|
|
|
- **风格先确认后出图**:发起任务先文字版问风格,再生成「人物完整形象照 + 插画」示例图供确认;门店场景直接采用门店空间索引实景图,无需生成示例。
|
|
|
-- **单片段 ≤30 秒**:口播超 110 字必须反馈精简、循环直到满足;不拆分片段。
|
|
|
+- **单片段 ≤30 秒**:口播预计超 30 秒必须反馈精简、循环直到满足;不拆分片段(最终 T 由 Step 8 Shot 表求和确认)。
|
|
|
- **LOGO 随实景自然呈现**:门店 LOGO 不另行生成,随选取的门店空间实景图(品牌墙 Z01「YIHEMEI 你的水光肌肤管理师」/ 发光字展柜 Z02 等)自然出现在成片;动线主场景若途经含 LOGO 的 zone,LOGO 即在画面中。
|
|
|
- **动线规划最先确定**:人物出场场景由动线规划决定,不固定前台;动线规划须于 Step 4 选取实景图前先行确定(见 Step 4 前置说明),并填入脚本第五节【动线设计规划】表(含场景 zone 列),门店实景图据此按对应 zone 选取。
|
|
|
- **原生音视频**:口播写进 prompt 作对白,音色作 reference_audio,wan3 一次性生成画面+对白+口型+环境音。
|