Forráskód Böngészése

feat(oral): 用户口播文案转换增强——除违禁词外,优化更口语白话、加语气词、不大幅增字

- SKILL/README/docs/elements/script-template 同步:用户自带口播除规避/修改违禁词外,还要优化得更口语化白话(书面改日常说话)、适当加语气词(咱/姐妹们/其实/啊/吧/嘛/呢)、不大幅增加字数(以原稿为底、同义改写/补语气词为主)
- SKILL Step5 用户自带 bullet 增补三步合规转换(扫违禁词→口语化+语气词→控字数)并注解语气词写进口播定本、与下方口播逐字红线不冲突
- elements.md 元素7 用户自带/技能生成两条路径均走『避违禁词+口语化白话+加语气词+不大幅增字』规则
- script-template 第四节标题与引言同步;项目 MEMORY.md 澄清『直接采用用户口播』=以底稿过 Step5 转换、非原样不改、非另写新稿;口播逐字红线注解语气词属定本允许读出
zhengqi 1 hete
szülő
commit
761a17d793

+ 1 - 1
README.md

@@ -13,7 +13,7 @@
 2. **制服**参考指定细节图(可换款式/颜色,**胸牌样式绝对不可变**)。
 3. **门店场景**必须采用门店空间索引实景图(按动线规划从资源包选取对应 zone 照片),怡呵美 LOGO 随实景自然呈现。
 4. **音色**必须用指定文件作 `reference_audio`。
-5. 口播文案由用户内容**转口语化**适合口播。
+5. 口播文案由用户内容**转口语化(更白话、适当加语气词、不大幅增字)+ 规避违禁词**适合口播。
 6. 整段视频**一个片段、≤30 秒**(时长不固定 30 秒,由 Shot 台词时间分配表求和得出 T 作为实际 duration;T 超限则反馈精简,循环直到满足;绝不拆片段)。
 7. 确认后调用**百炼 wan3** 生成、轮询、下载本地、交付确认。
 8. **不支持二次创作**:任何元素修改都重新组装完整脚本、整段重发 wan3(不用编辑/延长模式)。

+ 3 - 3
SKILL.md

@@ -1,6 +1,6 @@
 ---
 name: beauty-talk-science-video-script
-description: 生成「美业口播科普视频脚本」并直出视频的通用技能。面向阿里云百炼 wan3(万相3.0)文生/参考生视频,把选题/人设/画幅/时长/场景/服装/造型/画质/穿插/字幕/配乐等元素参数化;人物五视角图、制服细节图、音色三项固定素材来自技能素材包(assets/brand/)或公网URL(config.brand_assets)并锁定作生成输入;据其生成人物完整形象照、插画供用户确认,门店场景直接采用门店空间索引实景图(按动线 zone 选取),确认后的物料作为参考图提交 wan3;口播转为口语化;整段视频一个片段、≤30秒;确认后调用 scripts/generate_video.py 提交 wan3 异步任务、轮询、下载本地;修改即整段重发(不支持二次创作)。
+description: 生成「美业口播科普视频脚本」并直出视频的通用技能。面向阿里云百炼 wan3(万相3.0)文生/参考生视频,把选题/人设/画幅/时长/场景/服装/造型/画质/穿插/字幕/配乐等元素参数化;人物五视角图、制服细节图、音色三项固定素材来自技能素材包(assets/brand/)或公网URL(config.brand_assets)并锁定作生成输入;据其生成人物完整形象照、插画供用户确认,门店场景直接采用门店空间索引实景图(按动线 zone 选取),确认后的物料作为参考图提交 wan3;口播转为口语化(更白话、适当加语气词、不大幅增字,并规避违禁词);整段视频一个片段、≤30秒;确认后调用 scripts/generate_video.py 提交 wan3 异步任务、轮询、下载本地;修改即整段重发(不支持二次创作)。
 agent_created: true
 ---
 
@@ -14,7 +14,7 @@ agent_created: true
 2. **制服**必须参考指定的(素材包或 URL)制服细节图(可换款式/颜色,**胸牌绝对不变**)。
 3. **门店场景**必须采用门店空间索引实景图(按动线规划从 `assets/store-spatial-index/` 选取对应 zone 照片作参考图),怡呵美 LOGO 随实景图(品牌墙/发光字展柜)自然呈现,不另行生成含 LOGO 的门店图。
 4. **音色**必须用指定的(素材包或 URL)音色文件作 reference_audio。
-5. 口播文案由用户内容**转换为口语化适合口播**的文案。
+5. 口播文案由用户内容**转换为口语化适合口播**的文案(更白话、适当加语气词、不大幅增字,并规避违禁词)。
 6. 整段视频**一个片段、≤30 秒**;超 30 秒则反馈用户精简、循环直到满足。
 7. 确认后调用 **百炼 wan3 API** 发起生成、轮询完成、存储本地、给用户确认。
 8. **不支持二次创作**:每次修改都重新组装完整脚本重发 wan3(不用编辑/延长模式)。
@@ -110,7 +110,7 @@ agent_created: true
 
 ### Step 5 — 处理口播文案(转口语化 + 时长软卡 ≤30s)
 
-- **用户自带内容/口播** → 转换为口语化、适合口播的文案(自然亲和、带 `/` `//` 停顿符号、科普准确)。
+- **用户自带内容/口播** → 先做合规转换:① 规避/修改违禁词(敏感词检测见 Step 6,先扫后改);② **优化得更口语化、白话**——把书面表达改成日常说话的样子,**适当增加语气词**(如「咱 / 姐妹们 / 其实 / 说真的 / 啊 / 吧 / 嘛 / 呢」)让口播更自然亲切;③ **不要大幅增加字数**——以原稿为底、同义改写 / 补语气词为主,不另起长句、不堆词。转换后带 `/` `//` 停顿符号、科普准确、自然亲和。(注:语气词写进「口播定本」本身;下方口播逐字红线要求 wan3 逐字读出定本、不得自行加词,二者不冲突——语气词是定本的一部分,不是生成时临加的。)
 - **用户只给选题/知识点** → 技能生成口语化口播文案。
 - **时长软卡循环(不固定 30 秒,但 ≤30 秒)**:按"每秒 ≈ 3–3.7 字(放慢语速 + 句间气口)"估算台词所需时长;若预计 >30 秒 → **反馈用户精简,等用户回精简版后重新估算**,循环直到预计 ≤30 秒才继续。绝不为凑时长拆分片段。最终的精确总时长 T 由 Step 8 的 Shot 台词时间分配表求和得出(见 Step 8 第 5 点)。
   - ⚠️ **口播红线**:组装 prompt 时须内联完整「口播定本」作唯一台词依据,并显式禁止 TTS 据画面/主题自行补词(句间/句末幻觉加词,如"做好防晒"后补"干皮");prompt 其他文字(标题/表头/规格标注)一律不出声。详见 `wan3-workflow.md` 坑5。

+ 2 - 2
assets/script-template.md

@@ -39,9 +39,9 @@
 
 ---
 
-## 四、口播文案(口语化,按约 3–3.7 字/秒估算、总时长 ≤30 秒、不固定 30 秒)
+## 四、口播文案(口语化、可加语气词、不大幅增字,按约 3–3.7 字/秒估算、总时长 ≤30 秒、不固定 30 秒)
 
-> 由用户内容转换而来,自然亲和、适合口播;`/` 短停、`//` 长停不读出。
+> 由用户内容转换而来:先规避/修改违禁词,再**优化得更口语化白话**(书面改日常说话、适当加语气词),**不大幅增加字数**;自然亲和、适合口播;`/` 短停、`//` 长停不读出。
 
 [口语化口播全文:……(示例)"很多姐妹分不清泛红和红血丝 / 其实它俩真不是一回事 // 泛红是一过性的、受刺激就红 / 红血丝是毛细血管扩张、常年挂在那 // 搞清楚了,护肤才不踩坑。"]
 

+ 1 - 1
docs/暨北内部-朵朵口播视频专用技能.md

@@ -53,7 +53,7 @@
 | --- | --- | --- | --- |
 | **API Key** | 自己的百炼 / DashScope Key(`sk-` 开头) | ✅ 必填 | 写入 `.env`,不进 git |
 | **选题 / 知识点** | 这条视频讲什么(如「敏感肌能不能用功效型护肤品」) | ✅ 必填 | 触发即提供 |
-| **口播文案** | 自带底稿,或让技能生成 | 可选 | 自带则转口语化;不给则技能写 |
+| **口播文案** | 自带底稿,或让技能生成 | 可选 | 自带则转口语化(更白话、加语气词、不大幅增字、避违禁词);不给则技能写 |
 | **风格偏好问卷** | 门店调性 / 插画风格 / 色调等 | 可选 | 无要求→系统自动生成物料 |
 | **插画插入点** | 插画从口播第几句开始融入 | 需确认 | 默认技能按语义建议,使用者最终拍板 |
 | **人物动线路径** | 走动→落座 / 坐→起身走动 | 可选 | 默认技能选,可指定 |

+ 2 - 2
references/elements.md

@@ -42,8 +42,8 @@
 ## 7. 口播文案(Oral Script)
 - 默认:技能生成(当用户只给选题/知识点时)
 - 可选项:
-  - 用户自带完整口播(含 / 短停、// 长停 符号)
-  - 技能生成(把用户给的内容**转换为口语化、适合口播**的文案;自然亲和、带停顿符号、科普准确)
+  - 用户自带完整口播(含 / 短停、// 长停 符号)→ 经 Step 5 转换:**规避/修改违禁词** + **优化得更口语化白话**(书面改日常说话、适当加语气词如「咱/姐妹们/其实/啊/吧/嘛/呢」)+ **不大幅增加字数**(以原稿为底、同义改写/补语气词为主)
+  - 技能生成(把用户给的内容**转换为口语化、适合口播**的文案;同样走上述「规避违禁词 + 口语化白话 + 加语气词 + 不大幅增字」规则;自然亲和、带停顿符号、科普准确)
 - 停顿符号约定(不读出):`/` 短停(换口气) `//` 长停(段落 / 情绪切换)
 - 字数参考:按 ~3–3.7 字/秒 估算,使本段总时长 T ≤30 秒(T 不固定 30 秒,由 Step 8 的 Shot 台词时间分配表求和得出)。