modelscope.cn

talking-head-safe-packaging

面向中文新手,为一段真人口播视频直接生成可发布的竖屏短视频?

Installation

$ npx skills add https://modelscope.cn

Similar popular skills

Related neighbors and high-traction skills in the same topics — useful to compare before installing.

Also in this package

Other skills from modelscope.cn · top by installs.

npx skills add https://modelscope.cn

Browse all from modelscope.cn

More details

Agent compatibility

Declared targets from SKILL.md / docs. Unmarked agents are not listed — the skill may still install via the CLI.

Claude Code Not declared
Cursor Not declared
Codex Not declared
GitHub Copilot Not declared
Windsurf Not declared
Gemini CLI Not declared
Cline Not declared
OpenCode Not declared

Skill metadata

Parsed from SKILL.md frontmatter.

Version1.0.0

Package contents

Files included with this skill beyond the listing page.

  • skill md SKILL.md 7,762 B

History

  1. First recorded snapshot · 0 installs

SKILL.md

口播短视频安全包装

把用户提供的真人口播素材直接包装成可发布的中文短视频。目标不是堆特效,而是让字幕、信息卡和动效帮助理解,同时始终让人物保持清楚、自然、可看。

默认交付

  • 成片:1080x1920、9:16、MP4、30fps。
  • 音频:默认保留并封装原始口播音频,不重配音、不静音。
  • 字幕:默认开启;文字必须与当前时间的实际口播一致。
  • 画面:人物主讲优先;只在当前话题需要解释产品、数据、流程或对比时短暂使用前景信息卡。
  • 包装:每段 3--6 个有语义的轻量元素即可,不为“高级感”堆卡片、转场或素材。
  • 素材:没有 Logo、图片或品牌规范时,使用干净的文字、线条、图标和半透明 UI;不要强制生成图片。
  • 时间轴:不要求用户提供或审阅时间轴文档。内部可使用转写时间戳完成同步,但交付只给成片、工程与 QA 结果。

不可突破的规则

  1. 先分离当前视频,再设计包装。 不能把前一段的字幕、卡片或高亮残留到下一段。
  2. 先转写,后设计。 即使用户不需要字幕,也必须转写并确认人名、品牌、数字、单位和缩写;不确定的内容不得臆造。
  3. 人物优先。 小卡片、标签、字幕和浮层不得压住发际线、头发轮廓、眼镜、眼睛、鼻子、嘴部或关键手势。
  4. 字幕只对应当前口播。 每屏 1--2 行,宁可短句切分,也不要提前显示下句、滞后不消失或把多句挤成一团。
  5. 信息卡必须有语义。 卡片应对应当前正在讲的一个产品、数据、步骤、对比或结论;没有明确用途时不加。
  6. 保留原声。 不得用静音、黑屏、错误音轨或无声替换来掩盖渲染问题。
  7. 先验证再交付。 成片必须可解码,包含视频和音频流,并通过人物避让、字幕、残留层和首尾画面检查。

执行流程

1. 明确输入与默认值

至少需要一段真人口播视频。文案、Logo、品牌色、图片、平台要求和特别要强调的观点均为可选输入。

若用户没有指定,使用本 Skill 的默认交付。若素材并非中文、不是竖屏、没有人物或明确要求去除原声,先说明会改变哪些默认项,再继续制作。

2. 素材体检与转写

  • 检查时长、分辨率、帧率、画幅、编码、是否可变帧率、是否有音频、人物位置、脸部大小、手势和已有字幕。
  • 从原始音频生成带时间戳的转写;校正专有名词、数字、货币、百分比和单位。
  • 找到话题切换、数据出现、动作明显、人物移动和停顿的位置。这些是包装切换点,不需要产出给用户的时间轴表。

3. 先画人物安全区

为每个镜头记录脸部框和关键手势区域。先放置人物安全区,再放字幕和 UI,绝不能反过来。

默认从 [安全区参考](references/platform-safe-area.md) 的 1080x1920 起始值开始;素材人物靠边、低机位、多人、手势多或目标平台 UI 不同,必须重新校准。

4. 选择画面模式

默认使用 人物主讲模式:人物清晰可见,包装只是辅助。

仅在下列情况短暂使用 前景信息卡模式:

  • 展示产品或页面;
  • 解释一项关键数据;
  • 对比两个选择;
  • 梳理一个流程或结论。

前景卡结束后应及时回到人物主讲模式。卡片不能只因为“看起来更精美”而出现。

5. 设计字幕和轻量包装

  • 字幕使用高对比文字与轻阴影或描边,不使用压迫人物的大黑底。
  • 顶部支持 UI 保持短小:主题、当前章节、关键数字或流程进度均可;一次只突出一个信息。
  • 卡片进出应平稳、可读、及时清除。切换话题时先退出旧层,再进入新层。
  • 动效以淡入、位移、缩放和进度变化为主;时长短、节奏贴近口播,不使用无意义的频繁闪烁。

6. 选择渲染路径

优先按当前可用环境选择,而不是为工具本身硬撑:

  1. HyperFrames:适合单条口播、HTML/CSS/GSAP 字幕、透明 UI、标题和快速预览。先运行环境检查、lint/inspect 与短片段烟雾渲染。
  2. Remotion:HyperFrames 不可用、烟雾渲染失败,或需要复杂字幕、批量复用、React 组件和逐帧稳定性时切换。
  3. 其他渲染路径:前两者都不可用时,说明原因、预计影响与可用方案后再切换;仍须遵守本 Skill 的人物安全、字幕、音频和 QA 规则。

短视频直接合成出现编码、可变帧率、关键帧或透明层异常时,先将素材转为稳定的 H.264/CFR 中间文件,再重新渲染。不得以删除原声、字幕或人物避让为代价换取“能导出”。

7. 成片 QA

逐段检查以下位置:开场后 0.2--0.5 秒、每个包装稳定段、每个包装退出后 0.2--0.5 秒,以及片尾。

  • 当前字幕、卡片和高亮是否准确对应正在说的话;
  • UI 是否压住脸部、眼镜、嘴部、发际线或关键手势;
  • 是否有黑屏、白闪、旧层残留、幽灵层、跳帧或错位;
  • 人物与 UI 是否仍有足够对比度和可读性;
  • 原声是否从头到尾存在、同步且无异常静音;
  • 输出是否为可解码 MP4,尺寸、帧率、时长和音视频流是否符合约定。

使用本包的检查脚本完成基础交付验证:

python scripts/verify_delivery.py "输出成片.mp4" --expect-width 1080 --expect-height 1920 --expect-fps 30 --decode

该脚本只验证技术交付,不替代人工的人物遮挡和字幕语义检查。

8. 交付

交付以下内容:

  • 最终 MP4 成片;
  • 可继续编辑的项目或源文件;
  • 简短 QA 说明:渲染路径、原声状态、字幕策略、人物安全检查、技术检查结果及已知限制。

不要只交付工程、预览链接或未检查的渲染缓存。

常见请求的处理方式

用户请求 执行方式
“给这段口播做精美包装” 默认保留原声和中文字幕,以人物主讲为主,顶部放少量话题和数据 UI。
“字幕不要挡住人” 先标记脸部和手势,再把字幕放入底部安全区;若人物处于底部,改用侧边或动态避让。
“HyperFrames 用不了” 给出失败原因,切换 Remotion;仍不可用时说明其他可用渲染方案后再继续。
“做得高级一点” 提升排版、层级、动效节奏和数据表达,不增加与当前口播无关的装饰。
“不要字幕” 仍完成转写用于包装同步,但不输出字幕层;其余人物安全和 QA 保持。

最终回复模板

完成后用简短中文汇报:

已完成:{成片路径}
规格:{分辨率} / {帧率} / {时长}
渲染:{HyperFrames | Remotion | 其他}
音频:原声已保留
字幕:{逐句中文字幕 | 未显示,已用转写同步包装}
QA:已检查人物避让、字幕同步、包装退出和音视频可解码性
限制:{无;或具体说明}