半解说真人短剧——Design 短剧生产

SkillDev tools

Produces live-action short dramas driven by narration with supplementary character dialogue, based on stories, scripts, and reference materials, including continuity assets, timecoded shots, final assembly, standalone narration, and optional subtitles. Uses MiniMax-H3 by default; when the user expl

Available today. Use it from your connected AI after setup.

Add ahel to your AI once: Claude, ChatGPT, Cursor, Claude Code or Codex. Then ask it to use this.

Then ask your AI: use the 半解说真人短剧 skill

What this skill tells your AI

The instructions your AI receives, as published by qxryz/workflowgenerator in skills/library/half-narrated-live-action-short-drama/SKILL.md and read by ahel’s review.

用于在 Design 平台端到端制作短剧,发展灵感,锁定故事和视觉圣经,制作角色卡与场景卡,生成关键帧,生成镜头视频,读取最终合成视频的真实时间轴,然后直接生成一条独立的 Seed Audio 旁白音轨。专用于真人写实风格的半解说短剧,支持第一人称或第三人称旁白推进剧情,并结合角色对白、动作表演和场景调度完成单集成片。不用于动画、二次元、纯解说、纯口播、普通单张生图、单条视频或普通剪辑任务。

核心能力

  • 将灵感、主题、参考素材或故事前提发展为聚焦的短剧创意。
  • 创建并确认一句话梗概、角色、场景、单集结构、剧本、对白和旁白。
  • 建立可复用的角色与场景连续性锚点。
  • 将确认后的剧本转为带时间码的分镜和镜头合同。
  • 生成角色卡、场景卡、关键帧、镜头图片和镜头视频。
  • 批量处理相似图片任务,并生成连续的镜头视频。
  • 按故事顺序组装镜头,读取最终视频真实时间轴,并生成一条独立 Seed Audio 旁白音轨。
  • 检查连续性、唇形同步、构图、节奏、对白归属和最终时长。

输入

  • 创作种子:灵感、故事前提、主题、故事片段、剧本或参考素材。
  • 可选的角色、服装、道具、地点、风格、分镜、图片、视频或音频参考。
  • 可选的受众、平台、画幅、时长、语言、对白、旁白、音乐、字幕偏好和内容约束。
  • 需要续作、改编或重制的已有素材或剧集。

制作锁定

  • 默认生图模型:Design Image 2。
  • 默认生视频模型:MiniMax-H3。
  • 用户明确指定其他视频模型时,先检查其是否支持所需的参考素材、分辨率、时长、对白和口型能力,通过后再遵循用户选择。
  • 生图默认使用 2K;生成视频前由用户在 2K 和 768P 中确认分辨率。
  • 视频时长只使用整数秒。使用 MiniMax-H3 时,每段镜头必须为 5–15 秒;如果原始台词镜头短于 5 秒,需要合并相邻连续故事节拍。用户明确指定其他模型时,按能力检查确认的限制执行,不改变已确认的故事结构。
  • 视频镜头失败时先分析原因并只重试该镜头一次;仍失败则将该镜头切换到其他兼容可用模型,不对同一模型反复尝试。
  • 不因为某一时刻图片生成容量不可用就改变已经确定的制作方案,受影响的工作项在可以执行时继续处理。
  • Skill 不增加独立的容量或安全拦截流程;如果平台返回任务无法执行,遵循平台实际执行结果。
  • 除非用户要求 SRT 或烧录字幕,否则关闭字幕。

工作流

1. 灵感与创意

提取用户意图和参考素材,形成聚焦方向:故事前提、类型、情绪钩子、主角、冲突、世界和结尾落点。在详细创作前确认方向。

2. 故事与剧本

根据目标时长创建短剧结构:一句话梗概、角色功能、场景推进、对白或旁白、动作节拍和结尾。将口播文案与画面方向分开。高成本生成前确认剧本。

3. 角色卡与场景卡

角色卡在作为身份参考时统一使用 16:9。背景必须为纯白,不得出现任何场景背景、标题、标签文字或水印;左侧放详细人物脸部特写,右侧放同一人物的正面、侧面和背面半身三视图。真人写实项目里,角色卡要按真实选角 / 服装 / 连续性参考图来写,不要按概念设定图来写:脸部描述必须细化到脸型、眉骨、眉形、眼型与眼睑、鼻梁与鼻翼、嘴唇、唇峰、下颌线、发型轮廓、年龄痕迹、皮肤质感、自然不对称、服装结构、面料行为和身份特征。要明确保留真实比例、真实手部、真实褶皱与磨损,避免过度磨皮、塑料皮肤、轮廓过锐、二次元特征、CG 渲染感或插画感。

场景卡统一使用 16:9 纯白背景,并且不得包含任何人物。场景卡展示环境和设备布局的有效视角,保持空间关系和重复物体一致;不得出现角色、人体、手、脸、人物剪影、人物倒影、可读 UI、标题或水印。

后续关键帧和视频只使用最终确认的角色卡与场景卡。如果用户重新整理或替换了分组,不得继续使用已被替代的旧卡。

4. 分镜与镜头合同

将确认后的剧本拆成可执行镜头。每个镜头定义最终视频时间段、整数时长、主体、角色卡映射、场景卡映射、动作、空间关系、构图、运镜、对白或旁白时间、关键帧需求、转场、连续性衔接,以及必须带入生图和生视频的精确提示词要素。原始台词不足 5 秒时,合并相邻连续节拍;每段 MiniMax-H3 镜头保持在 5–15 个整数秒内,用户明确指定其他模型时按能力检查确认的限制执行。

每条提示词都必须明确列出相关角色:旁白人、每位对白说话人、每张角色参考图、场景参考图和关键帧参考图。说明哪些角色出场、哪些角色不出场。所有对白和旁白必须逐字保留。

5. 关键帧生成

暂时保留关键帧流程。每个可执行视频镜头生成一张 16:9 的关键帧总图,且总图内部必须由三个横向排列的 9:16 竖屏关键帧组成;三个子关键帧分别对应同一镜头的不同展现内容,按“空间建立 / 主要动作 / 结果或情绪收束”的顺序组织,彼此共享同一角色、场景和道具连续性,但构图角度、主体重点和视觉信息要有明确区分。关键帧必须体现该镜头的实际构图、主体位置、动作起点和连续性衔接。角色身份来自最终角色卡,世界和布局来自最终场景卡,镜头构图来自分镜。真人写实项目里,关键帧必须像扎实的摄影参考图或连续性分镜板:人物结构稳定、服装物理可信、表情自然,不要出现插画感、玩具感、蜡皮感、海报化处理或把三宫格做成重复近景。视频生成前先检查关键帧。

6. 生图

使用 Design Image 2 默认以 2K 生成角色卡、场景卡、关键帧和镜头图片。使用已经确认的参考角色,保持身份、主体数量、场景地理关系和必要视觉特征。真人写实项目里,提示词必须明确压向摄影级真实感:电影剧照 / 连续性参考图 / 选角照语言,真实光线、自然皮肤质感、可见毛孔与细发丝、可信的衣料褶皱、正确的镜头透视和克制的色彩处理。不得添加未要求的文字、标题、水印或背景元素,也不要让结果漂成过度精修的 AI 美颜图、插画或 CG 海报风。

7. 视频分辨率确认

生成任何视频前,先询问用户选择输出分辨率:2K 或 768P。将用户选择记录为制作锁定,并让本集所有镜头使用同一确认分辨率。确认后不得静默选择、修改或混用分辨率。

8. 生视频

默认使用 MiniMax-H3,按用户确认的 2K 或 768P 分辨率生成每个已确认镜头,时长只能使用 5–15 秒的整数。用户明确指定其他模型且能力检查通过时,沿用同一镜头合同,并在该模型支持的分辨率、时长、参考素材、对白和口型范围内执行。单个视频任务或单个镜头的时间码必须从 00:00 开始计时,不得沿用上游分镜段落时间。使用 MiniMax-H3 时,生成前读取 references/h3-video-prompt-template.md 并按模板填充。分镜要求关键帧时,使用三宫格关键帧总图作为镜头视觉锚点,同时绑定对应的角色卡和场景卡。保持角色、世界、动作、运镜意图、对白时间和视觉风格。真人写实项目里,视频提示词要明确压向摄影真实感:纪录片感 / 剧情片感 / cinéma vérité / 手持或固定机位按需要选择,景深真实、运动模糊自然、面部运动可信,不要出现二次元、CG、过度美颜或夸张 AI 对称脸。

每条视频提示词必须按镜头内的旁白、对白和画面内容切成若干清晰段落来写:先写镜头要建立的空间和人物关系,再写被旁白对应的画面内容,再写对白发生时的动作和反应,最后写收束画面与情绪结果;如果同一镜头需要切换视角或切换信息重点,可以在提示词里明确写出段内切镜、推进、遮挡后 reveal 或空间过渡的方式,但仍然只能服务于同一个已确认镜头,不得改变镜头编号和总时长。旁白期间,被描述的角色保持闭嘴,除非该角色另有对白;对白期间只有指定说话人做口型同步。提示词中要区分每个角色的声音职责。

8.1 视频提示词装配顺序

每条视频提示词都按以下固定顺序拼接,避免画面和风格跑偏:

  1. 镜头目的和精确时间段。
  2. 锁定的身份来源:角色卡、场景卡、三宫格关键帧引用。
  3. 真人写实目标:摄影 / 连续性参考图语言。
  4. 旁白对应的画面内容与对白对应的画面内容。
  5. 主体站位:谁在画面里、谁不在、各自站哪。
  6. 动作节拍和情绪状态。
  7. 镜头构图和运镜,必要时说明段内切镜、推进、移焦、遮挡 reveal 或空间过渡。
  8. 对白、旁白和精确口型归属。
  9. 连续性约束:服装、道具、湿度、光线、伤痕和空间衔接。
  10. 负向约束:不要插画、不要 CG、不要美颜滤镜、不要夸张对称脸。

如果一个镜头有多角色、转场或连续性约束,不要把提示词写成随手一段散文,必须按模板顺序装配。段内切镜只允许服务于该镜头内部的叙事展开,不改变镜头编号和总时长。

镜头执行失败时保留已经成功的镜头,分析原因后只重试缺失镜头一次;仍失败则只把该镜头切换到其他兼容可用模型。不要重做全项目、对同一模型反复尝试或改变镜头拓扑。

9. 组装最终视频

按照已编写的镜头编号排序,不按照画布返回顺序排序。将生成的镜头合并为最终视频,并读取该最终视频的真实媒体时长、真实镜头边界和真实画面结束时间,作为后续旁白音频生成的唯一时间基准。不要在这里做音频拆分、对白分析或最终混音。

10. 最终旁白生成

编写最终 Seed Audio 提示词前,必须读取 references/seedaudio-final-track-prompt-template.md 并按其结构执行。该模板只用于根据最终合成视频的真实时间轴生成一条独立旁白音频,不需要拆分原视频对白,也不需要为最终混音做对白避让。最终送入 Seed Audio 的文本字段必须包含模板正文、所有角色音色描述、所有时间戳、所有静音区间和所有旁白台词,保持逐字不漏;不得把角色表、真实时间戳核对、逐条映射或显式静音区间压缩成简短的泛化提示词。

最终视频合并后,提取最终视频的真实时间轴,只核对旁白与画面。形成最终旁白表,包含:

  • 精确起止时间戳
  • 说话人角色
  • 逐字旁白台词
  • 音源类型:Seed Audio 旁白 / 绝对静音
  • 根据最终视频产生的时间修正

独立旁白音频直接依据最终视频的真实时间轴生成。该流程不拆分原视频音频、不保留原视频对白作为音频来源、不进行对白避让,也不执行旁白句段的后期倍速、时间拉伸或重切对齐;不生成混合音频视频。没有标注旁白的区间保持绝对静音,音频总时长以最终视频真实时长为准。

11. 交付最终视频、字幕和旁白音频

将最终合成视频、字幕和 Seed Audio 旁白音频作为三个独立交付物输出。不要把旁白音频重新混回视频,也不要额外生成新的混音版本。字幕优先从最终同步视频和旁白脚本生成;如果用户要求 SRT 或烧录字幕,则按最终合成视频的真实时间轴输出。

输出

  • 已确认的创意方向和短剧前提。
  • 剧本、旁白、对白、场景拆解和时间结构。
  • 最终 16:9 纯白背景角色卡:左侧脸部特写,右侧三视图半身。
  • 最终 16:9 纯白背景无人物场景卡。
  • 9:16 关键帧和镜头合同。
  • 2K 整数秒图片,以及默认由 MiniMax-H3 或用户明确选择且通过能力检查的模型生成的视频素材。
  • 按最终真实视频时间戳同步的一条 Seed Audio 独立旁白音频。
  • 最终合成视频,以及用户要求时输出的 SRT 或烧录字幕版本。
  • 用户要求时输出 SRT 或烧录字幕版本。

边界

本 Skill 面向 Design 平台的半解说真人短剧单集生产,不处理动画或二次元短剧、纯解说内容、纯口播、单条视频生成、普通剪辑、外部服务商配置、API Key 管理、图床、本地 Electron 安装或单独修图。不得静默改变已经确认的角色身份、场景地理关系、说话人归属、剧本文字、镜头顺序或用户选择的输出约束。

来源说明

本 Skill 专用于需要连续性控制的半解说真人短剧单集制作。

Signals

GitHub stars
26
Last commit
Sep 2026
Advanced
Item type
skill
Key
half-narrated-live-action-short-drama
Source
github.com/qxryz/workflowgenerator