AI 情景喜剧短片生成

SkillMedia

Turns synopses, scripts, storyboards, or reference material into short AI sitcom-style videos, with consistent characters and scenes, comedy beats, shot prompts, and continuity checks. Best for narrative comedy shorts; not for single images or generic video prompts.

Available today. Use it from your connected AI after setup.

Add ahel to your AI once: Claude, ChatGPT, Cursor, Claude Code or Codex. Then ask it to use this.

Then ask your AI: use the AI 情景喜剧短片生成 skill

What this skill tells your AI

The instructions your AI receives, as published by qxryz/workflowgenerator in skills/library/sitcom-story-video/SKILL.md and read by ahel’s review.

当用户希望把梗概、剧本、分镜或参考素材制作成可执行的情景喜剧短片时使用本 Skill。流程会在镜头之间保持角色身份、场景地理、道具、光线、轴线和喜剧因果,并交付故事圣经、剪辑图、生成提示词包与质量检查建议,适用于图生视频或文生视频制作。

STEP 0:检查资源

  1. 接受一句梗概、剧本、分镜或已有视觉参考;如果核心故事缺失,只询问一句话创意。
  2. 保留用户已明确的时长、画幅、平台、语言、对白、视觉风格和目标生成系统。
  3. 有参考素材时,为每份素材分配场景、角色、道具、姿态或已批准尾帧角色。不要把联系表、UI 截图或带边框面板当作干净场景参考。
  4. 若简报不完整,按 references/choice-cards.md 逐张使用渐进式互动选择卡;优先展示可点击选项,同时保留手动输入作为备用;已经说明的选项直接跳过。
  5. 第一次进行任何生图操作前,必须展示 references/choice-cards.md 中的图片清晰度互动选择卡,请用户选择 1K 或 2K;确认后,将该选择锁定到后续所有角色卡、场景卡、道具卡和故事板图片。用户确认前不得生图;如果用户已明确指定图片清晰度,则记录该值并跳过选择卡。
  6. 如果用户提供角色卡参考图,生成角色卡前先分析其版式和信息架构;参考图中的角色设计内容可作为结构依据,载体装饰不作为角色设定照搬。
  7. 如果用户提供场景卡参考图,生成场景卡前先分析其版式、空间视图、平面图、动线、家具和细节组织;保留有用的场景设定信息,不照搬展示底板装饰。
  8. 视频默认使用 MiniMax-H3。用户明确指定其他模型时,先检查其能力,再遵循用户选择。生成失败后按已诊断原因重试一次;仍失败则切换其他兼容的可用模型,不对同一模型反复尝试。

STEP 1:分析输入

识别:

  • 喜剧引擎:地位错位、字面理解、人人看见的秘密、过度自信的计划、互相冲突的规则或不断升级的道具故障;
  • 角色的相互冲突目标、角色功能、不可变视觉锚点和表演习惯;
  • 主场景、屏幕空间关系、核心道具、光线方向和重复出现的背景锚点;
  • 时长、画幅、对白/声音方案和画面质感;若用户没有指定其他预设,采用 90 年代末至 2000 年代初室内电视情景喜剧基调;
  • 全局色彩与材质系统:蜂蜜木、焦糖棕、奶油白、灰粉、砖红和低饱和青绿;整体保持暖调自然,避免霓虹感;若用户有品牌或参考图约束,优先服从用户约束;
  • 参考素材中的连续性风险。

使用 references/story-comedy.md 处理节拍与对白长度;使用 references/visual-style.md 在写镜头提示词前锁定画面语言。全局默认风格改为原创 90 年代末至 2000 年代初室内电视情景喜剧:正面眼平电视摄影、暖色多机位棚拍、温馨杂乱的生活化室内、柔和高调棚光、自然中高饱和度和软化的早期电视广播质感。若用户选择其他视觉预设,以用户选择为准。使用 MiniMax-H3 全能参考制作时,再读取 references/h3-full-reference.md。

STEP 2:锁定创作简报

信息缺失时,依次引导制作模式、规格、情景喜剧世界、喜剧引擎、切镜策略、声音,以及仅在相关时出现的 H3 生成包装。不要询问画面质感:暖色复古室内电视情景喜剧预设默认自动锁定,只有用户主动提出其他视觉风格时才覆盖。始终维护可见状态块:

模式 / 时长 / 画幅 / 喜剧引擎 / 视觉预设 / 切镜策略 / 音频

若用户已给完整简报或明确要求一次完成,只补齐紧凑默认值:45–90 秒、一个主场景、2–4 个说话角色、6–10 个镜头。写提示词或制作视频前,先展示已锁定状态并请求确认。

STEP 3:建立故事制作包

交付:

  1. 梗概与喜剧引擎:一句话故事、受众、语气,以及能持续制造笑点的误会或规则。
  2. 角色圣经:角色功能、欲望、缺陷、喜剧行为、轮廓、服装、声音和不可变视觉锚点,明确绝不能变化的内容。
  3. 场景与道具圣经:空间地理、核心道具、重复背景细节、时间、光线和连续性锁定项。
  4. 节拍表与剪辑图:每镜包含时间码、时长、景别/镜头、运镜、调度、单一主动作、对白或字幕、声音提示、笑点功能、切点、转场以及首尾连续性说明。
  5. 生成提示词:一条主风格锁定词,加上明确时间线、景别、镜头、运镜、动作峰值、切入/切出点、转场和参考角色的镜头提示词。负面约束只聚焦身份漂移、多余肢体、重复道具、文字变形、纹理不稳定和非预期运镜。
  6. 剪辑与 QA:版本选择、视线与屏幕方向检查、尾帧交接、坏帧裁切、笑点节奏和声音清晰度检查。

每个笑点遵循铺垫 → 升级 → 反转/收尾。每个节拍明确目标、阻碍、可见行为、转折和反应。对白保持短句,绑定可见说话者,并为反应留出落点时间。

每条动态提示词必须先写 CUT MAP,再写画面描述。每镜包含时间码、镜头 ID、景别、焦段、机位、运镜、单一主动作、动作峰值和精确切点。使用具体转场名称,如视线硬切、动作硬切、反应硬切、道具方向匹配切或有动机的 J-cut/L-cut。默认采用正面眼平电视摄影:主镜 28–35mm,对话 40–50mm,反应近景 65–85mm。笑点依靠入画、道具误用、停顿、视线交接和反应镜,不依靠炫技运镜。

STEP 4:生成并审核中间资产

图片清晰度确认后,再批量生成角色、场景和核心道具锚点。所有后续生图操作统一使用已锁定的 1K 或 2K 清晰度,并统一使用已选视觉风格和不可变身份特征。默认的 90 年代末至 2000 年代初室内电视情景喜剧需要贯穿蜂蜜棕木柜、奶油墙面或墙砖、生活化厨房/客厅、冰箱磁贴、餐具、照片、桌布、地毯和可重复的核心道具。使用宽而柔的棚内主光、窗光填充和实景灯,稳定曝光并保证脸、手和走位清晰。若与用户故事兼容,角色卡可采用简洁的年代日常服装和可重复发型;具体角色身份始终优先于示例风格人物。生成高成本动态镜头前,先展示中间资产供用户审核。若某项被否决,只修改对应资产并更新连续性台账。下一步还要制作故事板帧,并在动画前一并审核。

角色卡参考格式

当用户提供类似结构的角色设定图时,不要只生成普通肖像,而要复用其信息架构:

  • 若参考图决定画幅,使用横向 3:2;否则保留用户已确认的输出画幅;
  • 使用模块化多栏布局,分为文字/设定区、全身主展示区、表情区和底部细节区;
  • 按正面、四分之三侧面、正侧面、背面顺序展示四个一致的全身视图,保持同一地面关系和身体比例;
  • 加入 2×3 表情网格,覆盖情景喜剧需要的情绪、眼神和口型状态;
  • 加入面部、发型、手部、鞋履、服装结构及其他身份特征的局部特写;
  • 对会影响连续性的服装、配饰和手持道具,加入平铺拆解区;
  • 用短而清晰的制作标注标出视图和细节区域,但标注应服从角色画面;
  • 所有视图、表情、特写和服装细节必须是同一个稳定角色,不得变成分镜、动作序列、无关图片联系表或多个不同身份。

如果用户要求两个情景喜剧角色分开制作,则每个角色单独生成一张角色卡,不要为了节省产物把两个身份放在同一张图里。

场景卡参考格式

当用户提供类似结构的场景设定图时,不要只生成一张氛围美术图,而要复用其面向制作的信息架构:

  • 若参考图决定画幅,使用横向 3:2;否则保留用户已确认的输出画幅;
  • 使用模块化栅格布局,包含场景标题/设定区、一张大型主透视图、三张互补角度图、俯视平面图区和底部细节特写条带;
  • 主透视图用于建立主要机位、空间纵深、出入口、窗户、家具关系和可执行动作区域;
  • 三张互补视图分别补充另一侧空间、正面轴线关系以及侧后方关系,避免单一视角无法确认空间;
  • 加入简化的正投影俯视平面图,标出墙体、门、窗、主要家具轮廓和角色主要动线;
  • 加入约七个带标签的局部特写,展示连续性所需的家具、核心道具、材质结构、灯具和背景锚点;
  • 在文字区简要说明场景使用者、使用时段、空间分区、进出路径、角色动线、镜头覆盖和连续性锁定项;
  • 为主视图、角度图、平面图和细节使用短制作标注。边框、分隔线、色板和展示底板属于载体装饰,不应被误认为场景内容。

情景喜剧制作时,要把场景卡映射到镜头地理:明确主镜机位、互动三角区、屏幕左右动线、核心道具区域,以及角色使用的门口、浴室或厨房入口。

**易错点:**不要把多格分镜、联系表、UI 截图或带边框参考用作角色或场景源,否则模型可能把面板直接复现为画面内容。

STEP 5:创建故事板帧

在制作动态视频前,为每个场景和镜头创建故事板帧;故事板图片沿用首次生图前已锁定的图片清晰度。这些图像是视觉规划资产,用于指导机位、调度、屏幕方向、关键姿态、动作峰值、面部表演、道具状态以及镜头之间的精确视觉交接;它们不是成片帧,也不能被当作装饰海报。

故事板内容来源规则

故事板帧必须按以下优先级从当前制作资料生成:

  1. 当前故事包或已批准剧本/剪辑图:故事事件、镜头顺序、时间码、对白、声音、动作峰值和转场;
  2. 已批准角色卡:身份、脸型、发型、身体轮廓、服装、配饰、表情和固定手持道具;
  3. 已批准场景卡:空间结构、机位地理、出入口、家具、演员动线、空间分区和重复背景锚点;
  4. 已批准道具卡:物体形状、材质、位置、手部占用和状态变化;
  5. 当前项目视觉锁定:媒介、镜头语言、光线、纹理和画面完成度。

不要自动使用之前附加的故事板图片、示例图片或画布连接图片作为故事、角色、场景、道具或动作来源。故事板格式图片与故事无关,除非用户明确要求“把它作为故事板版式参考”。如果用户明确提出这一要求,只能将它标记为 storyboard-layout-reference:它只能提供画格排列、编号、说明文字位置或标注方式,不能提供剧情、角色身份、场景、道具、动作、姿态、颜色或画面内容。若用户没有提出该要求,故事板生成时完全不引用它。

故事板生成规则

  • 按当前剪辑图的镜头顺序,为每个场景和镜头创建故事板帧;
  • 多面板布局只是规划载体,不是最终动画内容;
  • 按镜头顺序编号,每格只呈现当前故事包规定的关键戏剧或喜剧瞬间;
  • 每格配紧凑文字区,写明镜头 ID、时间范围、景别、主动作、对白或声音提示,以及转场/交接说明;
  • 每格角色绑定已批准角色卡,空间绑定已批准场景卡,物体和状态绑定已批准道具卡;
  • 在有助于动画规划时,用清晰符号表现运动方向、冲击、视线、道具移动或特效;
  • 将面部表情、身体姿态、手部占用和动作峰值表现为可执行的动画关键帧;
  • 清楚显示连续性所需的前景、中景、背景、出入口、演员动线和重复道具;
  • 包含下一镜所需的首状态、动作峰值和结束状态;
  • 故事板文字必须与已批准对白和故事包一致,不得为了适配某张参考图而发明新事件;
  • 外框、画格线、标题栏、数字标牌、说明框和装饰性标记属于载体元素,不得进入最终动画场景。

为每个已批准镜头记录故事板帧中的构图、角色位置、视线方向、道具状态、运动向量、特效形态和首尾姿态,并写入连续性台账。动画制作前按顺序审核全部故事板帧。若某一帧不清楚,应依据当前故事包和已批准卡片修改,不得导入无关参考图,也不得只靠视频提示词弥补歧义。

视频清晰度选择卡

进入动态视频生成前,必须展示一次清晰度与成本选择卡。用户选择后才能开始生成镜头:

【视频清晰度】
A. 768P(推荐)— 适合先验证动作、连续性和喜剧节奏,成本与生成压力较低
B. 2K — 适合最终画面细节与更高输出规格,生成成本与资源消耗更高

将用户选择的清晰度锁定为所有镜头和最终组装的制作约束。如果当前视频能力不支持所选清晰度,必须说明不兼容并请用户选择可用替代项,不得静默降级或升级。即使故事板已经审核通过,也必须展示此卡,因为清晰度是独立于创意审核之外的生成成本决策。

STEP 6:制作镜头

按剪辑图顺序生成镜头,使用已批准的角色、场景、道具和尾帧参考。每镜只保留一个主动作和一个有动机的运镜。保持 180 度轴线、左右位置、手部占用、道具状态、服装、光线和情绪状态。

对于 H3 全能参考包装,先写完整 CUT MAP,再为每个片段写清晰的镜头时间线,并要求全幅拍摄感画面:无边框、画中框、联系表、面板布局、UI、黑边或海报文字。失败时按 references/h3-full-reference.md 的恢复阶梯处理:移除最弱参考、简化动作、缩短片段、替换干净入点尾帧,再用更简单的可用规格验证。

困难镜头至少生成三个版本,优先按连续性、表演、精致度选择。不要用含糊提示词掩盖坏帧。

STEP 7:组装与质量检查

裁掉坏帧,挑选最好的版本,匹配视线与屏幕方向,并在支持时把批准的出点尾帧作为下一镜入点连续性锚。保持切镜间室内底噪连续,对白时压低音乐,在笑点前留短暂停顿。检查:

  • 每镜都有明确时间码和笑点功能;
  • 没有无故事理由的轴线、光线、服装、道具、空间或身份变化;
  • 面孔、手部和核心道具始终可读;
  • 转场有明确动机并使用具体名称;
  • 对白在镜头时长内清晰可听;
  • 需要时结尾收梗能回扣开头;
  • 不保留盒状、分镜、拼贴、闪烁、蜡感或塑料感镜头。

最终成片成功组装并通过基础质量检查后,必须主动向用户展示可点击选项:添加器乐 BGM 或 仅保留原始声音。在用户确认 BGM 选项前,不得生成、分析或混入 BGM。若用户拒绝,直接交付保留原始音轨的成片并结束声音分支;若用户确认添加,再进入第 8 步。

STEP 8:成片声音设计合成

当用户要求给成片配乐、做声音设计或成片混音,或明确要求情景喜剧感时,使用本成片后处理分支。本分支现在只提供纯器乐 BGM 设计:不得生成罐头笑声、新拟音、转场音效、室内底噪或任何其他新增声音。如果用户要求罐头笑声,应说明本 Skill 不再生成罐头笑声;经用户确认后,只继续纯器乐 BGM 流程。

  1. 先解析成片。 先回放并理解成片,按镜头拆分,记录节奏、对白窗口、情绪高点、转场、动作节点和有意留白。产出 BGM 设计表,每行一个配乐事件,包含:时间码、段落、器乐风格、强度、进入/退出方式,以及它和对白或动作的关系。没有画面或明确时间码依据时,不得凭空安排配乐事件。
  2. 先确认 BGM 方案。 向用户展示 BGM 设计表、器乐方向、段落边界、音量策略和淡入淡出点。用户确认前不得生成音频。方案必须服从对白,并保留有意留白。
  3. 生成纯器乐 BGM 段落。 用户确认后,使用 seed-audio T2A 按已定义的时间块生成非人声器乐段。每段提示词只能要求纯器乐和留白:不得出现任何可辨识人声、说话、歌词、耳语、对白、发声、观众笑声、罐头笑声、音效、拟音、室内底噪或其他语言内容。不得按对白逐句拆分;对白和原声音效全部由成片原音轨保留。
  4. 对齐并混音。 将纯器乐段先 trim 或按时间码对齐,再混入成片原始声音。原始对白、旁白、现场声和原有音效原样保留。人声优先级最高,BGM 默认低于人声约 12–18 dB;对白密集时进一步降低。除非用户另行要求声音修复,不得替换或清理原始音轨。
  5. 回放验收。 回听混音结果并检查:新增轨道只有无唱词器乐和留白;没有新增人声或拟音;配乐跟随画面节奏;淡入淡出对齐切镜;原始对白和原有音效清晰。如果验收失败,删除问题 BGM 段并重新混音,不得用生成式罐头笑声或拟音补救。交付前必须说明验收结果。

默认情景喜剧配乐方向:轻快爵士、vaudeville、钢琴、木琴或克制的器乐 stinger,但 stinger 只能属于 BGM。情感或对白密集处使用更轻的器乐铺底;罐头笑声和所有画面拟音不属于生成音频范围,不得重新生成。

工作模式

  • 概念模式:梗概、角色、场景、喜剧引擎和简明风格圣经。
  • 分镜模式:编号镜头表和图片提示词。
  • 动画模式:把已批准分镜转成带运动、声音和尾帧交接的时间化视频提示词。
  • H3 全能参考模式:明确参考角色、镜头时间线、切镜方向、抗盒感规则和恢复阶梯。
  • 修改诊断模式:只修复受影响镜头的身份、连续性、节奏或喜剧问题。

除非用户提供了实际生成结果供检查,否则不要声称镜头已经渲染或保持一致。

Signals

GitHub stars
26
Last commit
Sep 2026
Advanced
Item type
skill
Key
sitcom-story-video
Source
github.com/qxryz/workflowgenerator