羊毛毡故事短片

SkillMedia

Turns narration or story scripts into vertical or horizontal wool-felt short videos, with staged confirmation, clarity options, sound modes, asset reuse, shot-by-shot generation, and final assembly; not suitable for static images or miniature projects.

Available today. Use it from your connected AI after setup.

Add ahel to your AI once: Claude, ChatGPT, Cursor, Claude Code or Codex. Then ask it to use this.

Then ask your AI: use the 羊毛毡故事短片 skill

What this skill tells your AI

The instructions your AI receives, as published by qxryz/workflowgenerator in skills/library/wool-felt-story-short/SKILL.md and read by ahel’s review.

当用户希望制作一条完整的竖版或横版故事视频,并将现实世界中的人物、场景和道具全部重新表现为可见羊毛毡材质时,使用本 Skill。流程采用严格节点门控:当前节点未得到用户确认前,不进入下一个制作节点。

核心制作契约

  • 默认最终画幅为 9:16,同时支持 16:9、1:1、4:3、3:4 和 21:9。
  • 必须在 Final Video Spec 中选择并锁定一种支持的画幅,再确认故事板;不能静默改变用户确认的比例。
  • 生成图片资产前必须展示并锁定图片清晰度选项卡:1K 或 2K。如果用户已经明确选择其中一项,直接记录为已锁定,不重复询问。该选择适用于生成的角色、场景和道具图;用户已提供的图片直接绑定,不为了改变清晰度而重生成。
  • 生成视频镜头前必须展示并锁定视频清晰度选项卡:768P 或 2K。如果用户已经明确选择其中一项,直接记录为已锁定,不重复询问。所有生成镜头和最终视频衍生版本都使用已锁定的选择,除非用户明确修改。如果当前生成能力不支持已选清晰度,必须说明不兼容并取得新的用户选择,不能静默更改清晰度或生成能力。
  • 视觉基准是现实世界比例的完整羊毛毡世界,不是微缩模型、立体微缩景观、玩偶舞台、娃娃或玩具展示。
  • 默认动作柔和、流畅、自然且可读,不追求僵硬的定格动画感。
  • 视频内 SFX 在每个视频镜头生成时由视频模型自动烘焙;除非用户明确要求替换或增强,否则不单独建立 SFX 音轨。
  • 视频默认使用 MiniMax-H3。用户明确指定其他模型时,先检查其能力,再遵循用户选择;失败后按已诊断原因重试一次,仍失败则切换其他兼容的可用模型,不对同一模型反复尝试。
  • 在故事板确认前选择一种音频模式:narration 旁白模式,或 dialogue 角色对白模式。不能隐含混用。
  • 在 narration 旁白模式中,旁白时长是镜头时长的权威依据:每段旁白与对应镜头必须等长,完整旁白不得被截断、遗漏或被迫加速。
  • 在 dialogue 角色对白模式中,每句对白必须绑定说话角色、完整原文、起止时间和对应镜头;对白必须完整,不得被迫加速。默认直接使用已确认视频镜头内生成的角色原配音;镜头确认后不再额外生成逐句 TTS,除非用户明确要求替换配音、独立对白音轨或对白修复。
  • 在 narration+dialogue 混合模式中,必须在生成视频前先建立并确认逐镜音频时间轴:按自然语速测算或生成每段旁白,把对白安排在不重叠的时间窗内,明确记录必要的停顿,并根据完整音频计划确定镜头时长。不能先生成固定时长镜头,再把更长的旁白整段叠加到对白上。除非用户明确要求有意的同时说话,旁白与对白不得重叠。
  • 音频时间轴是镜头时长的权威来源。每个镜头的 audio_timeline 必须记录 narration_start、narration_end、dialogue_start、dialogue_end、audio_gap 和 shot_duration。如果旁白按自然语速放不下,应延长镜头、在语义边界拆分,或先修复时间安排;禁止不自然地压缩语速。混音时按已确认的时间码放置音轨;音量闪避只用于环境音或 SFX,不能代替分离两种说话声音。
  • BGM 推荐放在带旁白的最终成片完成并确认之后,再决定是否生成 BGM 版。
  • 用户确认 BGM 后,以最终成片时长为目标,但不强求 BGM 原生时长完全一致。若生成的 BGM 长于成片,直接裁剪到成片时长并做自然收束;若 BGM 较短,可以按需循环,再将循环结果裁剪到完整成片时长;禁止强行拉伸。
  • 无 BGM 的旁白版成片是必须保留的独立交付物;BGM 版必须作为新的独立资产输出,禁止覆盖、替换或隐藏原本的无 BGM 版本。
  • BGM 默认混音音量必须清晰可听,同时在旁白出现时适当压低或闪避,不能因为过度压低而听不见。
  • 旁白变成配音文本时必须保留用户原文,不为追求风格而改写;在 dialogue 模式中,每句已确认对白也必须原样保留并绑定到正确角色。
  • 对于变身、伪装、换装或其他持续性状态变化的角色,必须为每个需要出现的状态分别定义并生成形象。变身后的角色必须有专属参考图,并明确绑定到变身之后的镜头;不能只依赖变身前的参考图。
  • 所有规划文档与生成资产都保存在当前项目工作区,后续步骤使用工具返回的资产引用。

第一步:接收并检查文案

以纯文字旁白、脚本或故事文案作为主要输入,不要求用户上传参考视频。用户可以额外提供角色、场景、道具或风格参考图;如果没有参考图,直接使用内置羊毛毡视觉基准。

只提取文案能够支持的信息:标题或暂定标题、预计时长、主题、情绪弧线、角色、地点、道具、旁白语言和可能的声音线索。不要凭空增加不必要的事实或角色细节。

如果没有文案,或文案过于零散而无法识别主要故事,先请用户补充文案;否则进入第二步。

根据用户意图选择音频模式:由旁白讲述故事时使用 narration;角色在画面中互相说话或直接说出对白时使用 dialogue。如果用户明确同时需要旁白和对白,使用 narration+dialogue 混合模式,分别记录两类音轨,不能混淆角色对白与旁白。固定镜头时长前,先测算或生成每段旁白和对白的自然时长,再为所有说话内容预留互不重叠的时间窗。

第二步:编写并确认 Final_Video_Spec.md

生成简洁的制作规格文档,包含:

  • 标题或暂定标题;
  • 已锁定的画幅:从 9:16、16:9、1:1、4:3、3:4 或 21:9 中选择;
  • 根据正常旁白语速估算的总时长,中文约按每秒 5–6 字计算,其他语言按自然朗读速度估算;
  • 与画幅对应的构图、安全区域和主体布局要求;
  • 待锁定的图片清晰度(1K 或 2K)和视频清晰度(768P 或 2K);
  • 主题与故事前提;
  • 主题情绪、情感方向和结尾意图;
  • 旁白语言,以及后续是否可能生成旁白;
  • 内置羊毛毡视觉基准;
  • 已确认选项和仍待确认选项。

在此暂停,请用户确认或修改预计时长、本次主题、旁白语言和画幅。图片或视频生成前不在此处提前询问清晰度,而是在对应生成节点展示清晰度选项卡。用户回复即为本阶段权威锁定结果。

第三步:设计故事板

基于已锁定规格和原始文案,生成 key_elements、shot_list、audio_layers 三个顶层部分。

key_elements

定义本次视频需要复用的角色、场景和道具。每个元素必须包含文字描述,并预留后续绑定参考图资产的字段。

角色描述需要包含体型、清晰可读的五官、服装颜色、辨识度高的轮廓特征,以及适合当前语境的羊毛毡比例等级:

  • 写实感可爱:主要角色默认使用,头身比约 1:3–1:4,面部圆润温暖,身体与四肢保持正常比例。禁止使用 chibi、super-deformed、doll-like、puppet、toy figurine 等描述。
  • 适度 Q 版:次要角色或单镜头路人使用,头身比约 1:2,体型圆润、表情清晰。
  • 高度 Q 版:仅用于人群、象征性群像或情绪示意,面部简化但仍需可读,以大头小身体概括多人。

场景、建筑、食物和道具必须保持真实世界形状与比例。它们应当像普通大小的房间、街道、餐厅、餐具或食物,只是全部由羊毛毡重新建造,不能像微缩布景。

每个场景或道具描述必须说明主色调方向、道具构成和光线类型。除非文案或已确认参考图要求其他方案,默认使用暖色、低饱和色彩描述。

对于包含变身的故事,增加 character_states 状态表,为每个可见状态单独记录,例如 frog_prince_before 和 human_prince_after。每个状态都要描述轮廓、面部、服装、配饰和连续性锚点,并预留独立参考图资产。

shot_list

按叙事顺序命名为 镜头1、镜头2、镜头3……每个镜头必须包含时长、画面主体与动作、场景氛围、运镜方式、参考图绑定和旁白文案参考。

根据故事边界拆分镜头,但不能在测算旁白时长之前固定镜头时长。先将文案拆成旁白段落,按自然语速估算或生成每段旁白,再把对应镜头时长锁定为完全相同的时长。每段旁白必须完整落在对应镜头内,不得截断、遗漏或被迫加速。若一段旁白超过所选视频模型的最大时长,必须在语义句子或动作边界处拆成多个旁白/镜头对,不能硬塞进一个镜头。若旁白短于模型最小时长,则与相邻且语义兼容的段落合并,或明确加入与该旁白等长的视觉停顿;必须显式记录旁白时长。每个镜头内部必须包含 2–4 个时间分段,且分段范围覆盖该镜头的精确时长。每段写明时间区间、画面动作或情绪节拍,以及运镜方式。画面焦点必须直接回应当时旁白:旁白说“食物出锅”,就要出现食物出锅;旁白描述情绪,就要通过清晰的表情和姿态表达同一情绪。

旁白进入新转折时,画面不能继续停留在上一段静态氛围。相邻镜头之间保持空间关系和角色身份连续。

audio_layers

在 narration 模式中,放可选的跨镜头 BGM 计划和每镜旁白参考。在 dialogue 模式中,增加对白表,字段包括 speaker、line、start、end、shot_id、voice_id 和 mouth_state;对白、可选旁白、BGM 与镜头内烘焙的 SFX 保持独立角色。在 narration+dialogue 混合模式中,每个镜头还必须增加 audio_timeline,记录 narration_start、narration_end、dialogue_start、dialogue_end、audio_gap 和 shot_duration。说话时间窗不得重叠,任何有意重叠都必须经过明确确认。不要把已经由视频镜头烘焙的 SFX 放入此处。

旁白音色锁定

只要使用旁白,在任何视频生成、视频合成或旁白生成之前,Storyboard 文档必须包含已锁定的 narration_voice 区块,记录:语言和口音、感知到的性别与年龄感、音色特征、语速、情绪范围、叙事风格,以及一个固定的 voice_id。所有旁白片段必须使用同一个 voice_id 和同一套音色设置,不能每个镜头重新选音色。如果用户没有指定音色,先准备音色选项并在继续前锁定一个。

故事板验证

展示故事板前检查:

  • 每段旁白都归属到明确镜头;
  • 每个镜头都有 2–4 个时间分段;
  • 每个分段都同时包含动作和运镜;
  • 每段旁白都有明确时长,且对应镜头与旁白时长完全相同;
  • 在 dialogue 模式中,每句对白都有唯一说话者、稳定音色绑定、明确时间和对应镜头;
  • 只要使用旁白,Storyboard 就必须包含完整锁定的 narration_voice 区块,记录语言/口音、性别/年龄感、音色、语速、情绪、叙事风格和固定 voice_id;
  • 在 dialogue 模式中,每个镜头都明确当前说话角色,画面中其他角色保持闭嘴或处于反应状态;
  • 旁白原文完整保留,既不截断也不以不自然的加速硬塞;
  • 镜头时长与自然朗读所需文案量匹配;
  • 画面动作和旁白语义一致;
  • 每个需要复用的角色与场景都有元素定义;
  • 没有误导为微缩模型、玩偶、娃娃或玩具舞台的表达。
  • 每个变身、伪装或持续性角色状态变化都已经分别生成参考资产,并在变化前后的镜头中明确绑定;

暂停并展示镜头结构,请用户确认分镜,以及画面与旁白的对应关系。

第四步:生成角色、场景和道具元素图

按元素类型批量生成所需元素,每个元素一张图。生成元素图前,必须展示图片清晰度选项卡,且只能提供两个选项:1K 和 2K;如果用户已经明确选择其中一项,则不重复询问。锁定用户选择,并将其用于本项目所有生成的元素图。如果当前图片生成能力不支持该选择,先说明不兼容并请用户选择兼容路径,不能静默替换清晰度。使用项目已锁定的画幅和已选图片清晰度,以白底三视图输出:从左到右依次为正面、侧面、三分之四背面。用户已经提供合格元素图时直接绑定,不重复生成。

每条元素图提示词开头必须原样包含以下视觉锚点:

wool felt animation style, real-world scene and characters rendered entirely in wool felt material, visible fiber texture covering all surfaces, soft rounded forms with no sharp edges, smooth and fluid motion, natural movement, warm muted color palette — full-size felt world at realistic scale, NOT miniature, NOT diorama, NOT puppet, NOT toy figurine; characters have clearly defined facial features (eyes, nose, mouth fully visible and readable)

随后补充具体主体描述、至少两项材质细节(如 visible wool fibers、slightly uneven handmade surface、soft fabric sheen、felted texture)、低饱和色彩和固定三视图构图。统一使用柔和漫射光,不使用强烈硬阴影。不要要求图像模型渲染文字。

所有元素图完成后暂停,请用户确认羊毛毡质感,以及角色和场景身份的一致性,再进入视频生成;项目中继续保留已锁定的图片清晰度。

第五步:逐镜头生成视频

生成第一个视频镜头前,必须展示视频清晰度选项卡,且只能提供两个选项:768P 和 2K;如果用户已经明确选择其中一项,则不重复询问。锁定用户选择,并将其用于本项目所有生成镜头和最终视频衍生版本。随后严格按照故事板顺序,每次只生成一个镜头,并使用项目已锁定的画幅和视频清晰度。若同时存在角色正面元素图和场景全景图,优先组合使用。使用故事板设定的镜头时长和完全一致的内部时间分段。每次调用视频生成前,必须核对该镜头时长与该镜头完整的 audio_timeline 完全一致。混合模式还必须核对旁白和对白都落在镜头内、说话时间窗互不重叠,并完整覆盖旁白时长;不一致时先修复音频时间轴和镜头时长契约,不能直接生成。

视频提示词按以下顺序编写:

  1. 参考图绑定,使用 <<<image_1>>> 等有序占位符;
  2. 完整羊毛毡视觉锚点;
  3. 现实比例的场景氛围;
  4. 每个故事板分段对应的时间码动作与运镜;
  5. 使用 <soft fabric rustling>、<quiet kitchen ambience> 等自然 SFX 标记;
  6. 末尾固定追加:no subtitles, no text overlay, no sharp edges, no realistic human skin, no CG glossy material, no puppet, no doll figurine, no miniature diorama, no toy stage。

优先使用缓慢推进、柔和跟拍、轻微平移和自然推轨。避免手持抖动、快速变焦、生硬运镜、剧烈挥动、僵硬动作和随机场景跳转。如果旁白是独立音轨,使用 <no dialogue, narration on separate track>,不要把旁白原文塞入视频提示词。在 dialogue 模式中,使用已确认的说话者绑定和时间码;只让当前说话角色做张嘴说话动作,其他可见角色保持闭嘴或做反应,不能让旁白或 BGM 触发口型。镜头内生成的原角色对白音频是默认对白音轨,合成时必须保留。 对于变身镜头,如果画面中同时可见变化前后状态,必须同时绑定两种角色状态,明确描述变身节拍;变身后的后续镜头统一使用变身后参考图。

每个镜头生成后都必须暂停,请用户确认羊毛毡质感、角色连续性、SFX 和节奏。只有用户明确确认后才能生成下一镜头。若某镜头失败,只修复该镜头,并保留已确认的故事板契约;不要重新生成已经确认的镜头。

第六步:生成旁白,并在第一版成片后推荐 BGM

所有视频镜头逐一确认后,按照已锁定的音频模式准备最终合成。narration 模式中,如果用户确认需要旁白,先生成旁白,使用故事板各镜头中的旁白文案参考并保持原文和顺序不变。所有旁白片段必须使用 Storyboard 已锁定的 narration_voice 区块和固定 voice_id;除非修改并重新锁定 Storyboard,不得替换音色。dialogue 模式中,镜头确认后不再生成新的对白 TTS,直接使用并保留每个已确认视频镜头内生成的角色原配音。在混合模式中,旁白使用已锁定音色生成,角色对白保留镜头原配音,两者严格按照 audio_timeline 放置;不能把两条未经排程的完整音轨直接叠加。只有用户明确要求替换或增加独立对白音轨时才额外生成。

在 narration 模式中,每个镜头对应一段旁白,或使用其他明确保留镜头边界的定时结构;旁白音频时长就是对应镜头的时长契约。

合成前逐对检查:

  • 旁白文本与已确认故事板原文完全一致;
  • 旁白时长与对应镜头中的旁白时间窗完全相同;
  • 混合模式下旁白和对白时间窗不重叠,所有音轨都遵循已确认的 audio_timeline;
  • 没有被截断、意外留出空白,或被迫不自然加速;
  • 全部旁白按镜头顺序完整存在。

如果任意一对不通过,只修复对应的旁白或镜头时长并重新检查;所有配对通过后才能合成。旁白版成片生成后单独请用户确认。

在 dialogue 模式中,检查每个已确认镜头内的原角色对白音频:说话者、台词、时间、音频存在性和镜头是否与对白表一致;确认当前说话者是唯一张嘴角色,除非该镜头明确设计为反应镜头或画外对白。若对白或口型状态失败,只修复对应对白或镜头。除非用户明确要求,不得用额外生成的 TTS 替换镜头原配音。

不要在这版旁白成片之前询问或生成 BGM。旁白版最终成片生成并检查后,先在推荐中明确告知最终成片的精确时长,再推荐匹配的器乐 BGM,询问是否需要 BGM 版。用户确认后,生成一条以最终成片时长为目标的器乐音乐,不强求原生时长完全一致。如果音乐工具返回的 BGM 过长,直接裁剪到成片时长;如果 BGM 过短,按需循环并将循环结果裁剪到成片时长;禁止强行拉伸,也不必仅因原生时长过短或过长而重新生成。混音时保证 BGM 清晰可听,同时通过自动闪避或音量控制避免遮盖旁白和环境音。BGM 版必须作为新的独立资产输出,原本的无 BGM 旁白版保持不变并继续可用,然后单独确认 BGM 版成片。

第七步:最终合成与交付

按照故事板顺序组接全部已确认镜头,先完成镜头与旁白逐对等长的旁白版成片。只有旁白版成片生成并确认后,才可追加可选 BGM 版。只加入用户明确确认的音频层,遵守 SFX 契约,避免重复叠加音轨。

最终输出前检查:

  • 最终比例与项目已锁定的画幅完全一致;
  • 构图、安全区域、元素图、镜头提示和最终合成都使用同一已锁定画幅;
  • 所有生成图片资产使用已锁定图片清晰度,所有生成视频资产使用已锁定视频清晰度;
  • 所有必需镜头都存在且顺序正确;
  • 角色和场景身份保持一致;
  • 没有故事板标签、辅助线、字幕或提示词残留;
  • 旁白完整存在,且每个旁白/镜头配对时长完全相同;
  • 只要使用旁白,所有旁白片段都使用 Storyboard 已锁定的 voice_id 和同一套音色设置;
  • 在 dialogue 模式中,每句镜头原配音对白都完整、归属正确、时间对齐,并匹配正确的说话或反应状态;
  • 在 dialogue 模式中,除非用户明确批准替换或追加对白音轨,否则保留镜头内原角色对白音频;
  • 每个发生变身、伪装或状态变化的角色都有经过检查的前后状态参考图,并在变化前后保持视觉连续;
  • BGM 仅在旁白版成片生成并确认后追加;
  • BGM 不强行拉伸;过长时直接裁剪到成片时长,过短时允许循环补足后再裁剪到完整成片时长;
  • BGM 清晰可听,但不能盖住旁白;
  • 原本的无 BGM 旁白版保持可用且不被修改;
  • BGM 版作为独立新资产输出,不能原位覆盖原版本;
  • 总时长与音频严格按照已确认的时长契约对齐。

展示最终视频及关键制作资产,然后引导用户导出成片。没有可用的最终资产引用时,不得声称制作完成。

Signals

GitHub stars
26
Last commit
Sep 2026
Advanced
Item type
skill
Key
wool-felt-story-short
Source
github.com/qxryz/workflowgenerator