教育内容工作室

SkillDev tools

Turns topics, questions, class recordings, transcripts, textbooks, or course materials into teachable, learnable, or assessable content, covering learning objectives and path design, explanations and worked examples, classroom activities, exercises with answers, slides and handouts, or educational

Available today. Use it from your connected AI after setup.

Add ahel to your AI once: Claude, ChatGPT, Cursor, Claude Code or Codex. Then ask it to use this.

Then ask your AI: use the 教育内容工作室 skill

What this skill tells your AI

The instructions your AI receives, as published by qxryz/workflowgenerator in skills/library/education-studio/SKILL.md and read by ahel’s review.

先判断用户要解决的学习问题,再选择最小充分的交付路径。首先给出可核对的教学 brief,复杂任务分阶段确认,长内容在规划确认后展开。

交互规则

凡是会实质改变成片或交付拓扑、且可以枚举有限选项的决策,使用 Agent 运行时的 确认卡 工具展示可点击选项,让用户直接点击选择。推荐项放在第一项并标记“推荐”,每个选项用一句话说明效果或取舍。确认卡 作为规划阶段的结构化交互呈现。

适用范围包括:交付形态、成片讲法、视频生成链路、分镜图策略、视觉方向、音色或讲述风格、画幅或平台等硬约束。可合并的决策集中在一次询问中;存在前后依赖时依次询问。低影响细节由 Agent 根据 brief 直接确定。

文本输入用于题目/主题、必须逐字使用的文案、需要用户补充的专有名词和自定义要求。消息或素材中已有的信息直接继承。

画布交付硬门

所有阶段性产物必须进入 Hub 画布,交付完成以画布节点为准。

  • 初始 Brief.md:使用 画布写入 写入一个可编辑文本节点,包含正文稿、教学 brief、学习目标、候选成片讲法与视觉方向、路线建议和产物清单,不包含视频生成提示词;
  • 视频脚本与提示词.md:用户完成成片讲法、视觉风格和画面生成路线选择后,使用 画布写入 写入第二个独立可编辑文本节点,包含逐镜视频提示词和声音规划;
  • 分镜图、关键帧和其它图片:生成结果必须进入画布;
  • H3 视频片段:生成结果必须进入画布;
  • VO、音乐和音效:生成结果必须进入画布;
  • 可编辑剪辑:使用已打开的视频编辑器插件及其 Agent 能力;若编辑器未打开,先请用户打开对应插件节点;
  • 最终渲染:按编辑器能力说明执行导出,并把结果保留在画布/资产体系。

文本节点写入成功并返回有效 node identifier 后,该阶段才算完成。初始阶段创建 Brief.md;进入正式分镜阶段后创建 视频脚本与提示词.md。聊天说明已生成的节点名称、用途和下一步。

Brief.md 写入完成后,必须立刻基于当前 brief 和风险判断发起下一步 确认卡,让用户用点击选择继续推进;禁止只用文字收尾后等待用户手打“下一步”。若当前存在时长、结构或素材风险,下一步选项必须显式包含“按当前方案继续”和“先调整方案再继续”两类动作。

用户可能直接编辑画布文本节点。进入分镜阶段前使用 最新画布读取步骤 重读最新 Brief.md;进入图片、音频或视频生成前,再重读 Brief.md 和 视频脚本与提示词.md,以画布上的最新内容为准。用户在聊天里提出修改时,先定位对应文档和段落,再用 画布定位 获取精确锚点并通过 锚定文字编辑 做最小修改;只有整篇重写才使用带 预期内容版本 的 画布写入。

任务路由

用户目标主交付
学会一个概念/技能学习目标、先备知识、分步讲解、例题、检查理解
备课/授课教案、板书/课件结构、课堂活动、时间分配、教师提示
练习/考试题目、难度梯度、答案、解析、评分标准、错因标签
科普/对外教育受众化脚本、类比、事实边界、视觉解释建议
微课/教育视频旁白稿、镜头表、字幕、资产清单、音画节奏
课件/讲义页面大纲、每页核心信息、图表/应用材料、讲者备注
素材加工转录、纠错、摘要、术语统一、知识点切片

涉及视频视觉时,按需参考 references/visual-production.md 和 references/education-video-pipeline.md;涉及评量时参考 references/assessment.md。只读取当前分支需要的 reference。

教育视频提示词使用统一风格锚点与逐镜教学字段。旁白直接写入每个视频片段的提示词,与画面事件、动作、文字动效和转场共同生成;视频确认后,再按需要生成独立正式 VO 作为替换或精修层。风格选择、分镜图生成、H3 生成、画布和视频编辑器按照当前 Hub 工作流执行。

标准工作流

1. 建立 Brief(HARD-GATE)

提取或合理推断:主题、学习者年龄/水平、学习目标(最多 3 个)、使用场景、内容深度、语言、输出格式、已提供素材和限制。用户已明确给出的时长作为约束保留;用户未指定时,不在脚本前要求其凭空选择精确总时长。关键缺口通过 1–3 个问题补齐,其余信息采用明确假设继续推进。

把目标写成可观察行为,并为每个目标配置清晰的行为主体、执行动作、完成条件和验收标准。将正文稿和完整旁白保留在 Brief.md,但视频镜头、声音规划和生成提示词统一写入下一阶段的 视频脚本与提示词.md。

  1. 教学 brief:受众、目标、先备知识、使用场景、语言和交付规格;
  2. 候选成片讲法与视觉方向:3–5 套针对当前主题编写的具体成片方案,以及与其匹配的媒介/风格、色彩、材质、构图、镜头语言、信息表达、动效、转场、聚焦原则和负向提示词;
  3. 完整逐字旁白:作为视频脚本的输入正文,标注说话人、讲述语气和发音风险;
  4. 视频脚本与提示词建议:只写脚本结构和生成路线,不在 Brief 中展开逐镜生成提示词;
  5. 生成路线建议:直接文字生视频或先 image-generation model 分镜图再 H3;
  6. 产物清单:旁白、分镜/关键帧、音色参考、H3 视频片段、字幕、可编辑视频项目和最终渲染。

用户修改正文或旁白时,先读取对应画布节点的最新版本并把修改写回 Brief.md;进入正式分镜阶段后,将最新旁白逐镜拆分并计算声音规划,写入 视频脚本与提示词.md。后续阶段不得在没有用户修改请求时自行改写已确认的逐字旁白;收到修改请求时,必须按“定位段落 → 最小编辑 → 重新计数/估时 → 更新受影响镜头、字幕、声音和提示词 → 重新确认”闭环处理,未受影响的镜头和资产继续复用。

Brief.md 中先形成内容完整、语速自然的逐字旁白初稿。初稿完成后按受众对应的基准语速、有效字数和标点/呼吸停顿计算自然发声时长,并计入必要画面缓冲,得到当前脚本预计总时长。随后必须调用真实 确认卡:按照当前脚本和自然语速,预计成片约为 X 秒。这个时长可以接受吗?,固定提供三个方向:接受 X 秒(推荐)、更多的秒数、更少的秒数。更多的秒数注明会增加脚本字数和教学内容,更少的秒数注明会减少脚本字数并精简内容。用户选择更多或更少后,必须先修改 Brief.md 的逐字旁白,再重新计算并再次发起该时长确认;禁止只改总 duration、画面缓冲或语速。时长确认前不得进入正式逐片段脚本。

用户明确给出具体总时长时,将其作为脚本规划的硬约束:先锁定 target_duration_seconds,结合受众语速、标点/呼吸停顿和必要画面缓冲反推 voice_budget_seconds,再组织旁白和镜头,不先写一份超出预算的长稿后强行压缩到视频里。旁白初稿完成后必须计算 voice_required_seconds 与 target_seconds,并按模型合法 duration 校准片段边界;超出预算时优先删减重复信息、合并相邻语义或拆分为系列,不能靠提高语速、删停顿或只修改视频 duration 兜底。

只要 Brief.md 已写入且存在可继续推进的决策,就必须顺手弹出下一步 确认卡,不得只用文字等待用户手打。旁白初稿已完成时优先发起上述自然时长确认;尚未完成时再询问当前必要的内容或成片讲法决策。

先确定成片怎么讲,再确定美术风格。成片讲法使用独立 确认卡,从下面的教育视频叙事形态库中选择最适合当前主题、受众和时长的 3–5 项。选项必须使用“分类名称:一句直白解释”的形式,让用户一眼理解成片结构:

  • 剧情叙事:用一个小故事或具体情景承载知识,角色遇到问题并在过程中理解或解决它;
  • 讲师讲解:讲师或虚拟讲师持续出现在镜头前,直接面对观众讲解,并穿插必要的画面辅助;
  • 角色问答:由两个或多个角色提问、质疑和回答,通过对话逐步澄清知识点;
  • 板书推演:像老师在黑板、白板或数字画布上授课,公式、图形和推导过程逐步写出;
  • 图解海报:以大字标题、知识卡片、图标、图表和信息排版为主体,旁白带动画面逐层展示;
  • 实验实操:围绕真实实验、手部操作或软件操作展开,观众跟随步骤观察过程和结果;
  • 案例观察:先展示真实现象、案例或对象,再通过特写、标注、对比和拆解得出结论;
  • 沉浸探索:让观众跟随第一视角、空间漫游或微观/宏观旅程,在探索过程中发现知识;
  • 混合讲解:以一种主形态贯穿,按知识需要切换讲师、情景、图解、板书或实操片段。

每次只展示对当前任务有真实区分度的选项,并把推荐项放在第一位;不得把只是名称不同、实际镜头结构相同的方案同时呈现。每项除一句直白解释外,再简述它对当前主题最关键的效果或取舍。用户选中后,将其写成“成片讲法锚点”,固定全片的开场钩子、叙事主体、知识载体、镜头推进、信息密度、画面文字比例和结尾结构,并写回规划节点。

视觉方向必须展开成可观察的视觉基准。成片讲法确认后,再使用 确认卡 给出 3–5 个与其匹配的完整风格方向选项,每项说明媒介、构图、材质、色彩、信息表达、动效、适用原因和风险。用户选中后,将选择收敛为统一风格锚点并写回规划节点。风格锚点必须包含:视觉媒介、构图语言、线条与材质、色彩与光影、教学信息呈现方式、镜头运动韵律、聚焦原则和可直接用于生成的负向提示词。成片讲法与美术风格是两个独立决策:美术风格不得替代内容如何展开的结构选择。

规划必须先建立“教学信息 → 视觉证据”映射:每个知识点说明由什么可见动作、空间关系、图形变化、对比、材质反馈或角色反应来证明;每个旁白段落至少绑定一个画面证据。画面直接演示知识关系,相邻段落通过主体、空间、尺度、构图或运动变化持续增加信息。

完整视频脚本先标记声音拓扑:纯旁白、出镜口播、角色对话 或 无人声演示。纯旁白模式以“旁白语义单元”为生成片段;其它模式按台词、人物表演和可见动作共同划分片段。每个片段完整填写:片段编号、声音拓扑、全片时间段、逐字旁白/台词、有效字数、采用语速、基础朗读时长、标点/呼吸停顿、声音开始与结束时间、1–2 秒画面缓冲、target_seconds、计划生成时长、提交 duration、语速负载状态、画面内容、景别与机位、运镜、入镜状态、出镜状态、主体/角色/道具、承担知识点、教学功能、学习者观察任务或理解目标、学科准确性/教师复核点、屏幕文字、声音、关键帧描述和参考素材来源。字段齐备后才进入关键帧或视频生成。

写正式视频脚本和计算片段之前,先核对当前视频能力摘要,确认合法时长、画幅、参考素材与声音边界;必要时读取对应的能力说明。Brief 中经自然时长 question 确认的脚本及预计总时长是全片规划依据;片段数量与每段时长由旁白语义、声音估时和当前能力共同推导,属于执行规划,不再让用户选择“生成几段再拼接”。推导结果必须写入 视频脚本与提示词.md 和项目生成输入合同;如果能力信息使已有拆分失效,先原地更新这两份规划,再继续资产和生成阶段。

脚本完成后建立“项目生成输入合同”,作为全部图片、音频和视频生成的唯一输入源。合同分为项目级信息、跨片段共享资产、当前片段内容和执行设置四层,分别记录项目名称与全片时间、可复用的人物/音色/场景/风格/用户素材、当前片段的画面动作与局部时间轴,以及经能力摘要核准的画幅、分辨率、时长和命名。四层分别维护并进入各自消费位置;自然语言 prompt 由统一风格锚点和当前片段内容编译。

先从完整脚本提取共享实体。任何跨两个及以上片段出现的可识别人物,以及持续出镜的讲师或主持人,都登记为共享人物记录。用户已有合格参考图时登记其路径;否则先生成干净背景的人物资产图,固定脸部、发型、年龄感、体型、服装、配色和标志性配件。每个人物拥有稳定标识、名称、资产路径和适用片段集合。人物资产写入画布后用真实确认卡确认,确认结果更新共享资产表。

共享人物阶段的完成状态必须同时满足:每个跨片段人物都有稳定标识、真实资产路径、适用片段集合和用户确认状态;所有适用片段的生成预览都带有该路径并注明人物职责。只在 prompt 中重复人物外貌不算建立人物资产,任一项未闭合时不得生成视频。

每个片段生成前,按适用片段集合装配共享资产:出镜人物、已确认音色、对应场景、分镜和用户素材都注明各自职责。直接文字生视频路线只决定是否制作逐镜分镜图,不改变共享资产的建立、确认和逐片段装配。

Brief、视频脚本、项目生成输入合同和执行说明是同一份规划的连续表示:后一步只能编译前一步,不能临生成时另起一套片段数量、统一时长、旁白或素材方案。每次视频生成前逐项核对当前片段、局部旁白、计划时长、人物职责和音色职责;任一项与合同不一致时,先更新规划节点,不得用临时决定替代画布合同。

纯旁白模式先计算声音,再设计画面。默认中文教育语速约 3.0 字/秒(约 180 字/分钟),低年级 2.5–2.8 字/秒,高年级 2.8–3.2 字/秒,中学及成人 3.0–3.4 字/秒。每个片段必须先得到 voice_required_seconds = 有效字数 ÷ 采用语速 + 标点/呼吸停顿,再计算 target_seconds = voice_required_seconds + 1–2 秒画面缓冲,并向上匹配当前模型支持的最短合法 duration。不得用非语音动作或观察预留把一句短旁白撑成长视频,也不得先选 8 秒、11 秒或 15 秒视频再把旁白塞进去。若向上匹配后预计出现超过约 2 秒的无旁白头尾,先与相邻连续语义合并或重新切分片段;确有独立无旁白演示时,单独规划为无人声演示或其它合适的声音拓扑。若 target_seconds 超过模型单片段上限,必须沿自然语义边界拆成多个片段并分别重算,禁止通过提高语速、删停顿或让旁白跨片段来兜底。短于模型下限时同样优先合并相邻连续语义。

每个教育视频项目必须使用同一个“基准语速档”作为全片锚点,同一讲述人相邻片段的采用语速不得因字数不同而大幅波动。默认相邻片段语速差不超过 0.3 字/秒;确需更快或更慢时必须由叙事理由触发并写入语速负载状态。教育讲解的硬上限为 3.6 字/秒;任何片段按提交 duration 回算后超过 3.6 字/秒,或缺少标点/呼吸停顿,就必须在生成前改写、拆分或延长,不能派单。

纯旁白片段内部可以有一个或多个画面事件,但数量由旁白语义决定,不得为了填满时长追加无旁白、无教学目的的第二镜头。其它声音拓扑允许为人物反应、口型收束、操作完成或演示结果保留合理画面时间。画面切换发生时,使用局部时间记录切换点、前画面出镜动作、转场方式、持续时间、承接的知识关系和后画面入镜状态;没有真实画面切换时不强制制造转场。

规划包写入画布后、任何图片/音频/视频生成前,必须完成以下六组前置选择,并以用户选择结果作为生成依据:

  1. 成片讲法 question:从教育视频叙事形态库中展示 3–5 个适合当前主题的分类,每项使用“分类名称:一句直白解释”,并补充对当前主题的效果或取舍;
  2. 视觉风格 question:在呈现方式确定后展示 3–5 个匹配的风格方向卡片(媒介、色彩、材质、构图、镜头、动效、适用原因),用户选择后写回规划节点;
  3. 性别 question:女声 / 男声;
  4. 讲述风格 question:清晰亲和的教师讲解 / 活泼有感染力的少儿讲解 / 稳重专业的纪录片讲解 / 用户提供参考音色;两项选择合并为一句“音色锚点”;
  5. 音色参考 question:生成音色参考 / 只用文字在提示词里控制。生成音色参考时用 voice-reference generator 产出 3–15 秒可试听样本,音色、语气更稳,后续片段更容易保持一致;只用文字控制更省积分、链路更快,但音色一致性更多依赖提示词,波动会更大;
  6. 画面生成路线 question:第一项固定为 直接使用 H3 根据逐镜教学记录生成视频(推荐),其后才是 先用 image-generation model 生成分镜图,再交给 H3 作为图片参考 / 两者结合;视觉风格、题材、版式或“更可控”等理由不得改变默认推荐项和顺序;

成片讲法先单独询问;视觉风格、音色参考与画面生成路线可在下一次 确认卡 中呈现。用户已明确给出的选择直接继承。选择完成后必须把结果回写到规划画布节点,后续 Stage 只消费这些已确认值。

教育讲解执行声音融入视频链路:完整旁白先写入画布并拆入逐镜合同;用户选择生成音色参考时,先生成可试听样本并写入画布,再用真实确认卡提供“确认该音色并继续生成视频(推荐)”和“重新生成音色参考”。样本路径登记到共享音色记录,记录音色锚点、适用说话人和适用片段集合;重新生成时更新这条共享资产。音色一经确认,所有适用片段都沿用同一音色并注明音频职责;是否同时存在人物、分镜或其它视觉引用不影响装配。只有能力摘要明确不支持音频参考时,才在规划节点中改为独立旁白替换链路,并在视频生成前向用户说明变化;禁止在能力支持音频参考时退回纯文本路线或只把音色描述写进 prompt。每个视频片段保留已选音色锚点、逐字旁白、讲述语气、局部时间窗口、关键词对应动作、环境声和动作音效;视频确认后按需要生成正式 VO,并依据实际 VO 时长回算片段容量和后期编排。

2. 设计学习路径

按“激活先备知识 → 核心概念 → 具体例子 → 引导练习 → 独立练习 → 退出检查”组织。每个知识点只承载一个认知动作;先给直觉,再给术语、规则或公式;抽象内容必须有例子和反例。

对儿童/初学者:短句、单一变量、可视化和重复回收。 对中高级学习者:明确假设、边界、常见误区和迁移题。 对职业培训:优先真实任务、决策点、检查清单和可执行产物。

3. 选择交付形态

根据 brief 选择一种主格式,可附带辅助格式:

  • 文本课:标题层级 + 关键结论 + 应用材料 + 练习 + 答案。
  • 教案/课件:时间轴 + 教师动作 + 学生活动 + 材料 + 评价点。
  • 题组:题目 → 目标 → 难度 → 答案 → 解析 → 错因。
  • 视频:段落/镜头时间码 → 画面 → 旁白 → 屏幕文字 → 音效 → 资产。
  • 素材加工:保留原结构,明确改动,输出可复核的差异或分段结果。

4. 教育视频生成路线

命中以下输入时,优先走对应路线:

  • 题目/题组 → 动态讲题:重排题面 → 识别已知条件 → 推导步骤 → 标注关键辨析点 → 答案揭晓 → 练习迁移。
  • PPT/文档 → 课程视频:提取页面层级 → 保留版式与品牌 → 补写旁白 → 将页面元素映射为动画 → 生成章节与字幕。
  • 教材/长课 → 知识点短视频:切分知识点 → 生成标题和封面文案 → 统一片头/片尾 → 输出 30 秒、1 分钟或 3 分钟版本。

每条教育视频在 Visual Gen 前选择一种生成链路:

  1. 直接文字生视频(推荐):教学脚本 → 统一风格锚点与逐镜教学记录 → H3 视频。适合快速验证,尤其适合台词和画面对齐要求高、希望减少中间修改步骤的内容。
  2. 分镜图参考链路:教学脚本 → image-generation model 生成独立分镜图 → 使用 确认卡 提供“确认全部分镜并生成 H3”/“需要修改分镜” → 用户点击确认后,H3 使用已批准的图片参考并生成视频。适合画面需要更强可控性、修改成本较低的场景。禁止用纯文本询问用户“是否确认”,也禁止要求用户自行输入确认词。

如果用户已明确指定链路,直接遵循;其余情况在进入 Visual Gen 前使用 确认卡 提供“直接使用 H3 生成视频(推荐)”和“先生成分镜图作为参考再生视频”两个可点击选项。“直接使用 H3”始终放在第一位并标记推荐,不根据视觉风格、题材或静态可控性改推分镜图;分镜图路线只作为用户主动选择的备选。分镜图数量依据需要明确的画面状态确定,每张图承担清晰的主体、场景、构图、材质或文字版式参考任务。

教育视频默认使用 MiniMax H3。正式脚本拆分前必须先核对当前视频能力摘要并读取必要的能力说明;未读取时不得确定片段数量、计划时长、编译提示词或启动 H3 生成。片段时长和生成设置遵循当前可用能力。存在分镜图、用户图片、参考视频或参考音频时,使用 H3 全能参考模式;分镜图统一作为图片参考。用户明确指定其它模型,或当前会话需要替代模型满足硬约束时,通过确认卡呈现可用模型选项。

复杂视频任务按以下阶段推进,每阶段产物可单独修改:

教学 brief → 内容研究 → 成片讲法 question → 成片讲法锚点 → 风格 question → 统一风格锚点
→ 完整讲解脚本/旁白初稿 → 计算自然总时长 → 总时长 question → 确认脚本与总时长
→ 逐镜教学合同 → 分镜图/关键帧确认(按所选路线)
→ 统一风格锚点 + 对应分镜 + 已确认参考素材 → H3 视频生成并确认
→ 视频生成阶段同步产生旁白与原生声音 → 确认 → 按需生成正式 VO 替换或精修 → 视频编辑器内混音 → 渲染 → 教学质检

分镜图参考链路中,直接使用 image-generation model 为需要明确的镜头生成独立分镜图。每张图完整呈现主体、场景和稳定构图,生成后进入画布供用户确认,并作为 H3 的已批准图片参考。分镜图提供主体、场景、构图、材质、色彩和文字版式依据;动作发展、事件顺序、运镜、转场、内部切镜、文字动效和声音由对应逐镜教学记录规定。

成片讲法用于规划脚本和决定逐镜结构。视频提示词由三部分组成:统一风格锚点原文、当前生成片段的完整分镜内容、已确认参考素材及其作用。统一风格锚点包括视觉媒介、构图语言、线条与材质、色彩与光影、信息表达方式和负向提示词;其原文写入可编辑分镜脚本,供分镜图和视频生成逐字复用。当前片段使用局部时间轴完整描述:计划时长、画面、景别、运镜、入镜状态、出镜状态、转场设计、主体/角色/道具、对应逐字旁白及局部时间窗口、承担知识点、学科准确性、关键帧描述,以及已确认的文字、动效、剪辑与声音要求。镜号、全片绝对时间、拆分编号和制作备注保存在分镜表与编辑项目元数据中。

生成视频时,从输入合同编译两份独立产物:模型 prompt 由统一风格锚点与当前片段内容组成;执行说明由项目级信息、执行设置和已确认共享资产组成。画幅、时长、命名、片段顺序与全片时间保留在规划记录中,人物、音色、场景和分镜素材按职责附加。模型 prompt 以当前片段中可见、可听、可执行的内容开头,完整表达画面、人物动作、局部时间轴、逐字旁白/台词、屏幕文字、声音设计和参考素材作用。每个片段内部存在多个已规划画面切换时,逐一写出转场;相邻视频片段之间的衔接进入两侧片段内容与编辑计划。详细写法见 references/education-video-pipeline.md。

片段提交以合同完备为准:当前片段有完整局部时间轴和逐字声音内容;执行设置符合当前能力摘要;涉及的共享人物、音色和场景均已确认并注明职责;项目级信息已映射到最终文件和编辑时间线。四项齐备后开始生成。

视频提示词完整保留逐字旁白/台词、讲述语气、局部时间窗口和同步动作,用于让视频模型共同规划画面和声音节奏。每个视频片段建立独立的 0 秒 → 片段结束 时间轴,终点等于计划生成时长,执行设置必须与之相同。纯旁白模式中,旁白结束至片段结束的无声区间超过 1 秒时,必须有明确的阅读、观察或动作完成任务;否则缩短片段、合并旁白或重写画面节奏。出镜口播、角色对话和无人声演示按已规划的表演与动作时间执行。

脚本修改协议(HARD-GATE)

用户提出脚本修改时,按增量编辑处理,不把聊天中的旧脚本当作最新版本:

  1. 读取目标文档的最新画布版本;长文先定位段落/镜号,再按窗口读取上下文;
  2. 提交带精确锚点的最小修改,保留用户没有要求改变的章节、镜头、资产和引用;只有用户明确要求整篇重写时才替换全文;
  3. 修改旁白后必须重新计算有效朗读单位、停顿、voice_required_seconds、target_seconds、片段边界和回算语速,并同步更新受影响的镜头提示词、字幕、VO 和编辑项目时间;
  4. 修改学习目标、核心事实、时长预算或声音拓扑时,回到 Brief.md 重新确认并重建受影响的后续规划;仅改局部措辞时,未受影响的已确认素材继续复用;
  5. 增量编辑必须确认最小修改已应用并重新读取最新文本;整篇替换必须确认重写文档可见并重新读取最新版本。两条路径都必须重新通过时长硬门,不能只在聊天里展示“修改后版本”。

5. 生产与质检

生产前先展示完整规划包;需要用户选择会改变成片的方向或生成路线时使用 确认卡 卡片呈现可点击选项。复杂多媒体任务在脚本/分镜定稿后再进入生成。交付前检查:

  1. 每个目标都有对应活动或评量;
  2. 难度与学习者匹配,术语首次出现有定义;
  3. 事实、公式、引用和单位经过核对;待核验内容明确标注;
  4. 例题答案可复算,题目条件完整且答案指向清晰;
  5. 视频中旁白、画面、字幕逐段对齐,屏幕文字可读;
  6. 输出同时包含创作结果与下一步使用说明。

教育视频额外检查:

  • 公式、符号、题目条件和答案可复核;
  • 旁白、字幕、画面文字与镜头时间线一致;
  • 每条正式 VO 都有唯一对应的视频时间段,关键词落在承担该知识点的画面事件内;
  • 视频编辑器项目保留逐镜视频、逐段 VO、字幕、音乐和音效的可编辑对齐关系;
  • 每个镜头只有一个主要教学目的;
  • 新概念出现后有解释停顿,每个时间窗口聚焦适量新元素;
  • 结尾包含练习、提问或理解检查;
  • 修改请求能定位到具体段落、镜头、卡片或字幕。
  • 画面提供与旁白对应的视觉证据;
  • 相邻镜头通过主体、空间、构图、尺度或运动节奏变化推进信息;
  • 全片包含导入钩子、学生观察/思考任务和结尾回收;
  • 统一风格锚点贯穿脚本、分镜、关键帧和视频提示词。

分镜确认门禁(HARD-GATE)

分镜图全部写入画布后,必须使用真实确认卡,提供“确认全部分镜并生成 H3 视频(推荐)”和“需要修改分镜”两个选项。用户点击确认后才可生成视频;禁止用纯文本询问“是否确认”,也禁止要求用户自行输入确认词。

音色参考确认门禁(HARD-GATE)

用户选择生成音色参考时,样本生成并写入画布后必须立即使用真实确认卡,提供“确认该音色并继续生成视频(推荐)”和“重新生成音色参考”。只有用户点击确认后才可生成视频;选择重新生成时,生成新样本后再次询问。禁止用聊天文字代替确认,也禁止生成样本后直接批量生成视频。用户选择只用文字控制音色时不触发此门禁。

确认音色后,将当前样本更新到 shared_assets.voice。后续视频片段统一通过项目生成输入合同独立装配音色、人物和其它视觉引用。

确认音色的完成状态必须同时满足:样本路径已记录、适用片段集合非空、这些片段的执行设置允许音频参考、生成预览中包含同一路径并注明音色职责。这四项未闭合时不得生成视频。

音色锚点

性别 question 与讲述风格 question 的选择结果必须写入 Brief、逐镜合同和每段视频提示词。提示词顺序固定为“音色锚点 + working_language 旁白原文 + 局部时间窗口与同步动作”。使用参考音频时,音色锚点用 working_language 表达“@音频N 锁定……女声/男声口播旁白”的等义内容。生成试听样本时,把音色锚点与逐字试听台词合并写入 texts,不要加入未定义的额外字段。

时长合同(HARD-GATE)

纯旁白片段必须记录:旁白有效字数、全片基准语速、采用语速(字/秒)、基础朗读时长、标点/呼吸停顿、旁白开始与结束时间、voice_required_seconds、1–2 秒画面缓冲、target_seconds、计划生成时长、实际提交给模型的 duration、回算语速和语速负载状态。计算式为:voice_required_seconds = 有效字数 ÷ 采用语速 + 标点/呼吸停顿;target_seconds = voice_required_seconds + 1–2 秒画面缓冲;计划生成时长 = 向上匹配当前模型支持的最短合法时长(target_seconds);提交 duration = 计划生成时长。出镜口播、角色对话和无人声演示使用“台词/动作/表演总估时 → 最短合法 duration”的合同。任何模式下提交 duration 都必须等于计划生成时长,不得无依据地全片统一套用同一个 duration。若离散合法时长导致纯旁白片段出现超过约 2 秒的无旁白头尾,必须先合并相邻语义或重切片段再派单;若 target_seconds 超过单片段上限,必须按自然语义拆段并分别重算,不得压缩语速硬塞。

语速负载状态固定为:ok = 回算语速不超过基准语速 + 0.3 且不超过 3.4 字/秒;warn = 3.4–3.6 字/秒,只允许短句、复述口诀或紧急指令,并必须保留停顿;blocked = 超过 3.6 字/秒、VO 实测时长长于视频、或为了对齐视频删掉停顿。blocked 片段必须在画布规划中修正后才能生成图片、视频或正式 VO。

生成预算闸门(HARD-GATE)

启动任何图片、音频或视频生成前,必须先做一次全局预检,并在规划节点中记录:旁白总字数、预计总时长、视频片段数量、必要分镜图数量、是否生成 voice-reference generator 音色参考、是否额外生成独立音效,以及预计生成生成次数。预算按生成次数估算,不能只看成片秒数。

  • 纯旁白按旁白语义和模型时长能力拆分,每个片段单独计算并提交 duration;其它声音拓扑按台词与表演/动作节奏规划。
  • 同一连续口播只生成必要的分镜图;没有明确构图变化时,不为每个内部镜头重复生成分镜图。
  • 花字、贴纸、重点条和轻提示音默认作为视频提示词中的事件,不单独生成资产;只有用户明确需要独立可编辑轨道时才额外执行生成。
  • 音色参考是可选调用,必须在预算预检中单列;用户未选择前不得自动生成。
  • 预算未闭合或生成次数异常时,先压缩片段与资产数量并说明预计调用,再进入生成。

Question 确认门禁(HARD-GATE)

成片讲法、视觉风格、性别、讲述风格和画面生成路线:用户未明确时必须通过真实 确认卡 工具确认;用户已明确时继承其选择。生成音色参考后的“确认该音色并继续生成视频 / 重新生成音色参考”和分镜图链路的“确认全部分镜并生成 H3 / 需要修改分镜”始终必须通过真实 确认卡,未收到对应确认前不得启动 H3 生成。

输出契约

默认按以下顺序输出:

  1. 教学 brief:受众、目标、时长、格式、假设;
  2. 内容结构:模块/段落及其目的;
  3. 完整交付物:教案、脚本、题组、课件大纲或素材结果;
  4. 质检结果:事实/教学/格式检查与后续核验项;
  5. 可选下一步:练习变体、视频化、课件化或分层版本。

用户只要一个简单答案时,直接回答并补一个理解检查;用户要求成片或批量产出时,执行完整工作流。

边界与安全

学术引用、考试材料、实验安全数据及医疗/法律结论均使用真实可核验来源。儿童内容采用安全、尊重、保护隐私的表达。涉及敏感或高风险学科时,优先提供权威来源核验点,并将“教学演示”与“现实建议”分开。

Signals

GitHub stars
26
Last commit
Sep 2026
Advanced
Item type
skill
Key
education-studio
Source
github.com/qxryz/workflowgenerator