Visual Multimedia

SkillMedia

Turns confirmed content sources or assets into editable, previewable, exportable technical illustrations, GIFs, HTML animations, Live Photos, product feature promo videos, other videos, audio, or podcasts, and reviews or writes titles, voiceover scripts, subtitles, show structure, and accompanying p

Available today. Use it from your connected AI after setup.

Connect ahel once, and every AI you use reads what you have installed.

Then ask your AI: use the Visual Multimedia skill

What this skill tells your AI

The instructions your AI receives, as published by cheshiremew/visual-multimedia in SKILL.md and read by ahel’s review.

目标与边界

把成立内容转化为合适的媒体表达,并保留可修改的制作真源。Agent 负责载体判断、媒体文案、样稿、制作、修改、导出和真实结果检查;具体观点、事实、经历和来源仍由用户输入或上游内容真源决定。

适用于:

  • 从确认内容中选择载体,起草或修改标题、画面文字、口播、字幕、节目结构和媒体配套帖子,并按需维护口播声音、案例和钩子库。
  • 把技术图解、B-roll、动态图解、GIF 和多场景动画做成可编辑网页,再以手动、自动或混合播放派生所需媒体。
  • 剪辑讲课、访谈、实拍、录屏、音频或播客,并从已有视频派生字幕金句拼图。
  • 按明确参考复刻或对齐视频;建立或采用二次元口播角色;制作采访原声讲解型视频或有真实证据的 GitHub 项目介绍视频。

不适用于独立静态卡、社交卡、纯文字卡、轮播图或独立封面,也不适用于研究核查、独立文章、拍摄规划、PPTX/Keynote、账号运营与发布。仅支持从视频及事实转写派生字幕拼图,不扩展为其它静态设计;其它独立静态请求停止,不改做视频。

用户只点名本 Skill、未说明成品时,只在仍支持的载体中给出首选及理由;没有合适载体就在媒体文案后停止,不为避开静态卡强加运动。用户明确要受支持成品时直接进入对应功能区,不比较载体。

任务工作区与交付位置

所有生成任务先估算峰值字节,用 node scripts/media-task-workspace.mjs preflight --task-id <稳定任务-id> --expected-bytes <字节> 通过容量闸门,再以同一参数执行 ensure。制作真源、中间文件、预览、报告、渲染和成品都留在本 Skill 的 artifacts/<task-id>/;大型派生缓存只能进入本机已配置且有上限的缓存根。本文的“项目目录”均指该目录或其子目录。当前终端目录、活动 Git 仓库、输入项目和外部交付位置都不是生产目录。结束时运行 inventoryfinalize --status completed|failed|interrupted;没有删除授权只报告清理候选。

用户点名外部交付目录时,仍先在 Skill 内制作和检查,只复制最终文件;Skill 内真源、报告和成品继续保留,外部副本不成为修改入口。外部产品服从自身配置,但可移交真源、快照或交付结果必须收回任务目录。未点名外部交付时,不向其它项目写生成文件。

当前视频默认基线

中文视频最终默认显示中文主字幕,下方为英文小字幕,两层共用真实声音边界。原创中文视频先交完整中文字幕,确认后再做英文、声音、方向和样片;中文变化使下游失效。合成旁白默认使用注册声音 game.honkai-star-rail.silverwolf.default,由 GPT-SoVITS speech.synthesizespeed_factor: 1.25 生成。中文句子中的英文、缩写和英文专名保留正式拼写,与中文整句混合合成;实际试听确认读音异常后,才在项目发音表中改用中文谐音并重新整句合成。字幕和屏幕文字仍用正式写法,不默认拆分中英文音频。用户指定其它读法或声音时覆盖这一基线。真人原声或现成旁白先确认复核转写整理出的主字幕,再按真实声音定时。

入口判断与内部边界

先确定成品、确认内容、受众、已授权素材和规格,再选路径。没有明确点名或授权时,不搜索、不枚举、不打开、不预览这些视觉文件。各功能区只接收所需内容、已授权素材和确认结果:

  • 用户已经指定独立静态卡、社交卡、纯文字卡、轮播图或独立封面时,按目标边界停止,不创建 HTML、画布或图片,也不把请求升级成结构化网页。
  • 用户没有指定载体或确实需要跨媒体组合时,才读取 references/content-to-media.md
  • 可编辑网页视觉统一使用 editable-media v6;多场景、动画、结构化编辑、多比例统一管理、MediaFlow Pro、HyperFrames、复杂媒体管线或跨项目网页组件仍按各自需要启用。
  • 视频、音频、播客和二次元角色只在用户要求对应成品时进入自己的 reference。退出范围内的静态请求不会启动这些功能。
  • 运行时和导出检查服从已选路径,不反过来扩大成品范围或重新决定内容、尺寸和视觉方向。

建立二次元口播角色时读取 references/anime-avatar-production.md。只有母版时,先提供 assets/anime-avatar-prompts/motion-source-video.md 的完整提示词和合格条件;完整制作且外部生成已获授权时直接提交。已有校准视频时由 Agent 检查画面,并完成裁切、联系表、口型标注、机器文件和验证;不要求用户逐帧整理素材、编辑 JSON、运行内部命令或确认技术计划。

无骨骼路径使用校准视频的完整人物帧,适合克制动作和普通话口型大体同步。明显动作与高精度口型不能稳定兼得时,在生成前停止并让用户选择音频驱动或分层、骨骼系统。角色建库不套长视频五阶段;confirm-plan 只确认 Agent 已检查技术计划。

默认模式下,用户已经说清时直接执行;缺失信息只影响局部时从现有内容采用保守且可逆的选择。缺口会改变大部分文案、载体、构图或剪辑时,先读取材料和项目规则,仍无法确定再询问一个关键问题。生产位置不属于待猜测输入,始终由本 Skill 的任务工作区确定。

当前请求处于 Plan 模式时,无论上述信息是否已经完整,都先读取 references/plan-mode-creative-interview.md;本 Skill 不自动开启或关闭 Plan 模式。

内容真源不完整时,只补齐媒体表达所需的结构,不自行发明事实、第一人称经历、来源或作者立场。需要外部研究或事实核查时,先说明缺口并取得对应授权;未获得授权时停在现有材料能够支持的范围。

网页视觉、图解或视频包装的输入是研究材料、长稿或尚未确认的草稿时,由当前媒体文案路径直接整理成观众可见文字;完整视频内容读取 references/voiceover-writing.md,轻量画面文字读取 references/media-writing.md。只有用户明确点名 clean-copy 时才交给它处理已有文字。已经确认最终上图文字时不再改写,视觉制作只读取确认后的观众可见文字。

个人或系列内容带有上游确认的 editorial_positionvoice_contract 时分别读取:前者决定媒体文案强调什么、如何评价和说到哪里,后者决定视角、推进、句子节奏、幽默和结尾。两者缺失时沿当前内容真源与用户已确认文案制作,不从视觉参考、制作配方或平台模板推导作者观点和口吻。

同一来源准备派生多个成品,或者当前任务属于连续系列时,读取上游提供的来源标识、来源版本和内容单元标识。每个媒体项目保留这组来源信息,并另外记录项目标识、当前媒体文案版本和实际导出物;来源版本发生变化时,先核对受影响项目使用的主张、素材与文案,再继续导出。

默认正向流程

1. 选择具体载体

根据内容怎样成立和现有素材选择一个首选载体:

  • 技术机制、接口、系统关系、流程或比较确实需要空间关系才能看懂时,优先技术图解;只靠一段文字或清单就能成立、又没有合适时间型载体时,完成媒体文案后停止。
  • 状态变化、数值变化、循环、反馈、局部演示或需要原位逐步显现的关系,优先 GIF 或动态图解。
  • 由代码画面承担的多场景推进、逐步揭示或现场讲解,优先网页动画;需要演讲者决定何时推进时使用手动播放,需要连续观看或导出时使用自动播放,需要页内自动运动但在章节边界等待时使用混合播放。
  • 人物表达、故事、访谈、讲课、实拍、录屏,或多场景价值主要来自连续声音和镜头时,优先视频。
  • 主要价值来自讲述、对谈、访谈、声音氛围或适合伴随收听的连续内容,优先音频或播客。

同一内容适合多个载体时,结合目标受众、已有素材、平台规格、制作成本和信息损失给出一个首选。只有备选能够提供不同的真实价值时才补充。

2. 先完成并筛选媒体文案

制作前先固定标题、节目结构、主字幕和事实边界。原创带语音视频的第一份用户可见成果必须是完整主语言字幕内容,不是提纲、英文、配音、方向或样片;确认后再派生其它内容。

技术图解、网页视觉和视频包装只接收已经确认的最终上图文字;内容尚未确认时先完成上一节的清理与确认,不在视觉功能区再建一套筛选规则。

主字幕按观众理解顺序写,用普通话说明对象、用途、观看价值和事实结果。内部字段与维护术语不进入字幕;必要术语先解释观众能复述的关系。确认后再分配旁白与画面职责。

先选写作动作:只审查就诊断后停止;新写、扩写、重组或改写完整内容时,先确定观众和观看价值,再从确认材料、声音证据及用户指定或适用的完整参考直接写主语言字幕。制作顺序、内部合同和验收不自动成为观众内容。确认后才派生朗读文本。AI 句式是上层问题症状,不建禁词表;术语取舍由观众理解需要决定。错字、格式、等义压缩、短标题、数据标签和简短字幕走轻量路径。

每轮修改综合原始请求、活动真源、有效确认和最新反馈。“在当前基础上优化”保留真源、已确认内容和未被否定的约束。用户指出丑、字小、太密或空白过多时,先定位为内容重排、局部换装或整体改版,只让受影响层失效。“太丑”本身不等于整体改版;沿当前基础优化时不得换模板或从空白重建。内容或比例变化后重新计算整张画布。

媒体文案默认由当前模型起草,点名其它生产者时才切换;都使用同一净化材料、声音和参考,并完成同一回读。逐字引用、数据标签、来源和确认内容保持原样。

个人或系列媒体文案先按 editorial_position 选信息与评价方向,再从明确指令、声音样稿、口播真源和同语境合格候选生成 voice_contract。缺少个人声音证据时保持普通直接,不从案例、钩子或 AI 草稿推导。时长与密度由成品职责决定。

已确认最终上图文字时不再改写;只有材料或长稿时由当前媒体文案路径形成并确认上图文字。技术图解、网页视觉和视频包装按阅读目的选择文字、表格、图形、图片或组合;图形仅在更易理解或用户明确要求时使用。只要求文案时交付后停止。

3. 建立语义片段和时间结构

时间型媒体先把已确认的主语言字幕稿拆成连续语义片段,记录新增信息、声音范围、画面职责、进入退出和真实时长来源。用户未点名 B-roll 也要逐段判断:能增加证据、场景、动作、情绪、结果或剪切连贯性才采用,否则保持现有画面,不逐句切换。代码生成网页把片段变成场景和步骤;实拍或录屏剪辑只从已明确提供或授权的素材选取、定格和切点,不建网页场景。生成、采用或录制声音后,以实际音频更新时间边界,但不反向改写已经确认的字幕含义。制作备注、暂停提示、调试信息和审阅标签不进入观众可见字段。

代码生成网页的运动按当前含义选择:持续现象使用片段内循环;方向性变化完成一次演进后保持结果;反馈关系使用保留累积状态的局部循环;比较保持可同时读取;概念切换承接前后对象;结论允许稳定停留。需要延长网页画面时,只延长当前片段的运动或状态。已有素材怎样补足时长只由视频后期路径决定。

无实拍视频、代码动画或动态图解由运动本身承担主要表达时,在实现前再确定贯穿当前段落或相邻场景的运动载体、它的开始和结束状态、真正改变含义的动作、前后承接锚点以及文字只负责什么。承担推进、因果、转折或兑现的片段必须让状态变化直接可见;结论、证据阅读和刻意停顿可以稳定保持。不能用标题、卡片或截图轮流淡入代替本应由对象关系和状态变化表达的内容。

代码动画的每个步骤都写明开始、变化、结果或保持状态及其实际含义。复杂场景先由真实内容确定需要审阅的开始、全部关键变化和结果状态,再实现状态之间的运动;不固定状态张数,也不用模糊完成百分比代替可见结果。只有镜头平移、缩放、视差或焦点变化确实帮助解释空间关系或注意力转移时才使用镜头;纯对象显隐、数值或位置变化不为装饰套镜头。镜头、对象动画和持续可读文字各有唯一图层边界,并由同一时间线定位。

固定时长存在时,先在内容层调整取舍和表述,再生成或更新声音与画面。轻微语速调整可以用于消除小幅时间差;会损害可懂度的压缩改为修订文案或视觉结构。样稿通过后,完整成品从全量媒体文案和语义片段扩展,不把代表性样稿重复成整片。

4. 确定制作真源

每类成品只保留一个活动制作入口:

  • 网页真源:技术图解、多场景、动画、结构化编辑、多比例统一管理、外部渲染、复杂媒体管线或跨项目复用统一使用 editable-media v6 网页包。交互演示、图解图片和网页派生视频都从已经选定的网页真源导出,不在导出阶段升级工程。
  • 视频时间线:用户已有的实拍、讲课、访谈、录屏或多场景视频,以及需要声音装配的最终视频。先用产品无关的 media-timeline v1 建立可移植时间线;MediaFlow Pro 已配置且导入能力就绪时优先导入,成功后活动真源迁移为 project.mfp。没有可用 MediaFlow Pro 时,media-timeline v1 继续作为完整活动真源。
  • 音频时间线:录音、访谈、旁白和播客。
  • 混合项目:网页只负责代码生成的图形、字幕版式和动画;视频时间线只负责现有素材选择、剪切、定格、声音和最终装配。两者在装配处汇合,不互相借用生产规则。

代码生成视觉需要进入结构化媒体编辑器时,网页包继续保存结构和动画,编辑器项目只保存该片段的文字、布局、样式和时间覆盖值。人工调整和后续 AI 调整都通过编辑器公开的同一种片段状态操作完成;只有增加组件、改变结构或重写复杂动画时才修改网页包本身。

内容、样式、布局、时间线和输出设置分别集中保存。用户反馈后修改对应真源,再重新预览和导出;不把截图、GIF、音频或视频成品变成第二个编辑入口。

5. 选择并继承制作配方

先定表达形式,再按结构化网页、时间型视觉或专项路径的规则选择配方;只有结构化网页和系列复用才建立项目风格档案。视觉案例、布局模板、配色卡和字体预设各自只承担既定职责,不能替代当前内容与成品判断。

制作配方只决定视觉表面,不替换已定表达形式;内容、文字和构图分别读取 editorial_positionvoice_contract 和当前内容关系。风格档案保存共享核心及适用实现层,不复制画布、文案、字段和分区。网页动画另定运动载体、状态和节奏;实拍、访谈、录屏和剪辑视频只在包装中继承共享核心。声音语言独立保存,不从视觉参考推导。

网页案例只证明机制、容量和验收,布局模板只提供结构,配色卡只提供颜色职责。系列或结构化项目以 style-profile.json 保存可复用视觉身份。“看看、参考、分析”等要求不等于采用;用户明确要求使用某张配色卡、模板或参考层时,必须在真实画面中落实,不能用读取目录或写入记录代替。案例和模板本身不创建独立静态卡入口。

6. 用可展示成果分阶段确认

新的或实质重做的长视频、混合视频、音频和播客统一读取 references/staged-media-production.md,按五阶段提交真实成果并停止;只有全自动授权才连续推进。反馈使最早受影响阶段及下游失效,保留未受影响上游;明确的低成本局部修改不为形式重走五阶段。

进入导演方向、样片、付费模型、批量制作、大规模转码或高成本渲染前,原创视频必须已经有用户确认的完整主语言字幕内容。综合样片使用已经允许的真实素材、声音和主要合成元素,覆盖会重复出现的版式或声音家族;完整预览覆盖全量内容、节奏、字幕、声音和连续性。参考样本只影响用户要求参考的层面。

7. 制作、检查与交付

制作只使用用户提供或明确允许查看的素材;未授权项目图片不得枚举、打开、预览、采用或影响风格。素材进入项目后由 v3 media-sources.json 记录文件、来源、权利、生成过程和声音身份;导入与采用分开。注册资源先解析稳定 id 和版本再显式采用,不能替代素材账本。外部搜索、付费素材、模型调用、安装和大规模转码均需明确授权;公开使用前核对许可与署名。

先检查活动真源能打开、播放和修改,再在真实浏览器或播放器中检查关键状态,最后检查指定导出。技术检查覆盖文字与字幕、裁切、层级、时间、音画同步、声音可懂度、编码、尺寸、时长和文件可用性;内容完整、受众可懂和视觉方向分别按活动真源与确认风格判断。技术通过不能写成内容或视觉通过,待确认样稿不能称为最终设计。

默认先说明载体和结果,再提供媒体文案、可编辑真源、预览或样稿、指定导出及必要规格。用户只要求其中一层时只交付该层。

任务路由

只读取完成当前任务需要的 reference:

任务读取资源读取目的
需要在本地基础制作、MediaFlow Pro 原生增强和 HyperFrames 网页渲染之间选择references/production-providers.md先按真源和交付要求选定提供方;没有 MediaFlow Pro 时仍使用完整本地能力,不在失败后静默换路
已确认主语言字幕需要视觉导演,或需要决定真人、无人物及授权画面谁出镜references/video-direction-contracts.md绑定确认字幕与授权素材;短开场、章节路标、功能前价值主张或呼吸位主动选择全屏编辑标题卡,其它画面按关系与证据建立计划
外部生成服务的素材尚未下载并进入本地素材账本references/external-generation-jobs.md在素材入账前管理规范化输入、费用授权、一次性提交锁、远程恢复、实际费用和本地化
选择载体、确定媒体文案职责、分镜或节目结构references/content-to-media.md确定内容真源、受众称呼、媒体职责和文案合同
新写、扩写、实质重组、审查或审查后改写原创视频完整内容、口播、旁白、播客独白或主持连接语references/voiceover-writing.md视频先交付面向观众的主语言字幕稿,确认后派生朗读文本;音频成品仍交付可直接朗读正文
起草或派生标题、数据标签、简短字幕、画面文字、发音文本、说明文字或媒体配套帖子references/media-writing.md执行轻量媒体文字、等义压缩与确定性派生,不重新发明完整口播
定位或维护口播声音与完整案例references/voiceover-reference-library.md管理声音资格、完整案例和案例索引
检索、保存、更新或验证独立口播钩子references/voiceover-hook-library.md使用独立入口与索引,把连续原文交给口播写作
选择或继承视觉与动效配方references/visual-production-profiles.mdreferences/visual-production-profile-recipes.md只加载当前适用配方
查看、比较、采用或管理视觉案例与布局模板references/visual-resource-governance.md隔离证据检查、视觉采用、模板实例化和项目风格
没有用户、品牌、参考或已确认项目配色,需要为当前视觉选颜色references/color-palette-production.md从六张内置卡中选择一张,只继承颜色职责,不套用版式或字体
文字进入技术图解、字幕包装、网页动画或视频画面,并需要选择、继承或核对字体references/typography-production.md按内容职责选择标题、正文和元信息字体,记录真实来源与字重,并证明浏览器实际命中
建立或继承项目、系列的声音素材角色与混音规则references/sound-production-profiles.md使用独立声音档案引用真实 audio source id,不把声音规则混入视觉档案
查找、注册或采用创作者素材、通用制作素材、网页组件,发布编辑器可浏览的 MG、音效、转场、特效、缩放或 LUT 目录,或从项目晋升可复用成果references/reusable-media-resources.md使用不可变注册版本与带权利、预览、哈希和采用方式的目录,经现有素材账本、完整网页包或正式编辑器操作进入项目,并保存采用与晋升证据
多场景图文、GIF、HTML/React 或可拆分对象动效references/web-visual-production.mdreferences/web-motion-and-derivatives.mdreferences/semantic-graphic-motion-production.md建立 v6 网页真源,按内容关系制作场景与对象
技术概念、接口、工具或系统关系需要静态机制图、对比图,或保持全貌不变的动态流程图references/technical-diagram-production.md分配画面信息职责,建立可读机制、正交连接、稳定图层、同色流光和浏览器几何验收
把已确认的网页、桌面应用或移动产品功能制作成有真实界面证据的宣传片references/product-promo-production.md使用正式 profile、页面采集、镜头配方状态、功能覆盖和计划确认,并沿 render → review → finalize 完成真实构建、审阅与交付;拒绝把仅参考配方冒充已实现镜头
把已经确认内容真源和真实证据的 GitHub 仓库制作成约一分钟横版介绍视频references/github-project-intro-production.md使用 github-project-intro@1.0.0;沿 create → 确认中文 content → prepare → validate → plan → confirm-plan → 综合样片 → render → review → finalize 执行,未授权项目图片不进入候选
口播需要流程、时间线、层级、因果、工具链、比较、拆解、指标、前后证据或真人分屏等解释型画面references/explanatory-broll-production.md由导演计划自动选择活动模板;MediaFlow Pro 对应能力就绪时优先用它装配和导出,否则保留本地完整制作
用户明确要求按参考视频复刻、匹配、逐帧对齐或比较候选成片references/reference-video-alignment.md确定真实参考区间、目标还原层级、精确回放或参数化重建路径,并建立资产、运行时和交付证据
文字本身的进入、退出、替换、强调或逐字素、逐词、逐行构建承担主要表达职责references/text-motion-production.md从行为去重的正式目录选择效果,把分段和执行配方接入既有确定性时间线,并用当前真实文字审阅
网页视觉中使用照片、截图、产品图、生成图或视频帧references/visual-asset-placement.md确认素材来源,按场景槽位处理主体、文字安全区、截图完整性和各输出变体裁切
新的或实质重做的长视频、混合视频、音频、播客,或其它跨轮高成本时间型媒体references/staged-media-production.md用通用五阶段提交真实成果、逐阶段验收、记录全自动授权并控制局部失效范围
视频、音频或播客实际进入素材导入、Faster-Whisper XXL 转写、片段选择、长任务状态、审阅和分级交付references/media-project-contracts.md使用唯一素材账本、事实转写、原片与代理关系、项目状态、结构化审阅和机器可读交付报告
制作带语音的视频,或从最终旁白、最终合并视频、已复核转写生成可交付字幕references/media-project-contracts.mdreferences/subtitle-production.md原创视频先确认主语言字幕内容;最终声音只提供时间,再生成唯一字幕时间线、SRT、VTT 和短语级质检报告
从已有视频与事实转写制作字幕金句拼图references/media-project-contracts.mdreferences/subtitle-quote-image-production.md默认原片无烧录字幕;按完整观点选内容、按可读性拆显示行;中上英下、不显出处;全部同字号并复用第一句背景,每行只保留文字与最小内边距
把网页素材交给 MediaFlow Pro 继续精调、混剪、配音、字幕、外部转写,或导出透明覆盖层与普通视频references/structured-media-editor-cli.md从本机配置定位公开 CLI,只调用本轮声明的网页、透明媒体、Faster-Whisper XXL 或 GPT-SoVITS 操作
用户明确选择 HyperFrames,把独立的代码网页动画直接渲染成无声视频references/hyperframes-rendering.md从同一 editable-media v6 网页包建立渲染副本,探测实际 adapter,经动态样片门禁后渲染并核对真实成片
剪辑已有实拍、讲课、访谈、录屏或混合视频references/video-post-production.md先建立产品无关时间线;MediaFlow Pro 对应能力就绪时优先迁移为原生工程,否则本地完成;像素界面只承担受限操作
从电影片段、纪录素材、游戏录像、课程、产品实拍、活动记录或录屏制作视频解说,包括只有一条未经处理的源视频时references/source-video-commentary-production.md使用 source-video-commentary@1.0.0;从 prepare 完成获准源片入账、镜头分析、联系表和可用转写,Agent 先写并展示 authoring 中的完整主语言字幕,确认后再沿 synthesize → confirm-narration → materialize → validate → confirm-content → plan → confirm-plan → sample → confirm-sample → render → review → confirm-preview → finalize 制作
建立或使用无需 Live2D 的二次元口播角色references/anime-avatar-production.mdreferences/anime-avatar-rendering.mdAgent 建库并从真实语音生成口播轨
把二次元角色轨放入固定角色窗references/anime-avatar-rendering.md固定裁切和坐标;无声区间保持动态闭嘴
已经选定原声片段,并要用“可选原声钩子 → 必要背景 → 原声证据 → 紧接解释 → 独立总结”讲清访谈references/interview-explainer-production.md采用采访原声讲解型 profile,在 Skill 外项目中冻结计划、保留原声时间码、逐段渲染并分开记录机器、Agent 与用户审阅
用户明确要求 Live Photoreferences/live-photo-delivery.md用同一静态构图生成配对文件,检查元数据、.pvt、联系表和设备导入
编辑录音、访谈、音频或播客references/media-project-contracts.md进入项目合同后继续读取音频与播客后期流程,建立音频时间线并完成清理、结构、混音和附属产物
用户要求合成旁白、点名 EdgeTTS 或 GPT-SoVITS,或需要为视频、动画、播客生成语音references/speech-synthesis.md选择声音入口,派生合成文本,生成原始语音和时间信息,并按真实时长交给媒体时间线
实际导出或交付媒体references/review-and-export.md沿真实链路检查源文件、预览、编码和成品

媒体文案先确定动作、真源、受众和渠道职责。完整内容按需读取声音案例、钩子和口播说明;库不可用时不初始化、不凑数。原创视频、长内容转视频和采访讲解都先交付完整主语言字幕稿,确认后才派生发音、译文并进入导演与渲染。

结构化网页与时间型视觉按需读取视觉配方、网页制作和语义运动说明。文字动效需要时由 scripts/text-motion-library.mjs 选择效果,并物化 assets/text-motion-library/text-motion-runtime.jsassets/text-motion-library/text-motion-binding.js

长视频、混合视频、音频和播客先读 staged production,再从 media project starter 建立项目;综合样片后按构建计划拆分。真实人物素材先建立绑定原片哈希、经听音复核的事实转写。字幕拼图只沿 scripts/subtitle-quote-image.pycandidates → validate → render → finalize 运行;采访专用 profile 只运行 scripts/interview-explainer.mjs,不把普通素材硬套进去。

需要生成声音时读取 references/speech-synthesis.md;音频可视化只让网页负责视觉部分,独立播客封面不在本 Skill 制作。用户明确要求 Live Photo 时才读取对应说明。实际导出只读取 references/review-and-export.md 中与当前结构化网页、视频或音频相符的部分。

口播案例和钩子分别使用 scripts/voiceover_reference_library.pyscripts/voiceover_hook_library.py。二次元口播只通过 scripts/anime-avatar-project.pyscripts/render-anime-avatar.pyscripts/compose-anime-avatar-inset.py,注册库位于 assets/anime-avatar-libraries/;“夜希数字人”按注册资源采用,角色窗用 scripts/self-test-anime-avatar-inset.py 验证。采访原声讲解型和 GitHub 项目介绍只沿上表各自已经列明的完整活动命令链执行,并记录耗时、缓存与真实重试,不用省略内容确认或综合样片的快捷链,也不复制旧项目临时脚本。

实际制作与交付边界

结构化网页、素材处理、私人库、视频、音频、外部工具或复杂导出读取 references/media-production-runtime.md,并只检查当前路径实际需要的能力。HyperFrames 只在用户明确选择时使用;点名声音按 id、名称或别名唯一解析,不暗选默认。

Signals

GitHub stars
24
Forks
3
Last commit
Aug 2026
Advanced
Catalog kind
skill
Gateway key
visual-multimedia
Source
github.com/cheshiremew/visual-multimedia