短剧多语言出海配音
SkillSearchA multilingual dubbing workflow for user-uploaded short dramas or videos. First extract the video's audio track and separate vocals from background sound, then recognize the Chinese dialogue and generate an editable Chinese-English dubbing sheet without speaker or end_time fields. If the user also p
Available today. Use it from your connected AI after setup.
No other account needed.
Add ahel to your AI once: Claude, ChatGPT, Cursor, Claude Code or Codex. Then ask it to use this.
Then ask your AI: use the 短剧多语言出海配音 skill
What this skill tells your AI
The instructions your AI receives, as published by qxryz/workflowgenerator in skills/library/short-drama-multilingual-dubbing/SKILL.md and read by ahel’s review.
当用户上传视频,并希望把中文对白整理成可编辑的英文配音流程时,使用本 Skill。目标产出包括:提取后的音轨、人声与背景声分离结果、不含说话人列的可编辑中英对白表、用户确认后的中文与英文文本、音频复刻 / 官方音色 / 混合方案选择、与原对白时长匹配的英文替换配音片段、字幕时间表,以及最终按原时间轴对齐的英文版音频和英文字幕。
不要把本 Skill 用于普通字幕制作、泛视频剪辑或纯音乐分轨;除非用户同时要求对白本地化、英文配音或配音时间轴对齐。若用户要求字幕,应先按视频里中文字幕的实际出现/消失时间整理字幕时间表,再把对应内容翻成英文字幕;如果用户上传了字幕文件,则优先使用该字幕文件的时间戳和字幕文案来生成配音表与英文字幕。
STEP 1:接收素材并准备源音频
- 确认输入是视频文件。如果用户只提供音频,也可以继续音频流程,但需要说明无需执行视频音轨提取。
- 把原视频时间轴作为唯一主时钟。后续对白片段、静音间隔、配音片段和最终音频都必须对齐原始素材时长。
- 如果用户已经提供干净人声轨或字幕文件,先明确建议他们补充上传这些文件,因为它们能显著提高配音表和字幕时间轴的准确度。
- 如果用户没有提供干净人声轨或字幕文件,则通过弹窗 / 选择卡先确认:是否需要直接从视频中提取音频和字幕继续处理。
- 在同一个弹窗里,再确认目标翻译语言是否为英文;如果用户要翻译为其他语言,要求用户补充明确目标语言后再继续。
- 只有在用户确认提取后,才从上传视频中提取或定位源音频轨。
- 将源音频分离成两条音轨:
voice_audio_path:人声、对白、前景说话声background_audio_path:背景音乐、环境声、非对白声音
- 将两条分离音轨输出到当前会话 / 画布,方便用户检查。
- 如果用户同时上传了字幕文件和干净人声轨,则以字幕文件作为对白文字与英文字幕时间戳的主来源,以人声轨作为时长和表演参考。
STEP 2:识别并切分中文对白
- 如果存在字幕文件,优先读取其中的中文字幕,并把它作为配音表的中文文字来源;如果没有字幕文件,再对清理后的人声轨进行中文识别并保留时间戳。
- 创建配音表时,按完整口语句子或完整情绪节拍切分。禁止为了匹配字幕展示窗口,把一句连续说出来的话拆成多条配音生成行。
- 如果同一个人连续说了几句话,且这些话构成同一个连续反问、威胁、反击、情绪段落或口语节拍,可以合并成一行展示和生成。
- 配音表里只放
start_time和duration_sec,不要放end_time列。 - 配音表不要包含
speaker_role、说话人姓名、voice ID、推荐音色或克隆状态列。 - 每一行对白至少记录:
segment_idstart_timeduration_secdialogue_zhdialogue_ennotes
notes只记录内容相关信息,例如人名映射、ASR 不确定点、合并原因、连续组、字幕来源映射等;不要求点出说话人。- 如果存在字幕文件,先用字幕文件里的中文文案来生成配音表,再翻译成英文
dialogue_en。
STEP 3:将中文对白本土化为英文
- 将中文对白翻译成自然、地道、适合英语语境的表达,而不是逐字直译。
- 保留剧情含义、情绪意图、礼貌程度、羞辱感、威胁感、反击感、幽默感和人物关系。
- 英文台词需要尽量短到能放进原对白时长。如果直译过长,要在不损失核心含义的前提下自然改写。
- 对白里的中文人名必须改成真正的英文名,而不是拼音,
dialogue_en里不要保留中文汉字。 - 如果相邻字幕本来属于同一句话、同一个威胁句、同一个反问或同一个情绪节拍,先按整组理解和本土化,再放回对应配音行和字幕行。
- 除非用户明确要求字幕,不要主动制作字幕;本 Skill 聚焦音频配音。
STEP 3B:字幕本地化流程
- 如果视频里已经有中文硬字幕,先按字幕实际出现与消失时间整理字幕时间轴表。
- 如果用户上传了字幕文件,优先使用该文件中的时间戳作为字幕时间轴,并直接沿用其文案结构来生成英文字幕。
- 字幕时间轴表必须以视频中字幕的实际出现时间和消失时间为准,不能直接复用配音表的分行。
- 字幕表允许把一句完整口语拆成两段或多段展示,只要每段的
start_time/end_time与视频原字幕窗口一致,且文字来自已确认配音表或用户字幕文件。 - 每一行字幕至少记录
start_time、end_time、subtitle_zh、subtitle_en、notes。 - 英文字幕的时间基准要跟中文字幕窗口或用户字幕文件对齐,不要按英文配音文案的时间来排。
- 英文字幕每行末尾不要加句号,也不要使用三个点省略号。
STEP 4:创建可编辑确认表
- 涉及字幕时,为用户创建两张独立的可编辑表格:
- 配音表:用于生成配音,按完整口语句子或完整情绪节拍切分。
- 字幕时间轴表:用于字幕展示时间,按视频中原字幕的实际出现时间和消失时间切分。允许把一句完整口语拆成多条字幕展示行,但只能改分行,不改文案。
- 配音表至少包含这些列:
segment_idstart_timeduration_secdialogue_zhdialogue_ennotes
- 配音表中不要包含
speaker_role、speaker_name、voice_characteristics、recommended_voice_ids、selected_voice_id、克隆状态或end_time。 - 字幕时间轴表至少包含这些列:
subtitle_idstart_timeend_timesubtitle_zhsubtitle_ennotes
- 展示配音表时,必须增加这句用户可见提示:“默认翻译为英文,如果你需要翻译为其他语言,请给我说”。
- 请用户直接在表格里检查和修改。
- 在选择音频复刻 / 音色模式前必须停止,并让用户确认:
- 配音表中文对白内容是否正确
- 配音表英文本土化翻译是否正确
- 如果本流程涉及字幕,字幕时间轴表是否与视频原字幕出现/消失时间或用户字幕文件一致
- 这是硬确认点,因为后续音频复刻、官方音色兜底、字幕和最终合成都依赖已确认的表格内容。
STEP 5:表格确认后选择配音生成模式
用户确认表格后,用弹窗 / 选择卡按以下顺序询问使用哪种配音生成模式:
音频复刻:首推方案。逐句截取原中文音频作为 SeedAudio 参考,保留原句音色、情绪、节奏、停顿、表演强度和时长,再按确认后的英文文案替换为英文。官方音色:当原句复刻不可用,或用户更想使用官方音色库时使用。混合方案:重要表演句使用音频复刻;原句素材太短、太脏或效果不稳定的行使用官方音色。
不要收集逐说话人的音色选择。用户选择生成模式前,不要开始官方音色生成或混合方案兜底。
STEP 6:音频复刻准备
用户选择 音频复刻 或接受首推方案时,使用此分支。
- 配音表是英文内容的唯一来源。
- 对配音表每一行,用
start_time和duration_sec从voice_audio_path中截出中文原句音频。 - 如果某一行由连续几句话合并而成,则截取完整合并范围的原句音频。
- 每条原句参考音频要保持干净并与原时间槽对齐。只有在不改变表演落点的前提下,才可以移除过长的开头或结尾静音。
- 如果某行原句音频太噪、缺失或太短,导致无法稳定复刻,需要标记该行,并提供官方音色兜底或混合方案处理。
- 首推方案不克隆持久 voice_id;原句音频本身就是该行的表演参考。
STEP 7:官方音色兜底
仅当用户选择官方音色,或部分行无法使用音频复刻时,使用此分支。
- 根据整片语气或特定行需求,选择少量合适的官方音色。
- 不要求标记说话人。如果确实需要不同音色,用简单用途组或行号标记,例如
主对白音色、情绪女声行、威胁男声行、D05。 - 有试听时展示试听,并在生成前让用户确认官方音色选择。
- 相关音色确认前,不要生成官方音色配音。
STEP 8:混合方案
用户选择混合方案时,使用此分支。
- 有表演强度的重点对白默认使用音频复刻。
- 只有原句参考不可用、太噪、太短或用户不满意复刻效果的行,才改用官方音色。
- 生成前在
notes或分段清单中记录每一行使用的方法。 - 无论采用哪种方法,字幕文本和配音文本都必须保持不变。
STEP 9:生成时长匹配的英文配音
用户确认配音表和音色模式后,进入正式配音生成。
9A. 优先模式:原句参考英文替换
只要已经有人声分离轨,并且用户希望英文配音尽量保留原片表演,就优先使用此模式。短剧、强表演对白、羞辱、反击、威胁、哭腔、冷笑等场景,优先使用原句参考英文替换,而不是先克隆角色音色再普通 TTS。
- 对配音表中每一行,用该行
start_time和duration_sec从voice_audio_path中截出中文原句音频。 - 将这条原句音频作为该行 SeedAudio 的主参考音频。只有在需要稳定同一角色音色时,才额外加入角色级参考音频作为辅助参考。
- 每一行只生成一条英文替换音频,英文内容必须来自已确认的
dialogue_en。除非用户先修改配音表,否则不要为了时长改台词。 - SeedAudio 提示词必须要求保留原句的音色、情绪弧线、语速、停顿、节奏、呼吸压力、表演强度和总时长。
- 生成前要为每句写一个情绪锁定卡,说明开头、中段、结尾的表演节拍,例如:克制反问 / 嫌恶递进 / 冷硬短促收尾。这个情绪锁定卡必须写进提示词。
- 在写提示词前,先识别当前原句参考音频里每一句/每个短语的具体时间戳。提示词必须包含带时间戳的台词脚本,而且每一句/每个短语都要单独写成一行,并使用具体的相对时间范围。
- 如果一条配音行内部本来有连续语义节拍,不要把整段只写成一行。要按原句参考音频里实际的说话节奏拆成多个短语行,同时保持配音表仍然是一行、最终也只生成一个英文音频文件。例如某一行原视频时间为 23.320s–34.500s,提示词应写成:
Use the reference audio as the source performance.
Preserve the same speaker timbre, emotional arc, pacing, pauses, rhythm, breath pressure, and acting intensity from the reference audio.
Do not brighten the tone, flatten the anger, or over-perform.
Emotional lock:
- opening: restrained and taunting
- middle: disgust rising steadily
- ending: hard, cold, short and clipped
Keep the duration at 11.18 seconds.
Only speak the English dialogue specified in the timestamped script below. Do not read any instruction text.
Timestamped script:
[0.000s:2.140s | restrained taunt] Do you know why I won’t sleep with you?
[2.960s:9.680s | disgust rising] Because whenever something filthy and stinking gets near me,
[9.680s:11.180s | hard ending, short and clipped] it makes me sick.
- 生成提示词里不要额外写解释时间戳坐标系的话;执行者应在写提示词前自己把时间戳换算正确,而且不要把源音频里明显分开的多个短语压成一行。
- 每条生成后测量实际时长。只要技术上可行,实际时长应控制在该行
duration_sec的 ±0.5 秒以内。 - 如果时长或情绪不匹配,保持
dialogue_en不变,先通过调整情绪锁定卡和节奏提示重新生成。若仍不匹配,就重新生成或先改配音表。 - 进入合成前,建立分段清单,确保配音表每一行只对应一条唯一英文替换音频。
9B. 兜底模式:官方音色或混合方案行
只有在用户明确选择官方音色、原句参考英文替换不可用,或部分行被指定为官方音色兜底时,才使用此模式。
- 根据确认后的
dialogue_en和已确认的官方音色或行级兜底音色,为每一行生成一段英文语音。 - 不要求建立说话人映射。如果使用多个音色,在分段清单中按行号或用途组记录。
- 情绪变化通过标点、停顿、语速、强弱和表演备注控制。
- 对标记为同一
continuity_group的多行,使用同一个语气设计:同一情绪方向、同一强弱弧线,并在生成提示里明确写出“延续上一句 / 接着说 / 收尾同一句话”。 - 每次生成语音的提示词都必须包含精确时长指令,并把 X 替换成该行
duration_sec:Keep the duration at X seconds. - 禁止写成“整句要在 X 秒内说完”或类似表达,因为这种说法会让模型赶着说完,容易生成过短音频。
- 如果文案已经确认但时长仍然不匹配,应通过更严格的节奏提示重新生成或先改配音表。禁止硬切有声台词,也禁止用后期倍速 / time-stretch 去强行补齐时间轴。
9C. 所有模式通用的时间轴放置规则
- 每段最终英文配音必须从原始
start_time开始,并在重新生成后对齐原始duration_sec对应的时长槽位。 - 按原时间轴严格保留对白之间的静音间隔。
- 禁止把同一个
audio_path复用到两行不同对白上;如果确实要合并片段,必须在notes明确写出“已合并”。 - 后一行槽位里绝不能残留上一行音频尾巴。
STEP 10:合成英文时间轴音频与最终视频
- 以一条静音主轨为底,将每段时长匹配后的英文配音放回原始时间戳。
- 导出
english_voice_timeline_audio:只包含英文对白、与原素材总时长对齐。 - 混音前先统一所有英文对白片段的响度,让不同角色、不同句子的对白听感保持一致,不能出现某个角色或某一句明显过大或过小。
- 将
background_audio_path与english_voice_timeline_audio合成为新的混音。合成前需要对比对白音轨与背景音轨的响度,并调整两者相对电平,让英文对白略大于背景音轨:对白要清晰靠前,背景仍然自然可听,不要被压到完全听不见。 - 如果需要字幕,先根据视频里中文字幕的实际出现/消失时间整理字幕时间表。字幕内容必须来自已确认的配音表;可以把配音表的一句台词拆成多条字幕展示行,但不要在字幕表里重新改写文案。若用户上传了字幕文件,则字幕时间表直接沿用该文件时间戳,字幕文案优先使用该文件内容。先基于字幕表导出独立英文字幕文件;除非用户明确要求烧录,否则不要把字幕烧进视频。
- 如果分离出的背景音轨里仍残留中文对白,必须在已确认的对白时间段内降低或静音背景轨,避免中文人声压在英文配音下面。
- 导出
english_full_mix_audio:清理后的背景音 + 英文对白,并与原素材总时长对齐;其中对白响度需保持一致,且对白整体略大于背景。 - 从原视频导出无音频版本:
silent_video。这一步是强制步骤。 - 将
english_full_mix_audio挂到silent_video上,生成final_english_dubbed_video。 - 禁止把新音频直接合到仍带原声轨的原视频上。必须先移除原视频音轨,最终视频不能保留原中文音轨。
- 最终音频和最终视频总时长必须与原素材一致。如有漂移,先修正时间轴再交付。
STEP 10B:导出英文字幕文件
只要已经存在字幕时间轴表,就执行此步骤,即使用户没有要求字幕烧录。
- 根据已确认的字幕时间轴表,导出一份独立英文字幕文件。
- 字幕文件必须严格使用字幕表中的
start_time和end_time;不要用生成后的英文配音音频时长重新推字幕时间。如果用户上传了字幕文件,则直接使用该文件的时间戳。 - 字幕显示文本使用
subtitle_en。这些文本必须已经来自已确认配音表,只允许做展示分行。 - 默认导出为便于编辑的
.srt,除非用户指定.ass、.vtt或其他格式。 - 将生成的英文字幕文件放到画布 / 当前会话中,供用户检查和下载。
- 本步骤不进行字幕烧录。字幕烧录必须是用户明确提出的单独需求,或后续可选后期步骤。
- 如果用户后续要求烧录字幕,必须使用这份已确认字幕文件作为来源,并保持其时间不变。
STEP 11:最终交付
根据用户需求交付:
voice_audio_path:原始人声 / 对白分离音轨background_audio_path:背景声分离音轨- 已确认的不含说话人列的配音表
- 选择的生成模式:音频复刻 / 官方音色 / 混合方案
- 需要复查时,交付原句参考音频和对应英文替换配音片段
english_voice_timeline_audio:只包含英文对白、与原素材总时长对齐- 如果用户要求混音,交付
english_full_mix_audio:清理后的背景音 + 英文对白 - 如有字幕需求,交付字幕时间表和独立英文字幕文件
- 如果用户要求最终视频,交付原视频的无音频版本
silent_video - 如果用户要求最终视频,交付由无音频视频 + 新混音合成的
final_english_dubbed_video
最终回复中需要说明:英文音频总时长是否与原始时间轴一致,以及哪些行做过重新生成、时长修复、音频复刻失败兜底、官方音色兜底或温和倍速 / 慢速调整。
失败处理
- 如果识别置信度低,在
notes中标出,并请用户在可编辑表格中修正该行。 - 如果相邻台词应该合并或拆分,按用户确认更新行切分、时间和备注;不要新增说话人标签。
- 如果某行原句参考音频缺失、太噪或太短,标记该行,并提供官方音色兜底或混合方案处理。
- 如果音频复刻生成的英文情绪不够像原句,优先加强情绪锁定卡、内部时间戳节拍和表演保留提示后重新生成。
- 如果英文配音无法自然匹配原时长,保持已确认的
dialogue_en不变,先用节奏 / 时长提示重试;仍有小幅偏差时才使用温和倍速 / 慢速,禁止硬切有声台词。也禁止用后期倍速 / time-stretch 去强行补齐时间轴;如果仍不匹配,应重新生成或先改配音表。 - 如果官方音色兜底效果不合适,换更接近的官方音色,或在可能时改回音频复刻。
- 如果背景分离后仍有人声残留,必须在已确认对白时间段内降低或静音背景轨;不要让残留中文对白压在英文配音下面。
- 如果需要或预期输出最终视频,必须先生成
silent_video,再把新混音挂到无音频视频上。禁止把原视频自带音轨映射进最终英文配音视频。 - 用户确认表格前不要选择生成模式;用户确认音频复刻 / 官方音色 / 混合方案前不要生成最终英文配音。
Signals
- GitHub stars
- 26
- Last commit
- Sep 2026
Advanced
- Item type
- skill
- Key
short-drama-multilingual-dubbing- Source
- github.com/qxryz/workflowgenerator