先改文稿再生成
把长句拆开,减少括号和多层修饰。日期、金额和英文缩写明确写出希望的读法,例如把容易误读的产品名单独列成发音备注。先用十几秒测试稿验证,不要直接生成整篇长文。
示例:“今天介绍三个检查步骤。先看价格来源,再测接口响应,最后保存结果。”这种短句便于定位发音和停顿问题。
如何选择声音
同一段文字分别试听清楚平稳、活泼和叙述型声音,比较可懂度与内容适配程度。教学视频优先让人听清重点,产品演示则要控制语速,给画面操作留时间。
ElevenLabs 配音最佳实践说明了不同模型对表达控制的差异。不要把某个模型支持的停顿标记直接套到所有模型上。
专业词怎么读准
建立一份“原词、目标读法、例句”的小词表。支持发音词典的工具可以按其官方方式配置;不支持时,先在测试段中尝试拼写或中文注音,并确认不会出现在最终字幕里。
生成后重点回听金额、网址、型号和否定词。发音自然不代表内容准确。
长稿分段与拼接
按完整意思分段,尽量保持同一种声音和参数。拼接后检查段落交界是否突变、停顿是否过长和音量是否一致。需要与视频同步时,优先调整文稿和节奏,不要把声音强行压缩到难以理解。
配套字幕可按AI 字幕流程制作,并以最终音频为准校对。
授权与文件交付
使用自己的声音或有明确同意的声音素材。商用前核对所用套餐和声音的具体使用条件,不把克隆能力当作获得他人声音授权。保存文稿、版本、音频和发音词表;选音乐配合时,可继续阅读AI 音乐生成。