本文只解决一件事:配音。画面已经能看了,声音却像播音员匀速念作文,这一环怎么调。

一、我把声音重录了一遍,播放翻了快二十倍

我做过一条 60 秒的漫剧,画面自己挺满意,发出去两天播放四位数。后来把声音整个重录了一遍,画面没动,剪辑没动,只换了配音和 BGM 比例,播放翻了快二十倍。

那一版的问题我记得很清楚:稿子是直接粘的书面长句,音色用的是工具默认的第一个,语速没调,情绪没动。听下来就是一个人用播音腔匀速念完一段作文。

配音这事,在整条 AI 短剧流程里投入产出比最高。画面你可能花十几个小时,声音调好只要四十分钟。但多数人是反过来的。

二、先改稿,再配音

工具读的是文字,文字什么样,语气就什么样。

粘贴之前做三件事:把四五十字的长句拆成二十字以内;多补逗号和句号,标点就是 AI 的呼吸节奏;多音字和生僻字提前标读音,不然一定会读错,”步行”的”行”和”银行”的”行”是经典翻车点。

这个活儿我一般丢给 DeepSeek 或豆包,免费,给一句”把下面这段改成人说话的口语稿,保留信息,句子不超过 20 字”就够了。

三、开工前先定角色声音档案

这一步九成的人跳过,然后在第二集翻车。连载短剧最怕第一集女主是甜妹音,第二集变成御姐音,观众耳朵立刻出戏。

所以开工前要把每个角色的音色、音调、语速定下来,记一张表,整部剧沿用不改。常见的分配是这样:女主走甜妹音或御姐音,音调默认;男主走清亮少年音或低沉霸总音,音调 +5% 到 +10%;反派低沉微哑,音调 -5% 到 -8%、语速 -5%;旁白用沉稳知性音,语速放慢到 0.9 倍。

工具上分四种场景。要多人分饰,逗哥配音的 AI 分角能自动识别旁白和人物台词并各自配音,支持一部剧里分饰多角,SVIP 会员 39 元/月,基础功能免费、新用户送时长。不想开新软件就用剪映 AI 配音,基础音色永久免费,最大好处是配音直接落在剪辑轨道上,不用导出导入。正式感强的旁白,比如政企向、科普向、纪录片向,用讯飞配音,中文长文本稳定性最好,读音准确率在几家里排第一,按次 6.9 元、每次最多 500 字。要情绪表现力强的,比如单集精品短剧,用 MiniMax,它的模型会按上下文预测语调和情绪,有订阅套餐加每日免费字数。

四、参数甜区:语速要分场景

工具默认语速永远不适合短视频。全程一个语速,这就是”塑料感”的来源。

我摸出来的区间:信息密度高的内容,比如测评、口播、爽文解说,1.1 到 1.15 倍;故事叙事和剧情旁白,0.95 到 1.0 倍,给情绪留空间;影视感强的旁白、悬疑氛围,0.85 到 0.95 倍,别低于 0.8,太拖就像念经。

音调在原值上小幅动。商务男声往下 1 到 2 个半音更沉稳,年轻女声往上 1 个半音更灵动。超过两个半音,就不像这个音色了。

情绪档位要分段,这是”贴脸”和”念稿”的分界线。开篇叙述压到 40% 到 50%,冲突高潮拉到 80% 到 90%,收尾回到 50% 到 60%。有个反直觉的细节:不要拉满 100%,音色会撕裂失真,80% 基本就是安全上限。

五、停顿是手动给的

真人说话有留白,AI 不会自己喘气。气口得你插。

句号后面停长一点,逗号短一点;心理活动、沉默、对视这些地方直接插停顿标记;段落之间补 0.2 到 0.5 秒空白,模拟换气。长文案一定分段生成,一次粘几千字,越往后节奏越飘,音色还可能漂移。

六、混音和对轨,收尾两步别偷懒

生成完不要直接导出。

音量上,人声落在 -12dB 到 -18dB,BGM 压到低于人声 20% 到 30%。我一般先设 20%,戴耳机听一遍,听不清台词就继续往下调。顺手开一下剪映的降噪,AI 音频同样有底噪。

对轨上,导出 SRT 字幕导入剪辑软件,按人物张嘴那一帧微调首尾。验收标准是音画误差不超过 3 帧,差不多 100 毫秒。超了这个数,观众就能看出嘴型对不上。

七、有真人形象说话,再加一层口型同步

如果片子里有真人形象开口,这一步单独做。可灵 3.0 原生支持多语言口播画面,每天免费 66 积分、次日刷新。出海向用 HeyGen,覆盖 175 种以上语言,免费档每月 3 条 1 分钟带水印。肯折腾又想省钱,LivePortrait 开源免费、本地跑,代价是要显卡。想让静态照片开口,Hedra 免费档能把一张头像做成十分钟长视频,情绪表演是它的长板;只试一次不想折腾,Magic Hour 每天免费 3 次、不用注册。

八、两句实在话

第一,先把声音档案和参数表定下来再开录,别边录边挑音色。我第一版就是边做边换,结果一条片里五种声音,只能全部重来。

第二,别把配音当成收尾工序。单集投入四十分钟,完播率的差别能到一倍。画面可以简单点,声音不能平。

时效性说明:Sora 已于 2026 年 3 月被 OpenAI 关停(网页端、App、开发者服务全部下线),本文不涉及该工具;视频与口播生成请以 Seedance 2.0/2.5、可灵 3.0 为准。


附:本文用到的工具清单

工具用途免费额度 / 价格一句话选型理由
DeepSeek书面稿改口语稿完全免费中文口语化改写稳,一句话指令就能用
豆包书面稿改口语稿、写台词完全免费中文自然,爽文台词直接可用
剪映 AI 配音旁白 + 角色配音、混音、降噪基础音色永久免费,会员约 25 元/月配音直接落在剪辑轨道,最省事
逗哥配音多角色分饰、AI 自动分角免费版每日 3 次,SVIP 39 元/月一部剧里能分饰多角,漫剧分角色首选
讯飞配音正式旁白(政企、科普、纪录片)按次 6.9 元(每次最多 500 字),另有包月套餐长文本读音准确率最高,最不容易读错字
MiniMax高情绪台词、单集精品短剧订阅套餐 + 每日免费字数额度按上下文预测语调情绪,情感表现力突出
Fish Audio中文配音、角色音色克隆免费额度充足中文质量高且不用翻墙,日更够用
可灵 3.0数字人口播、口型同步每天免费 66 积分,次日刷新生成带原生口播画面,一套流程省一步
HeyGen出海短剧数字人、多语种口型免费档每月 3 条 1 分钟(带水印),付费 29 美元/月起语种覆盖最广,出海向直接够用
Hedra静态头像做成长视频免费档有水印,基础版 15 美元/月(1500 积分)一张照片能做十分钟,情绪表演是长板
LivePortrait本地口型同步、照片开口开源免费,需自备显卡唯一不限时长的零成本方案
Magic Hour口型同步、换脸、说话照片每天免费 3 次,付费 19 美元/月起不用注册就能试,轻量验证最方便
声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。