内容创作 · 熟练
AI 视频返工最多的地方,是顺序反了
先出画面再配旁白,音画对不上
做过几条 AI 短视频的人,几乎都栽在同一处:先把画面生成得漂漂亮亮,再回头配音 —— 结果音画对不上、口型错位,一条片子重新来一遍,那才是最费时间的地方。这一页只讲两条能省下整轮返工的纪律:① 先定声音,画面跟着节奏走(先做配音、再生成画面,顺序不能反);② 先锁长相,再让它动起来(用同一张角色参考图喂每一个镜头,避免同一条片子里人物变脸)。再给一张分镜表的字段清单和一个三版递进的迭代法,让「重做」变成「只补一版」。
方法 · 一图看懂
1
先定声音,再生成画面 — 配音(或 TTS)先出,画面的节奏与时长跟着声音走;⛔ 顺序反了就要重录或重生成
2
锁脸:同一张参考图喂每个镜头 — 用一张角色设定图(或一组种子图)固定「这个人长这样」;产品给白底图同理
3
分镜表一张纸写全 — 镜头号 · 画面描述 · 旁白与字幕 · 时长 · 运镜 · 参考图;一个镜头 3–15 秒最稳(太长模型会「忘记」前面长什么样)
4
先逐镜 3–5 秒,再拼成长片 — 挑满意的片段延长或用「尾帧接首帧」串起来,角色连续性明显更好
5
三版递进,而不是反复推倒 — V1 描述核心内容 → V2 补场景 / 光线 / 运镜 → V3 完善细节
原理 · 为什么有效
这两条纪律的机理不一样,但都指向「把不确定性挡在贵的那一步之前」。声音先行的机理是声音是节拍器:一条片子的时长、停顿、每句的字数上限都由旁白定,画面按声音写提示词就天然对齐;反过来先做画面,你只能把旁白裁成画面需要的长度,口型对不上就整条废掉。锁脸的机理是一致性靠外部锚点,不靠形容词:视频模型对「同一个人」没有跨镜头的记忆,每次生成都是新的采样,所以必须把「长什么样」从文字描述里拿出来,变成一张每次都随提示词一起提交的参考图 —— 描述越自由,漂移越大。至于 3–15 秒的片段长度,是因为模型对更早帧的记忆会衰减,镜头越长越容易「忘记」开头的样子;把它切短、用尾帧接首帧串起来,等于把一致性交给你自己控制。
适用场景
适用:想做口播 / 知识 / 带货类短视频、但不想学剪辑也没设备的人 —— 运营、自媒体、小商家、单条视频要在半天内出片的人。
⛔ 不适用:需要真人出镜、需要现场收音、或需要精确镜头语言(这类片子的瓶颈不在生成,在拍摄)。
⚠️ 前提:你愿意为每一镜单独写画面提示词,而不是一句「给我做个视频」——提示词写法请走「主体 + 动作 + 镜头运动 + 光影 + 风格」这条公式,⛔ 不写「一个好看的视频」这种模型听不懂的话。
自测 · 5 问
我手上有没有一段先定下来的旁白文本(不是「等画面出来再配」)?
我有没有一张固定的角色参考图?后续每个镜头的提示词里,角色描述是不是原样复制的同一段字?
我的分镜表里,每一行能不能填满六个字段(镜头号 / 画面描述 / 旁白字幕 / 时长 / 运镜 / 参考图)?
我这次有没有哪个镜头超过 15 秒?如果有,是不是因为它「太长导致模型忘了开头」?
上次返工的原因,是画面不好看,还是音画对不上?后者说明顺序错了,不是模型不行。
怎么上手 · 验证步骤
第一次别做完整条,先做一个 15 秒的片段跑通顺序:① 先写旁白(用结构化指令,一次出可用稿:开头 3 秒抛钩子、中间三段、结尾一句互动);② 录音或合成配音,确定总时长与每句的字数上限;③ 按声音切分镜,写成分镜表;④ 出参考图并锁脸;⑤ 逐镜生成 3–5 秒,挑最好的那条接起来。
⚠️ 四个最容易踩的点:一是先出画面(顺序反了);二是每镜重新描述角色(一定变脸);三是旁白字数不限(配到一半发现塞不进);四是一遍不行就整条重来(应该只重生成那一镜的 V2 / V3)。
自检动作:把这一条的旁白单独拎出来读一遍,掐一次表 —— 如果读出来的时长与你画面总时长差超过两秒,说明顺序仍然是「画面在前」;如果每个镜头的提示词里角色描述不是同一段字,说明锁脸没做。两个动作都做完,返工率会肉眼可见地降下来。