一条 60 秒的竖屏短剧,主角在同一集里换了三张脸。你回头翻提示词,发现第一次写的是”25 岁女孩,单眼皮,齐肩短发”,第二次写的是”年轻女性,短发”,第三次干脆只写了”女孩回头”。
废片的锅,通常不在模型。
我在提示词上踩的最大的一个坑,是把它当成”描述画面”的工具。其实它不是。它是要让一个没有记忆的模型,在每一次全新的生成里,重新认出同一个人的一份契约。你写得越随意,模型就越自由发挥。
所以问题落回一句话:分镜提示词失效,是因为它每次都在”重新发明”角色。

为什么提示词总是失效
三个原因,一个比一个隐蔽。
最直接的是每镜重写描述。模型是无状态的,你第一次生成的主角,它不会记住。第二镜你不写外貌,它就自己造一个。
第二个更麻烦:描述不够具体。”年轻女性””清冷气质”这类词,在模型眼里有无数种可能,它每次都挑一个不同的。
第三个最难察觉:缺视觉锚点。同一个角色,换了个场景、换了个光线角度,模型会重新”理解”他是谁。你不是提示词写短了,是压根没给它一个可以反复对齐的基准。
一份实测数据说得挺明白:没存档角色参数的样本,五官变形、画风错乱的概率高达 74.2%;完整建档后,全片角色统一度能到 92.5%。
解法:先建”视觉词典”,再生成
我见过最好用的做法,来自一套专门给 Seedance 2.0 写的微短剧分镜提示词。作者把整个流程拆成两份提示词——先在 Claude 里跑一份”视觉词典”,把全剧的角色、场景、物件、风格一次性定义死,后面每个分镜直接复制,不再重新发明。
顺序很关键。先建词典,再生成,比每镜现场编描述强的地方在于:词典是唯一的、被复用的基准。角色描述从头到尾一个字不改,模型每次拿到的都是同一份锚点。
第一阶段提示词(负责输出视觉词典):
第二阶段再把这套词典翻译成可以直接喂给 Seedance 2.0、可灵 3.0 的视听描述。作者自己说得很实在:这套提示词只适合 AI 微短剧,主要是让分镜和画面生成降本增效,并不会提升整体艺术水平。这话我信,比吹”一键出大片”靠谱。
外貌锁定:细节要够狠,缺陷要留
外貌锁定怎么写才有效?两个原则。
一是细节数量要够。原文要求面部至少 5 个可视化细节,凑成一段连贯的话,不是列表。目标是让一个没见过这角色的人读完能画出八成相似的肖像。看它给的示例:
三十五岁左右的男性,身高约一米七五,体态偏瘦但肩线端正。
黑色短发向后梳,发际线略高,鬓角有零星白发。
面部轮廓瘦削,颧骨突出,眼窝深陷,双眼皮但眼睑下垂显得疲惫,
眉毛浓黑平直,鼻梁高挺但鼻头略宽,薄唇,唇色偏淡,
法令纹从鼻翼延伸至嘴角,下颌线清晰,皮肤粗糙偏黄,
左眉尾有一道约一厘米的淡色旧疤。
二是缺陷反而是辨识度。一套很出名的提示词模板里,主角设定被写死成”有 1 个明显的外貌缺陷(如龅牙/单眼皮)”,冲突设定被写死成”必须出现被否定的场景”。
你是一位短剧编剧。请为一部职场逆袭题材的AI短剧写第1集分镜脚本,要求:
- 主角:小镇来城市追梦的女孩,性格倔强但笨拙,有1个明显的外貌缺陷(如龅牙/单眼皮)
- 核心冲突:第1集必须出现”被否定”的场景(面试被拒/合影被裁/被嘲笑)
- 分镜数量:6-8个镜头,每个镜头写明:景别、画面内容、人物表情、台词或旁白、时长(2-4秒)
- 情绪曲线:开头委屈→中段隐忍→结尾埋一个反转钩子
- 风格:生活流,不要狗血,台词口语化
那部单集砸一万多块的爆款短剧,女主之所以让人记得住,就是因为她不完美。整齐划一的”网红脸”,观众记三秒就忘。
分镜表:景别、运镜、画风必须标
词典建好,落到分镜表上。这是给 AI 生图、生视频的”说明书”——分镜越详细,画面越流畅、画风越统一。新手不用学专业分镜,套表格填就行。
| 镜号 | 时长 | 画面描述(AI指令) | 台词 | 配音/音效 |
| 1 | 0-30秒 | 【AI生成】场景:年代街头,暖光,女主摆摊做针线活;反派快步走来,抬手砸摊,镜头聚焦两人面部,近景,国漫风 | 反派:败家娘们!出来丢人现眼! | 配音:反派刻薄,女主平静;音效:街头叫卖声、砸东西声 |
| 2 | 30秒-2分钟 | 【AI生成】场景:同上,女主拦住反派,拿出纸条递过去,镜头特写纸条再切回两人表情,中景 | 女主:你偷我钱,再砸摊就去评理! | 配音:女主坚定;音效:纸张翻动声、路人议论声 |
| 3 | 2-3分钟 | 【AI生成】场景:同上,反派抢纸条,女主侧身躲开微笑,镜头定格微笑,右下角加”下集揭秘” | 反派:你敢威胁我! | 配音:反派愤怒;音效:BGM上扬 |
填表有三个硬规矩:每集分镜不超过 5 个;镜头以近景、中景为主(AI 最容易生成、最不容易失真);画面描述里必须明写”画风、景别、运镜”,比如”推镜、近景、国漫风”。这一句标清楚,生成准确率能明显提上来,返工少一大半。
另外提醒一句,分镜效果展示 2-3 个就够了,把精力留给关键的情绪镜头。
先把词典建完,再动手生成。你为角色描述多花的那二十分钟,会在后面每一个镜头上省回来。宁可第一镜慢,不要每一镜都重来。
如今 Seedance 2.0、可灵 3.0 已经把单次生成推到 15 秒上限,还支持自动镜头能力和音画同出。这意味着提示词的写法要跟着变——过去你是逐帧抠画面,现在可以直接写”一段带运镜和声音的完整描述”,让模型自己切镜头。这套”视觉词典 + 视听描述”的两段式,正好接得上。

评论(0)