文生视频工作流中的提示词工程怎么做?

我以前做文生视频,最容易卡住的地方不是模型不会生成,而是我自己不会描述。脑子里明明有一个很酷的画面,输入提示词后却变成“人物乱跑、镜头乱晃、风格忽冷忽热”的大杂烩。后来我才明白,提示词工程不是堆形容词,而是把想法拆成模型更容易执行的任务。

先把一句话拆成四层

我现在通常先写一句极简脚本,比如“未来城市的夜晚,主角走向光源”。这句话只是起点,不能直接当最终提示词。接着我会拆成四个维度:视觉元素、动作、情绪、镜头语言

视觉元素回答“画面里有什么”:人物、场景、光线和整体风格。动作回答“它怎么动”:走向、转身、抬头,还是镜头移动。情绪决定观众感受到什么,是紧张、温暖,还是冷峻。镜头语言则补充景别、视角、广角或景深等信息。这样写出来的提示词,通常比“高级、电影感、震撼”这类空泛形容词更稳定。

我还会明确时间点,例如白天还是夜晚,并尽量避免一句话塞进太多互相冲突的要求。想要温暖的广告感,却同时要求阴冷、压迫、强烈闪烁,模型很可能直接迷路。

提示词要服务镜头,而不是服务想象

文生视频最怕“一个提示词包打天下”。我会先做分镜或镜头表,把内容拆成几个短镜头,再为每个镜头单独写提示词。这样做的好处是,每个镜头只解决一个主要问题:交代场景、表现动作,或者完成一次情绪变化。

人物和场景的关键特征要尽量保持一致,尤其是服装、发型、色调和时间氛围。每换一个镜头,我不会把描述全部推翻,而是保留核心设定,只修改动作或镜头。否则上一镜还是未来城市,下一镜可能突然变成完全不同的世界,连主角都像临时请来的替身。

把生成当成迭代,不要一次求完美

我习惯先生成低成本预览,优先检查构图、动作方向和情绪是否对,再逐步补充细节。一次改太多内容,很难判断到底是哪一部分出了问题。更稳妥的方式是:先改主体,再改动作,最后调整镜头和风格。

如果出现“悬浮的手”、动作不自然或画面拉伸,我不会立刻重写整段提示词,而是回到对应镜头,找出问题所在。提示词写得越清楚,分镜拆得越合理,后面的素材生成、配音和合成就越省心。对我来说,真正好用的提示词不是最华丽的那一段,而是能让每个镜头按计划工作的那一段。

参与讨论

0 条评论

延伸阅读