Prompt Academy
提示词教学:从关键词堆砌到分层导演思维
好的提示词不是"关键词越多越好",而是一套可复用的结构。这一专题把人物出图、场景出图、多镜头视频三种场景,统一成一套写法。
统一八层框架
主流图像 / 视频生成工具都会按顺序阅读提示词,越靠前的内容权重越高。把这八层想象成一张拍摄通告单:先锁定演员,再逐项交代景别、动作、运镜、光影、质感,最后统一定调。
01
主体锚点
有参考图/角色资产库时先声明锁定对象,没有素材则跳过此层。
"参考图中红衣持扇的男子为主角,发型服装保持一致"
02
镜头与景别
先定景别(远/中/近/特写),单镜头写"镜头1",多镜头按序编号独立成段。
"镜头1:中近景"
03
主体特征
用2-3个具体、可复现的名词短语描述主体,杜绝"好看的""精致的"等空泛形容词。
"黑色束发,墨绿骨扇,玄色暗纹长衫"
04
动作与情绪外化
动作精确到身体部位+速度+幅度;抽象情绪一律转译为可视的身体细节。
"指尖无意识摩挲扇骨,耳尖泛红"
05
运镜
一个镜头只写一个运镜动作,且与主体动作分开描述,格式为"中文(English术语)"。
"缓慢推进(push in)"
06
光影与氛围
写清光源方向、色温、氛围颗粒物,可直接点名布光风格,避免"电影感灯光"这类空话。
"暖橙侧逆光45度打入,空气中浮动金色尘粒"
07
质感 / 声音
出图场景写材质与画质;视频场景用"音效:"前缀写对话、音效或环境音。
"绸缎反光自然,8K" 或 "音效:微风声"
08
全局收尾
风格锚点 + 一致性约束词 + 负面提示词 + 技术参数(分辨率/比例/时长),只写一次。
"保持面部一致,不生成水印。4K,9:16"
Syntax Cheatsheet
主流工具语法速查
同一层框架,不同工具的"控制旋钮"不一样,混用会直接失效。
| 工具 | 权重 / 强度控制 | 角色一致性 | 备注 |
| Midjourney | --sw 风格权重、--iw 图片权重,写在提示词末尾 | --cref 图片URL 锁定角色,--cw 0-100(0=仅五官,100=服装发型全迁移) | 参数统一放在整条提示词最后 |
| Stable Diffusion / SDXL | (关键词:1.3) 提高权重,(关键词:0.7) 降低权重 | 依赖 LoRA / Dreambooth 微调模型锁定角色特征 | 权重系数常用区间 0.5–1.5,堆太多会显僵硬 |
| 可灵 / 即梦等视频模型 | 无括号权重语法,越靠前的描述权重越高 | 上传2-4张多角度参考图,并在提示词中显式声明"参考图中的XX为主角" | 建议搭配独立负面提示词输入框使用 |
Template Library
场景化模板库
直接套用,替换主体与场景细节即可复用。
主体锚点:参考图中黑发少年为角色基准,锁定五官与发色
主体特征:十七岁古风少年,束发未冠,手持合骨折扇,玄青色暗纹长衫,腰系墨绿色丝绦
动作与情绪:侧身回眸,指尖轻搭扇骨,眼神清亮带一丝疏离
光影氛围:暖金色侧逆光从画面右后方45度打入,发丝边缘泛起光晕,背景虚化为庭院剪影
质感画质:皮肤质感细腻不磨皮,绸缎面料光泽自然,发丝根根分明,8K超清
全局风格:中国古装写实摄影风格,85mm人像镜头浅景深,保持面部比例一致
负面提示词:塑料感肌肤,五官变形,多余手指,水印,字幕
镜头与景别:远景,竖屏9:16
场景特征:潮湿的城市小巷,斑驳砖墙,霓虹招牌局部损坏闪烁
光影氛围:冷蓝紫色主光源,霓虹反射在积水路面形成破碎光斑,雾气弥漫制造纵深
氛围元素:细雨飘落,远处车灯划过留下光轨
质感画质:电影级颗粒质感,高对比度,暗部细节保留
全局风格:黑色电影(Film Noir)美学,24mm广角镜头,冷色调分级
负面提示词:过曝,噪点堆积,建筑透视变形,水印
镜头1:中近景,女主低头摆弄衣角,耳尖泛红,嘴角忍不住上扬又抿住。固定机位(fixed)。暖黄色顶光洒落,背景虚化为路灯光斑。音效:微风声,远处环境音。
镜头2:特写,男主伸手轻轻扶起她的下巴,动作缓慢克制,指尖悬停在皮肤上方半寸而未真正触碰。缓慢推进(push in)。暖橙侧光从左侧打入,形成柔和的伦勃朗光三角。音效:心跳声轻微放大,环境音渐弱。
镜头3:中景,两人视线交汇,女主眼眶微微湿润但带笑意,男主俯身,画面在唇齿将触未触的瞬间定格。缓慢环绕(orbit),从侧面缓慢移至正面。暖金色逆光勾勒双人剪影轮廓。音效:音乐渐强后归于安静。
全局风格:浪漫电影质感,50mm人像镜头,暖色胶片颗粒。保持双方面部一致,无拉伸,不生成字幕水印。4K,9:16,12秒。
负面提示词:面部扭曲,肢体变形,抖动运动,伪影
Case Study
实战拆解:同一个镜头,两种写法
差距不在创意,在于有没有把每一层都写具体。
✕ 新手版
"一个古代男生,帅气,拿扇子,光线好看,高清"
- "帅气""光线好看"是空泛形容词,模型无法转译成具体像素
- 没有声明景别,模型会随机选取全身或半身
- 没有光源方向和色温,容易出现平光、塑料感
- 没有一致性锚点,多次生成会"每次换脸"
- 没有负面提示词,手部畸变概率明显上升
✓ 进阶版(八层框架)
"参考图角色为基准;镜头1中近景;黑发束发少年,玄青长衫,手持墨绿折扇;侧身回眸,指尖轻搭扇骨;暖金侧逆光45度打入,发丝泛光晕;绸缎光泽自然,8K;中式写实摄影,85mm浅景深,保持面部一致;负面:五官变形、多余手指、水印"
- 每一层都有具体名词/数值,模型不需要"猜"
- 景别+镜头声明让构图可预期、可复现
- 光源方向和色温直接决定"高级感"还是"塑料感"
- 一致性锚点保证系列图/多镜头的角色不崩
- 负面提示词兜底,减少返工次数
情绪外化对照表
| 心动 | 耳尖泛红,指尖无意识摩挲物品边缘 |
| 隐忍 | 喉结滚动,指节因用力泛白,视线刻意避开 |
| 紧张 | 频繁眨眼,手指反复摩挲衣角,呼吸略急促 |
| 释然 | 长呼一口气,肩线放松,嘴角浮现淡淡笑意 |
| 愤怒 | 下颚绷紧,拳心攥出指印,胸口起伏加剧 |
常用负面提示词 / 避坑词库
塑料感肌肤
五官变形
多余手指
肢体扭曲
抖动运动
水印
字幕
过度磨皮
光源冲突
色温漂移
建议控制在 5–8 个高频瑕疵词,堆太多反而让画面变僵硬。
Learning Path
进阶学习路径(按投入产出比排序)
1
光影词汇优先
投入产出比最高。先学会描述光源方向与色温,一句话的质量提升超过其他任何单项技巧。
2
情绪外化
把所有抽象情绪词换成身体细节,这项能力对图片、视频、任何模型都通用。
3
运镜术语
记住 10 个核心运镜词,遵守"一个镜头只写一个运镜动作"的铁律。
4
分层结构
用八层框架代替关键词堆砌,写多了会成为肌肉记忆,不再需要逐条对照。
5
一致性控制
学会角色资产库、LoRA、cref/cw 等工具,解决"系列图换脸"的根本问题。
6
负面提示词
积累一套稳定负面词库,作为出图质量的最后一道兜底防线。