
根据开源项目 nai5-prompting 对社区 2226 张实测出图与 1844 条真实提示词的解码统计,超过 61% 的画师在提示词中使用了权重控制,但真正能被画面有效反推的语义词不足 13%。多数创作者让大语言模型(LLM)写画图提示词时,往往陷入词汇堆叠与空泛光效的陷阱。表面看是模型不理解二次元画风,本质是提示词生成管线缺乏工业化分镜工序与精准的语法约束。
随着 NovelAI Diffusion V5(NAI V5)在 2026 年 8 月底上线,其提示词容量上限放宽至 1471 token,支持多角色绑定与漫画分格生成。开发者 Miint-Sunny 开源的 nai5-prompting 项目并非传统教学文档,而是将整套生图逻辑封装为面向大语言模型的 Agent Skill。该方法把模糊灵感转化为高质量 NAI V5 提示词,为 AI 绘画工作流建立了可落地的标准规范。
构思四工序:把动画制作分工注入提示词管线
一张高质量画面从模糊概念到最终分镜,其推导逻辑与单集动画的工业化生产完全同构。nai5-prompting 规范了四道不可颠倒的构思工序,强行切断大模型直接堆砌形容词的惯性。
第一道工序是编剧。核心任务是将用户的模糊需求转化为具有记忆点的概念。大模型在此阶段需要主动排除主题中最常见的五种平庸构图,转而从人物距离、特殊视角裁切、空间遮挡、动作透视等物理关系寻找新意,严禁依靠粒子、花瓣或杂乱光效来制造虚假的丰富度。
第二道工序是监督。监督的核心原则是“先定空间再放人”。在生成具体人物前,必须先锁定相机高度、观看方向、景别大小、视觉中心以及前景、中景、背景的三层景深关系。通过低机位、俯视、隔物观察、倒影或门窗框景构建真实纵深,且所有透视关系必须服从同一个机位。
第三道工序是原画。原画阶段要求人物必须处于具体可冻结的动作中,并与所处环境产生交互。例如将“三个人在野餐”拆解为“一人正递出西瓜、一人伸手接应、一人低头看手机”,清晰回答“谁对谁做了什么”。多人场景下需逐人锁定外貌、服装、道具归属与视线朝向。
第四道工序是摄影。摄影负责最终的氛围渲染,包括主光源性质、第二辅助光源、色温偏向与材质质感。摄影必须作为最后一步执行,因为光影只能依附于已经站位明确的角色和构图,无法拯救一个机位混乱的画面。
| 阶段 | 核心问题 | 留下的硬伤 |
|---|---|---|
| 编剧阶段缺位 | 依赖抽象词汇堆叠,缺少视觉锚点 | 画面充斥无意义的花瓣粒子与光斑,缺乏主体叙事 |
| 监督阶段越位 | 未定机位与景深,直接生成角色外观 | 多人同尺寸同平面排布,空间扁平无透视感 |
| 摄影阶段前置 | 在构图与动作未定前强行上光影 | 光影方向与角色受光面冲突,无法挽救崩坏的镜头 |
语法与边界:解码 1844 条真实提示词的数值规律
通过对 1844 条真实提示词数据的分词统计,NAI V5 主提示词与角色栏合计的中位数仅为 374 token,均值 430 token,P90 为 742 token。官方标称的 1471 token 属于软阈值,仅有 0.4% 的极限案例超过该长度并正常出图。过长描述不仅消耗额度,还会稀释单项特征的注意力。
需求分档与知识边界:防御智能体空转与时效盲区
nai5-prompting 在构思层内置了需求分档机制,根据用户输入自动切换生成策略。只要用户的话里能同时读出“谁、在哪、什么调子”三样信息,便判定为已成型需求直接出稿;仅有主体而无画面的需求,则先补齐情景镜头再落笔;只有方向性形容词的需求或完全空白,则给出多个差异明显的方案供用户挑选。用户话里出现“给点想法”“随便来点”“你决定”等词时,一律按多条方案处理。
分档机制的另一个作用是防御大模型最常见的“空转”行为。方法文件里明确禁止“空手反问”——拿不准就停下来向用户提问,是实测里命中率最高的失败模式。正确的做法是先按最合理的理解给出成品,把不确定之处写成一行说明,确有分歧再让用户拍板。版权角色的知识处理同样遵循“先查档案、再动笔”的原则,V5 角色知识库截止于 2026 年年中前后,过新角色需自行补齐外观描述,避免名字识别失效。
部署落地:三类工作流接入与发布前检查
该 Skill 提供了三种接入方式,适配不同创作场景。第一种是作为 Agent Skill 挂载到支持 Skills 的智能体(如 Claude Code)中,把仓库放进 skills 目录,以 SKILL.md 为入口,适合需要批量产出提示词的重度用户。第二种是直接发给网页版聊天模型,将 references 目录下的两份方法文件连同需求一并上传,模型即可按规范生成成品提示词。第三种是单文件合并版,把全部方法论放进一个 NAI5_All_Prompting.md,适合仅能传递单个附件的环境。
# 权重数值与角色绑定写法(可直接复制的模板)
# 增强与弱化
1.4::dynamic angle::, wide shot, close-up,
0.5::crowd::, -1::simple background::,
# 多角色 source# / target# 绑定
source#1 girl, white hair, blue eyes, sitting on desk,
target#1 boy, black hair, looking at girl, standing,
# 负权排除项(模型已知怪癖)
-2::flat color::, -1::watermark::, -3::artist collaboration::,
# 场景氛围
cinematic lighting, warm sunset, god rays
写作方法强调“默认不加权、只在实测不足时加权”。黄金区间位于 1.3 至 1.8,负权按“排除项模板”而非“反义词”理解——实测显示 87% 的负权压制目标是 watermark、crowd 这类模型已知怪癖,而不是画面的反义描述。发布前需核对角色知识库时限、负权是否合理、检查各阶段工序是否齐全,确保输出符合完整的分镜逻辑。
综合判断与澄清
需要澄清的常见误区是:负权重并不是大模型的“反义词字典”。1844 条实测数据中,61% 的画师使用了负权,但去重后仅剩 156 种组合、前 6 种便覆盖了 58% 的用量,且这些组合多随画师串被整套复制。真正能作为画面反义词使用的负权只占约 13%,因此写作时更应把负权视为排除项模板,而非试图用语义相对词反向控制画面。另一个误区是 1471 并非提示词硬上限。实测 99% 的提示词集中在 1329 token 以内,超过上限的个例也能正常出图,只是额度消耗更高、注意力被稀释,过度堆词反而降低效果。
未解决的问题
当前该方法仍属于单一作者社区的项目,缺少独立模型回放与真实 API 兼容性的系统验证。数据基线虽来自 2226 张实测图,但主要集中于二次元插画与角色绘制场景,对写实、建筑、产品等其它画风的覆盖有限。负权“排除项模板”能在多大程度上迁移到其它扩散模型(如 SDXL、Flux),也有待更多跨模型实测证明。
引用来源
- NovelAI Official. [Image Generation] NovelAI Diffusion V5 is here! 2026-08-21. https://journal.novelai.net/image-generation-novelai-diffusion-v5-is-here-c2df7c6b8d2d/
- NovelAI Documentation. Image Generation Models: NovelAI Diffusion V5 Full and Curated Specifications. 2026-08-21. https://docs.novelai.net/en/image/models/
- AirMore AI. NovelAI V5 Review: NSFW Anime Image Model, Prompting, Pricing and Limits. 2026-08-24. https://airmore.ai/ai-review/novelai-v5-review
- Reddit r/NovelAi. V5 spotlight: Multi-Language Prompting and Syntax Evolution. 2026-09-04. https://reddit.com/r/NovelAi/comments/1w74t9q/v5_spotlight_multilanguage_prompting/
- Miint-Sunny. nai5-prompting: Agent Skills for NovelAI Diffusion V5 Prompt Generation. 2026-08-30. https://github.com/Miint-Sunny/nai5-prompting
— 伊娃 👑