配图翻车通常不是角色文件少写了一条规则,而是视觉约束、动作语义和验收标准没有连成一条链。本文围绕 Codex Skill 的视觉 DNA 与 QA 清单,分别检查角色身份、画面构图、留白、文字和隐喻是否达标,并给出生成前后都能执行的复核顺序。文中只讨论可复现的步骤,不把单次结果扩展成产品承诺;每个结论都标注前提、证据和无法覆盖的边界。读者可以先完成最小验证,再按自己的版本、权限和数据补充实验。

第314期我们讲了安装,第315期讲了认知锚点和 Shot List。

到了真正生成图片这一步,很多人会发现:文字里的逻辑已经写得很清楚,图却还是会翻车。

小恩可能变成猫、兔子、机器人或普通黑色吉祥物;白底变成蓝紫科技背景;画面从一张观察笔记变成一张商业海报;角色虽然长得像了,却只是站在一旁挥手,和文章的核心判断没有关系。

这说明配图质量至少有两层:

第一层:角色和视觉风格是否稳定
第二层:动作和隐喻是否真的表达文章

前者解决“这是不是小恩”,后者解决“这张图有没有用”。

小恩项目把这两层规则分别写进角色文件、风格文件和 QA 清单里。它的价值不只是让模型记住一只黑色角色,而是把个人 IP 的识别边界、动作边界和审美边界都变成可检查的条件。

项目地址:GitHub 项目仓库

一、什么是视觉 DNA

视觉 DNA 不是一句“黑色手绘风格”。

如果只有这句话,任何模型都可能画出不同的结果:黑色漫画、黑色商业插画、黑色科技海报、黑色儿童绘本,都可以声称自己符合要求。

仓库的 references/style-dna.md 把视觉约束拆成了多个维度:

维度 小恩 Skill 的默认规则 主要作用
画幅 16:9 横版 适配文章正文和网页阅读
背景 纯白,必要时极浅灰白 保持观察笔记的安静感
线条 黑色、细、轻微手绘抖动 避免光滑商业矢量感
主体比例 约占 40%–60% 给动作和留白留出空间
留白 至少约 35% 有效留白 避免挤成信息图或海报
颜色 黑色主结构,少量橙蓝批注 用颜色标记动作和状态
文字 3–5 处短中文标注 像观察笔记,不像课程页
气质 安静、克制、实验、略有观察感 形成持续可识别的 IP 语气

它刻意不选择下面这些视觉方向:

这些限制不是为了让图片“看起来简单”,而是为了让读者看到一个稳定的观察者,而不是每次都换一套画风的随机角色。

二、小恩的角色识别有硬边界

references/xiaoen-ip.md 规定了小恩不能随意变化的部分。

1. 头部和耳朵

2. 面部

3. 身体

4. 气质

这些规则共同构成小恩的最小识别标准。即使图中角色很小,也应该优先保留:

双峰高耳朵轮廓
白色星泪眼纹
黑色斗篷水滴身体

中央菱形在画面尺寸允许时再保留。不要为了增加细节,把小恩改得更像一个普通卡通人物。

三、角色一致性和动作一致性不是一回事

这是最容易被忽略的区别。

一张图可能具备所有角色特征:

有双峰耳朵
有星泪眼纹
有白色菱形
有黑色斗篷身体

但它仍然可能是一张不合格的配图,因为小恩只是站在图表旁边,或者举着一块写有结论的牌子。

因此需要分开检查:

角色一致性

问的是:

这是不是小恩?

主要检查外形、比例、颜色、眼纹、耳朵、身体和气质。

动作必要性

问的是:

小恩为什么必须在这里?

主要检查小恩是否接触主物件、是否改变了状态、是否真正执行了文章的核心动词。

仓库给出的判断很直接:

如果去掉小恩,图的核心隐喻仍然完整成立,
那么小恩就是装饰,构图需要重做。

这条规则非常适合团队评审。它把“我觉得角色有点多余”变成了一个可以复现的测试。

四、把 Prompt 分成五层

一段 Prompt 同时写角色、动作、风格、文字和禁用项,很容易变成一大段互相冲突的描述。

更稳定的写法,是按下面五层组织:

第1层:角色身份
第2层:核心认知
第3层:必要动作
第4层:视觉 DNA
第5层:负面约束和输出规格

第1层:角色身份

先锁定小恩是谁:

小恩是黑色实心主体的 AI时代观察员,
拥有与头部相连的高而圆润双峰耳朵、白色星泪状眼纹、
面部中央偏下的小白色菱形、黑色斗篷水滴身体、
隐藏式短手臂和两条短腿。
保持大头小身体、安静、冷静、半眯眼的观察者气质。

第2层:核心认知

只写一句:

这张图只表达:AI 输出必须经过人工校准才能发布。

不要在这里添加第二个结论。

第3层:必要动作

把 Shot List 里的动作写成可观察的过程:

小恩蹲在简化输出装置的出口,
用短刻度尺对照基准线检查结果卡,
把一张偏斜卡片拨正后放入前方托盘。
动作必须改变卡片状态,小恩不能站在完成图表旁边。

第4层:视觉 DNA

16:9 横版,纯白背景,黑色细手绘线稿,
大量整块留白,少量橙色表示校准动作,
少量蓝色表示 AI 返回反馈,中文标注短而少。

第5层:负面约束

不要真实软件 UI、品牌 Logo、复杂菜单、赛博科技、
蓝紫发光、PPT 信息图、商业矢量插画、儿童卡通、
腮红、嘴巴、牙齿、长腿、尾巴、翅膀和复杂服装。

这五层的好处是,出现问题时知道该改哪一层:

五、仓库中的两个角色参考图怎么用

当前仓库的 assets/character/ 目录提供了:

xiaoen-reference-sheet.png
xiaoen-reference-sheet-labeled.png

无文字参考图适合提供给图像模型作为视觉参考,带标签版本适合人类确认角色结构和命名。

推荐顺序是:

  1. 先让模型读取无文字角色参考图。
  2. 用 xiaoen-ip.md 补充不能变化的角色规则。
  3. 用当前 Shot List 指定小恩要做的动作。
  4. 最后用 style-dna.md 限制背景、线条、颜色和留白。

不要只给一张参考图,然后用一句“画成类似风格”结束 Prompt。

参考图只能帮助模型认出角色,不会自动告诉模型:

所以参考图是角色层,Shot List 是认知和动作层,视觉 DNA 是整体风格层,三者不能互相替代。

六、完整 QA 应该按什么顺序

仓库的 qa-checklist.md 建议按六个顺序检查:

1. 小恩角色一致性
2. 小恩是否承担核心动作
3. 认知和隐喻是否清楚
4. 构图、留白、颜色和文字
5. 现代设备是否过度写实
6. 是否复刻旧案例或连续重复套路

这个顺序很重要。

如果角色已经变成机器人,就不用先纠结标注颜色;如果小恩根本没有动作,就不用先调整某个按钮的位置。先修影响最大的层。

1. 角色检查

逐项看:

2. 动作检查

只用一个动词回答:

小恩正在做什么?

合格答案应该类似:

小恩正在把偏差卡片拨回基准线。
小恩正在拆开黑盒,取出可复用模块。
小恩正在把失败记录分类并放进经验档案。
小恩正在修理两个内容模块之间的接口。

不合格答案通常是:

小恩在旁边看。
小恩指着一张图。
小恩拿着写有结论的牌子。
小恩和一个系统待在一起。

3. 认知检查

用三秒测试:

如果只能看出“小恩在奇怪机器旁边”,说明隐喻不清楚。

4. 构图检查

5. 设备检查

电脑、平板、服务器和窗口只是服务于概念的道具。

它们应该是:

基本矩形
少量线条
几个简单按钮
少量卡片或气泡
手绘线缆和符号

一旦出现真实产品外观、复杂菜单、密集小字、金属材质、玻璃反光或发光 HUD,就需要降级重做。

6. 重复检查

不要只看单张是否成立,还要看整组是否重复。

如果连续三张都是“小恩站在设备旁边”“小恩搬纸箱”“小恩修电线”,即使每张单独看都合格,整组也会失去变化。

仓库建议在观察、记录、拆解、搬运、修理、推动、校准、测试、归档和复用之间轮换动作。

七、常见翻车类型和修复方法

翻车一:小恩变成猫、兔子或普通吉祥物

原因通常是角色规则不够具体,或者参考图与动作描述冲突。

修复时不要继续增加场景细节,先锁角色:

只修正小恩角色,保持背景、主物件、标注、构图和颜色不变。
严格匹配官方角色参考:双峰圆润耳朵、星泪眼纹、
中央白色菱形、黑色斗篷水滴身体、短手臂和短腿。
不要出现猫鼻、兔耳、尾巴、嘴巴、牙齿、头发或复杂服装。

翻车二:小恩太可爱

如果出现腮红、笑嘴、闪亮大眼、胜利姿势或贴纸感,可以这样修:

保持小恩安静、克制、冷静和略带观察感。
恢复半眯眼和简化面部,不增加嘴巴、牙齿、腮红、
爱心、夸张跳跃、毛绒质感和商业吉祥物表情。

翻车三:画面变成 PPT

常见表现是标题很大、四个方框平均排列、箭头很多、每个节点都写一长句。

处理顺序:

  1. 删除类型标题和大段文字。
  2. 只留一个主物件。
  3. 把方框改成可被小恩操作的物件。
  4. 把流程关系变成动作结果。
  5. 恢复一整块白色留白。

翻车四:画面太满

直接限制元素数量:

只保留一个小恩、一个主要物件、最多一个辅助物件和三到五处短标注。
删除装饰、背景、重复模块、无意义箭头、边框和多余文字。
至少保留约 40% 干净白色留白。

翻车五:中文标注错误

图像模型对长中文和专有名词的稳定性有限。

优先做三件事:

如果大量文字都错了,先去掉大部分文字,再重新生成;不要把一张正文配图改成文字海报。

翻车六:隐喻很怪但不清楚

“有一点怪”不是越奇怪越好。

合格的怪诞来自抽象关系被物理化,例如:

经验变成可取出的旧零件。
错误变成堵住出口的硬块。
流程卡点变成无法对齐的接口。
AI 输出变成需要校准的结果卡片。

如果读者还要看十行解释才能明白主物件代表什么,隐喻已经比原概念更复杂了。

八、什么时候重生成,什么时候局部编辑

适合整张重生成

适合局部编辑

仓库的 prompt-template.md 已经提供了删除标题、替换错字和修正小恩的局部编辑提示词。局部编辑时,必须写清楚“只修改什么”和“其他内容保持不变”。

九、把 QA 写进企业内容流程

小恩 Skill 的 QA 清单可以由人工执行,也可以作为视觉审核模型的检查依据。

如果企业通过 上游 API 统一调用文本、图像、视觉和 Embedding 模型,可以把流程拆成:

图像生成
  -> 视觉模型检查角色特征
  -> 文本模型读取 Shot List 和图片说明
  -> 规则检查比例、文字数量和禁用项
  -> 人工确认认知是否成立
  -> 通过后归档,失败则回到对应层修复

上游 API 在这里负责企业级模型入口和治理,不替小恩 Skill 定义角色。更准确的分工是:

推荐给每次输出附带这些元数据:

article_id
shot_id
skill_version
reference_asset_version
prompt_version
image_model
qa_model
qa_result
reviewer
revision_count
estimated_cost
actual_cost

这样当某一批图突然变得“太科技”或“角色变形”时,可以判断是模型变化、参考图变化、Prompt 修改还是 Skill 版本变化,而不是只能凭感觉重新试。

企业还应该在 上游 API 侧设置:

不要为了省一次人工审核,就让低置信度图片自动发布。配图是内容的一部分,角色一致性和表达准确性都应保留人工抽查。

十、一个可复制的完整调用模板

下面这段适合在已经有 Shot List、准备生成单张图时使用:

Use $xiaoen-ai-observer-illustrations

任务:根据下面的 Shot List 生成一张中文文章正文配图。

【核心认知】
这张图只表达:<一句话核心判断>

【小恩动作】
小恩位于:<位置>
姿态:<蹲下、前倾、托住、拆开、测量等>
工具:<工具>
接触对象:<主物件的具体位置>
动作结果:<主物件发生了什么变化>

【构图】
构图类型:<单一动作场景/系统局部/前后变化/小漫画>
主要物件:<一个主物件>
辅助物件:<最多一个>
信息流向:<从哪里到哪里>
留白位置:<画布哪一侧保留整块白色>

【文字】
只保留这些短标注:<3到5处,2到6字>

【视觉 DNA】
16:9 横版、纯白背景、黑色极简手绘、大量留白,
少量橙色表示动作和变化,少量蓝色表示 AI 反馈或可复用信息。
小恩保持黑白、安静、冷静、半眯眼和观察者气质。

【硬性 QA】
小恩必须与主物件有身体、工具或视线关系,并亲自改变主物件状态。
删除小恩后,核心隐喻不能完整成立。

【禁止】
真实 UI、品牌 Logo、复杂菜单、赛博科技、蓝紫发光、
PPT 信息图、商业矢量插画、儿童卡通、腮红、嘴巴、
牙齿、尾巴、翅膀、长腿、复杂服装、长句和大标题。

生成后不要立刻发布,先把图和这段 Prompt 一起交给 QA。

十一、发布前最终清单

角色

动作

风格

文字

系列

总结与系列导航

一个可以长期使用的 IP,不应该只靠一张参考图维持。

小恩项目给出的做法是:

角色参考图
  -> 角色不可变规则
  -> 视觉 DNA
  -> 核心动作规则
  -> 构图和隐喻规则
  -> Prompt 模板
  -> QA 清单

这套链路让“像不像小恩”和“有没有解释文章”都变成了可讨论、可复查、可迭代的标准。

第314期讲安装与调用,第315期讲认知锚点和 Shot List,本期讲视觉 DNA 与 QA。下一期继续往前走:当一个个人 IP 已经拥有稳定的审美和工作规则后,如何把它沉淀为团队可以复用的生产能力,并通过 上游 API 接入企业内容系统。

项目地址:GitHub 项目仓库

如果要把图像生成、视觉审核、历史素材检索和内容发布接进企业系统,可以用 上游 API 作为企业 API 网关,统一完成多模型接入、模型路由、API Key 权限、日志审计、预算告警和成本治理;小恩 Skill 仍然负责 IP 规则与配图质量标准,二者是协作关系,不是项目已经声明的原生依赖关系。

结论

本文给出了问题定位、配置或创作流程的可执行路径。实际结果仍取决于当前版本、权限和运行环境,提交前应按官方文档复核可变字段,并保留失败证据和回滚边界。