配图质量的关键不是把文章平均切成若干段,而是找出读者真正需要看见的判断和关系。本文从认知锚点出发,逐步提取核心动词、物理动作、主物件和 Shot List,再用单张生成与 QA 验证画面是否解释了观点,而不是只把角色贴在画面里。文中只讨论可复现的步骤,不把单次结果扩展成产品承诺;每个结论都标注前提、证据和无法覆盖的边界。读者可以先完成最小验证,再按自己的版本、权限和数据补充实验。
第314期我们完成了小恩 Codex Skill 的安装,并看懂了仓库里的角色规则、视觉 DNA、构图模式、Prompt 模板和 QA 清单。
但安装成功,不等于一定能得到好配图。
很多人第一次调用生图 Skill,会直接把一篇文章粘进去,然后说:
帮我配 8 张图,风格统一,好看一点。
结果通常有三种:
- 每一段都被平均配了一张,真正重要的判断反而没有被突出。
- 每张图都有小恩,但小恩只是站在旁边,像被临时贴上去的吉祥物。
- 画面看起来很热闹,却无法回答“这张图到底解释了什么”。
小恩 Skill 的关键,不是把所有段落都画出来,而是先从文章里找出值得被看见的认知锚点,再把它转译成一个可观察的动作。
这条链路可以写成:
文章观点
-> 认知锚点
-> 核心动词
-> 物理动作
-> 主物件
-> Shot List
-> 单张生成
-> QA
这篇只讲中间最重要的一段:怎样从文字走到 Shot List。你可以先不生成任何图片,先把配图逻辑审清楚。
项目地址:GitHub 项目仓库
一、认知锚点不是段落标题
“认知锚点”可以理解为一篇文章里最值得读者停下来理解的一处判断、转折、关系或方法。
它不一定出现在小标题里,也不一定是最容易被摘抄的句子。
例如,一篇文章的小标题写着“为什么要做内容复用”,这只是一个主题。真正值得配图的认知锚点可能是:
内容复用不是把旧文章复制到新平台,
而是把一次经验拆成可以重新组合的模块。
主题告诉你在讲什么,认知锚点告诉你读者应该看懂什么。
1. 值得视觉化的六类内容
仓库的 composition-patterns.md 把优先选择的内容归纳得很清楚,通常包括下面六类:
| 类型 | 文字表现 | 适合转成的动作 |
|---|---|---|
| 核心判断 | 这个方法真正解决的不是 A,而是 B | 小恩把错误对象移开,处理真正的对象 |
| 认知转折 | 不是堆更多素材,而是提炼少数关键判断 | 小恩从一堆材料中取出一张核心卡片 |
| 输入处理输出 | 输入文章,提炼观点,再生成配图 | 小恩在中间处理台拆解、筛选或校准 |
| 流程卡点 | 问题发生在两个环节的交接处 | 小恩维修接口、接通断点或托住下坠模块 |
| 状态变化 | 从混乱、重复、不可用变成清晰、可复用 | 小恩改变同一个物件的状态 |
| 可复用结论 | 一次复盘要沉淀为下一次行动规则 | 小恩把经验归档、取出并装入下一次任务 |
2. 不值得单独配图的内容
下面这些内容一般不值得单独占一张正文图:
- “今天我们来介绍一个工具”这种开场句。
- 只有名词,没有判断和关系的产品介绍。
- 可以用一个小标题直接说明的目录信息。
- 只是重复前文,没有新增结论的段落。
- 需要依赖大量文字才能解释清楚的复杂清单。
- 纯粹为了填充图片数量而拆出的边角观点。
配图不是对文章做逐段插图翻译。真正好的正文图,应该帮助读者理解那些只读文字不容易抓住的关系。
二、四步把抽象判断变成画面
小恩 Skill 的核心方法可以压缩成四步:
找到核心判断
-> 提取核心动词
-> 把动词变成物理动作
-> 让小恩亲自完成动作
下面用本文所属主题做一个完整拆解。
第一步,先写一句“这张图只想说明什么”
不要一开始就想“画电脑、画卡片,还是画一个小恩”。
先把目标压缩成一句话:
这张图只想说明:
小恩配图不是平均解释每个段落,而是先挑出最重要的认知锚点。
这句话越短越好。它不是给读者看的标题,而是给配图执行者看的约束。
如果一句话里出现了“同时”“以及”“另外”“还有”,通常说明里面塞了多个认知,需要拆成两张图,或者只保留一个主判断。
第二步,从判断里提取核心动词
上面这句判断里,真正有动作感的词是:
挑出
它比“理解”“解释”“处理内容”更适合做画面,因为“挑出”天然可以变成手部动作、筛选动作和对象变化。
常见的抽象词可以这样换:
| 抽象表达 | 可继续追问 | 可能的核心动词 |
|---|---|---|
| 统一管理 | 到底统一了什么 | 分流、归档、限制、追踪 |
| 提升质量 | 质量是怎样变化的 | 筛选、校准、比较、剔除 |
| 经验沉淀 | 经验去了哪里 | 记录、分类、保存、复用 |
| 找到问题 | 问题怎样被发现 | 观察、测量、拆开、对照 |
| 推进项目 | 下一步怎么发生 | 连接、托住、推动、启动 |
| 方法可复用 | 哪个部分可以带走 | 拆出、装盒、取出、重组 |
核心动词不是文案修辞,而是后面选择画面结构的开关。
第三步,把动词变成物理动作
“挑出”可以变成:
一叠纸卡从左侧进入;
小恩站在一张有窄缝的工作台前;
它把其中一张卡片从缝隙里取出;
被取出的卡片被放到一个空白观察框里;
剩余卡片留在原处,但不再抢画面中心。
这里不需要真实 UI,也不需要画一张“认知锚点筛选流程图”。
一个简单物件和一个具体动作,已经可以表达“从很多段落中选出少数关键判断”。
第四步,让小恩成为动作的必要条件
最后问一句:
如果把小恩删掉,这个动作还会不会自动发生?
如果答案是“会”,那小恩还是装饰。
上面的场景里,小恩必须亲手从狭窄的选择缝里取出那张卡片,并把它放入观察框。画面中的变化由小恩造成,删掉小恩之后,只剩一堆卡片和一个框,表达会变得不完整。
这就是仓库反复强调的原则:
不是先画一个系统,再把小恩放进去;
而是先确定小恩正在做什么,再让画面围绕动作成立。
三、一个完整的认知锚点拆解例子
假设你要给下面这段文章配图:
AI 生成的文章和图片不能直接发布。
真正稳定的流程,不是让模型一次输出完美答案,
而是把输出分成候选、筛选、校准和归档四个步骤。
1. 不要把整段话画成四个框
最直觉的做法是画四个方框:
候选 -> 筛选 -> 校准 -> 归档
这能传递流程,但很像 PPT 或流程图,也没有说明“为什么人工要介入”。
2. 找到真正的认知锚点
这段话真正想说明的不是“有四个步骤”,而是:
稳定的 AI 工作流依赖人的筛选和校准,
而不是依赖模型一次性给出完美结果。
3. 提取核心动词
这里至少有三个动词:
筛选、校准、归档
一张图只保留一个主动作。假如本文需要三张图,可以分别表达三个认知;假如只能画一张,优先保留“校准”,因为它最能解释“为什么不能直接发布”。
4. 变成物理场景
可以这样设计:
一台简化的输出机器吐出三张略有偏差的结果卡片。
小恩蹲在机器出口,用一把很短的刻度尺贴近其中一张卡片,
把偏离基准线的卡片向后拨开,
只把校准后的卡片放到前方的发布托盘。
这里的主物件是“输出机器和基准线”,小恩的动作是“测量和拨正”,画面表达的是“输出要经过人工校准”。
5. 确定短标注
文字只保留观察笔记式的短语:
原始输出
偏差
人工校准
可发布
不建议把完整句子写进图片。长句会让图变成一张课程页,也会增加错字和生成失败的概率。
四、Shot List 应该写到什么程度
Shot List 不是一句“画一张小恩配图”,也不是把最终 Prompt 提前写成一大段。
它是生成前的拍摄清单,要让作者、编辑和设计师能在生图之前审查逻辑。
仓库给出的模板包含这些字段:
图号:
放置位置:
图的主题:
核心认知:
构图类型:
抽象动词:
物理动作:
小恩动作:位置 + 姿态 + 工具 + 动作 + 结果
主要物件:
辅助物件:
信息流向:
建议标注:
颜色用途:
留白位置:
原创性检查:
一个可直接使用的 Shot List
以“AI 输出需要人工校准”这段内容为例:
图号:01
放置位置:解释“不能直接发布”的段落之后
图的主题:输出不是成品,校准才是发布前的关键动作
核心认知:AI 结果需要人工对照标准、发现偏差并修正
构图类型:单一动作场景
抽象动词:校准
物理动作:把偏离基准线的卡片拨回可用位置
小恩动作:站在输出机器出口,身体前倾,双手拿短刻度尺和夹子,
对照一条橙色基准线,把一张歪斜卡片轻轻拨正
主要物件:简化输出机器、三张结果卡片和一条基准线
辅助物件:前方一个空白发布托盘
信息流向:机器吐出候选结果 -> 小恩检查偏差 -> 结果进入托盘
建议标注:原始输出/偏差/人工校准/可发布
颜色用途:橙色表示基准线和拨正动作,蓝色只表示机器返回的反馈
留白位置:画面右上方和左下方保留大块纯白
原创性检查:不使用传送带、漏斗、桥和旧案例中的断点结构,
改用出口刻度线与拨正动作表达校准
这份清单已经足够指导单张生图,但没有把画面塞满。它只规定必要关系,给模型留下适度的视觉解释空间。
五、直接复制的三条调用 Prompt
Prompt 1:只提取认知锚点
适合文章还没有确定配几张图时:
Use $xiaoen-ai-observer-illustrations
先不要生成图片。阅读下面的中文文章,只提取真正值得视觉化的认知锚点。
要求:
1. 不要平均给每个段落配图。
2. 优先选择核心判断、认知转折、输入处理输出关系、流程卡点、
状态变化和可复用结论。
3. 每个锚点用一句话说明“读者应该看懂什么”。
4. 说明为什么它值得配图,以及不配图会损失什么理解。
5. 最多输出 6 个候选锚点,并按重要性排序。
6. 不要生成图片,不要写成标题列表。
文章正文:
<粘贴文章>
Prompt 2:生成 Shot List
适合你已经选定了候选锚点:
Use $xiaoen-ai-observer-illustrations
先不要生图。根据下面的文章和认知锚点,输出 4 张 Shot List。
每张必须包含:
- 放置位置
- 核心认知
- 构图类型
- 抽象动词
- 物理动作
- 小恩的位置、姿态、工具、接触对象和动作结果
- 一个主要物件和最多一个辅助物件
- 信息流向
- 3 到 5 个短中文标注
- 橙色、蓝色或红色各自表示什么
- 大块留白放在哪里
- 与之前案例相比具体改变了哪三个构图元素
硬性限制:
- 每张只表达一个核心认知。
- 小恩必须亲自改变主物件的状态。
- 删除小恩后,画面不能完整表达原判断。
- 不使用 PPT、真实 UI、商业插画和赛博科技风。
文章正文:
<粘贴文章>
Prompt 3:由 Shot List 生成一张图
不要一次让模型把 4 张图拼在一张画布里。每个 Shot 单独调用:
Use $xiaoen-ai-observer-illustrations
根据下面这条 Shot List,只生成一张 16:9 横版正文配图。
这张图只表达一个核心认知:
<填写核心认知>
小恩必须完成这个动作:
<填写位置、姿态、工具、接触对象和结果>
主要物件:
<填写一个主物件>
短中文标注:
<填写 3 到 5 个短标注>
严格保持小恩角色参考、纯白背景、黑色极简手绘、大量留白和少量橙蓝批注。
禁止大标题、真实软件界面、品牌 Logo、PPT 信息图、复杂背景、
蓝紫发光科技感、商业矢量插画和可爱吉祥物风。
六、为什么要先做 Shot List
先做 Shot List 有三个现实好处。
1. 先检查逻辑,再消耗生图成本
一张图是否值得生成,和它能不能生成是两件事。
Shot List 阶段可以先问:
- 这张图到底在解释哪个判断?
- 小恩的动作是否和判断直接对应?
- 主物件是否足够简单?
- 读者不看长文,能否通过动作看懂关系?
- 这张图是不是只是上一张图换了文字?
这些问题在文字阶段解决,比生图之后再返工便宜得多。
2. 避免整篇文章被同一种构图占满
仓库明确提醒,不要连续复刻传送带、漏斗、桥、鱼、信息井、发酵罐和断点接口等旧隐喻。
一个系列可以轮换:
第1张:观察
第2张:拆解
第3张:校准
第4张:归档
第5张:推动
动作轮换比“每张都画一个小恩站在设备旁边”更能让 IP 形成稳定但不重复的工作方式。
3. 方便多人协作
企业内容团队经常不是一个人从头做到尾。
作者负责确认判断,编辑负责删减锚点,设计师负责检查画面,工程师负责接入生成接口。Shot List 让每个人看到的是同一份中间产物,不用反复猜测“这张图为什么要这样画”。
七、上游 API 如何承接 Shot List 前后的模型任务
小恩 Skill 本身不要求 上游 API,也不能据此推断仓库已经原生集成了 上游 API。
更适合企业的分工是:
文章或研究资料
-> 上游 API 统一调用文本模型提炼候选锚点
-> 编辑确认 Shot List
-> 小恩 Skill 固化动作、风格和角色规则
-> 上游 API 路由图像模型完成生成
-> 视觉模型或人工按 QA 复核
-> 内容系统发布和归档
在这条链路里,上游 API 的价值不在于替小恩决定“画什么”,而在于让企业能够统一管理模型调用:
- 用成本较低的文本模型做第一轮锚点候选。
- 用能力更强的模型处理复杂文章和多轮编辑。
- 用视觉模型检查角色是否变形、画面是否过满、文字是否异常。
- 用 Embedding 检索历史文章、已有 Shot List 和可复用素材。
- 用模型路由和失败切换减少单一上游不稳定对发布节奏的影响。
- 按项目、成员、环境和任务类型拆分 API Key,避免所有人共用一个生产密钥。
- 留下请求日志、模型版本、Skill 版本、Prompt 版本和成本记录,方便复盘返工原因。
建议把一次配图任务视为一个可追踪的任务单,而不是一串无法回溯的聊天:
task_id
project_id
article_id
skill_version
prompt_version
selected_shots
text_model
image_model
qa_status
estimated_cost
actual_cost
failure_reason
字段名称可以按企业系统调整,关键是要能回答三件事:
- 这张图是谁、用什么规则生成的?
- 为什么它通过或没有通过?
- 这次返工究竟花了多少模型成本?
八、生成前的 Shot List 验收清单
认知验收
- 每张只有一个核心认知。
- 核心认知可以用一句话说清楚。
- 它不是简单的小标题或段落复述。
- 读者看完动作,可以理解文章的一层关系。
- 多张图之间没有重复解释同一个观点。
动作验收
- 已经从判断里提取出一个主要动词。
- 抽象动词被转换成了物理动作。
- 小恩有明确的位置、姿态、工具和接触对象。
- 小恩的动作会改变主物件的状态。
- 删除小恩后,核心隐喻会明显失去意义。
构图验收
- 一个主物件,最多一个辅助物件。
- 不依赖规整框图和大量箭头。
- 有一整块安静留白,而不是零碎空隙。
- 颜色用途已经写清楚,没有大面积铺色。
- 标注是 3 到 5 处短中文,不是课程标题。
原创性验收
- 没有直接复制仓库示例的构图。
- 与系列前一张至少改变主物件、动作和空间关系中的三项。
- 没有因为“表达流程”就默认画传送带或漏斗。
- 隐喻来自当前文章,而不是通用图标拼贴。
九、常见失败与处理顺序
失败一:看起来漂亮,但不知道在讲什么
先不要加字。回到“这张图只想说明什么”,删掉所有不能服务这个判断的对象。
失败二:小恩变成旁观者
把“站在旁边看”改成明确动作:
检查 -> 接触并对照
分析 -> 拆开并比较
优化 -> 拧动并改变
复盘 -> 分类并归档
推进 -> 托住并推动
失败三:一张图塞进四五个结论
优先保留最能解释文章转折的一个判断,其余内容交给下一张图或正文。
失败四:画面像 PPT
删除大标题、规整矩形、编号、长箭头和密集文字,把节点改成一个可触摸的主物件。
失败五:动作和隐喻重复
不只换标签。至少同时改变主物件、动作、空间关系和颜色用途中的三项。
十、今天就能完成的一次测试
拿一篇 500 到 1000 字的中文文章,按下面顺序做:
第1步:让 Skill 只提取 3 个认知锚点。
第2步:人工删除其中 1 个最弱锚点。
第3步:让 Skill 为剩余 2 个锚点输出 Shot List。
第4步:只选 1 个 Shot 生成单张图。
第5步:按“小恩是谁、正在做什么、为什么必须在这里”做三秒测试。
第6步:通过后再生成第二张。
第一次不要追求九张图,也不要先追求整套风格海报。先确认一个动作能否把一个判断讲清楚。
总结与系列导航
小恩 Skill 最值得学习的不是某一个画面,而是这套从文字到视觉的中间方法:
不要从“画什么”开始,
要从“读者应该看懂什么”开始。
不要把抽象词直接塞进 Prompt,
要把抽象词变成小恩正在完成的动作。
不要先批量生图,
先用 Shot List 把认知、动作、物件和留白审清楚。
第314期讲了项目是什么、怎么安装和怎么调用;本期把认知锚点与 Shot List 拆开了。下一期继续处理最容易翻车的部分:怎样用角色参考、视觉 DNA 和 QA 清单,减少小恩变成猫、机器人、商业吉祥物或普通黑色角色的情况。
项目地址:GitHub 项目仓库
企业需要把文章分析、图片生成、视觉审核和素材检索接进自己的系统时,可以用 上游 API 作为企业 API 网关,统一处理模型路由、Key 权限、日志审计、预算和成本治理;但具体模型、接口字段和商用授权,仍应以实际服务文档与企业合规要求为准。
结论
本文给出了问题定位、配置或创作流程的可执行路径。实际结果仍取决于当前版本、权限和运行环境,提交前应按官方文档复核可变字段,并保留失败证据和回滚边界。