配图质量的关键不是把文章平均切成若干段,而是找出读者真正需要看见的判断和关系。本文从认知锚点出发,逐步提取核心动词、物理动作、主物件和 Shot List,再用单张生成与 QA 验证画面是否解释了观点,而不是只把角色贴在画面里。文中只讨论可复现的步骤,不把单次结果扩展成产品承诺;每个结论都标注前提、证据和无法覆盖的边界。读者可以先完成最小验证,再按自己的版本、权限和数据补充实验。

第314期我们完成了小恩 Codex Skill 的安装,并看懂了仓库里的角色规则、视觉 DNA、构图模式、Prompt 模板和 QA 清单。

但安装成功,不等于一定能得到好配图。

很多人第一次调用生图 Skill,会直接把一篇文章粘进去,然后说:

帮我配 8 张图,风格统一,好看一点。

结果通常有三种:

小恩 Skill 的关键,不是把所有段落都画出来,而是先从文章里找出值得被看见的认知锚点,再把它转译成一个可观察的动作。

这条链路可以写成:

文章观点
  -> 认知锚点
  -> 核心动词
  -> 物理动作
  -> 主物件
  -> Shot List
  -> 单张生成
  -> QA

这篇只讲中间最重要的一段:怎样从文字走到 Shot List。你可以先不生成任何图片,先把配图逻辑审清楚。

项目地址:GitHub 项目仓库

一、认知锚点不是段落标题

“认知锚点”可以理解为一篇文章里最值得读者停下来理解的一处判断、转折、关系或方法。

它不一定出现在小标题里,也不一定是最容易被摘抄的句子。

例如,一篇文章的小标题写着“为什么要做内容复用”,这只是一个主题。真正值得配图的认知锚点可能是:

内容复用不是把旧文章复制到新平台,
而是把一次经验拆成可以重新组合的模块。

主题告诉你在讲什么,认知锚点告诉你读者应该看懂什么。

1. 值得视觉化的六类内容

仓库的 composition-patterns.md 把优先选择的内容归纳得很清楚,通常包括下面六类:

类型 文字表现 适合转成的动作
核心判断 这个方法真正解决的不是 A,而是 B 小恩把错误对象移开,处理真正的对象
认知转折 不是堆更多素材,而是提炼少数关键判断 小恩从一堆材料中取出一张核心卡片
输入处理输出 输入文章,提炼观点,再生成配图 小恩在中间处理台拆解、筛选或校准
流程卡点 问题发生在两个环节的交接处 小恩维修接口、接通断点或托住下坠模块
状态变化 从混乱、重复、不可用变成清晰、可复用 小恩改变同一个物件的状态
可复用结论 一次复盘要沉淀为下一次行动规则 小恩把经验归档、取出并装入下一次任务

2. 不值得单独配图的内容

下面这些内容一般不值得单独占一张正文图:

配图不是对文章做逐段插图翻译。真正好的正文图,应该帮助读者理解那些只读文字不容易抓住的关系。

二、四步把抽象判断变成画面

小恩 Skill 的核心方法可以压缩成四步:

找到核心判断
  -> 提取核心动词
  -> 把动词变成物理动作
  -> 让小恩亲自完成动作

下面用本文所属主题做一个完整拆解。

第一步,先写一句“这张图只想说明什么”

不要一开始就想“画电脑、画卡片,还是画一个小恩”。

先把目标压缩成一句话:

这张图只想说明:
小恩配图不是平均解释每个段落,而是先挑出最重要的认知锚点。

这句话越短越好。它不是给读者看的标题,而是给配图执行者看的约束。

如果一句话里出现了“同时”“以及”“另外”“还有”,通常说明里面塞了多个认知,需要拆成两张图,或者只保留一个主判断。

第二步,从判断里提取核心动词

上面这句判断里,真正有动作感的词是:

挑出

它比“理解”“解释”“处理内容”更适合做画面,因为“挑出”天然可以变成手部动作、筛选动作和对象变化。

常见的抽象词可以这样换:

抽象表达 可继续追问 可能的核心动词
统一管理 到底统一了什么 分流、归档、限制、追踪
提升质量 质量是怎样变化的 筛选、校准、比较、剔除
经验沉淀 经验去了哪里 记录、分类、保存、复用
找到问题 问题怎样被发现 观察、测量、拆开、对照
推进项目 下一步怎么发生 连接、托住、推动、启动
方法可复用 哪个部分可以带走 拆出、装盒、取出、重组

核心动词不是文案修辞,而是后面选择画面结构的开关。

第三步,把动词变成物理动作

“挑出”可以变成:

一叠纸卡从左侧进入;
小恩站在一张有窄缝的工作台前;
它把其中一张卡片从缝隙里取出;
被取出的卡片被放到一个空白观察框里;
剩余卡片留在原处,但不再抢画面中心。

这里不需要真实 UI,也不需要画一张“认知锚点筛选流程图”。

一个简单物件和一个具体动作,已经可以表达“从很多段落中选出少数关键判断”。

第四步,让小恩成为动作的必要条件

最后问一句:

如果把小恩删掉,这个动作还会不会自动发生?

如果答案是“会”,那小恩还是装饰。

上面的场景里,小恩必须亲手从狭窄的选择缝里取出那张卡片,并把它放入观察框。画面中的变化由小恩造成,删掉小恩之后,只剩一堆卡片和一个框,表达会变得不完整。

这就是仓库反复强调的原则:

不是先画一个系统,再把小恩放进去;
而是先确定小恩正在做什么,再让画面围绕动作成立。

三、一个完整的认知锚点拆解例子

假设你要给下面这段文章配图:

AI 生成的文章和图片不能直接发布。
真正稳定的流程,不是让模型一次输出完美答案,
而是把输出分成候选、筛选、校准和归档四个步骤。

1. 不要把整段话画成四个框

最直觉的做法是画四个方框:

候选 -> 筛选 -> 校准 -> 归档

这能传递流程,但很像 PPT 或流程图,也没有说明“为什么人工要介入”。

2. 找到真正的认知锚点

这段话真正想说明的不是“有四个步骤”,而是:

稳定的 AI 工作流依赖人的筛选和校准,
而不是依赖模型一次性给出完美结果。

3. 提取核心动词

这里至少有三个动词:

筛选、校准、归档

一张图只保留一个主动作。假如本文需要三张图,可以分别表达三个认知;假如只能画一张,优先保留“校准”,因为它最能解释“为什么不能直接发布”。

4. 变成物理场景

可以这样设计:

一台简化的输出机器吐出三张略有偏差的结果卡片。
小恩蹲在机器出口,用一把很短的刻度尺贴近其中一张卡片,
把偏离基准线的卡片向后拨开,
只把校准后的卡片放到前方的发布托盘。

这里的主物件是“输出机器和基准线”,小恩的动作是“测量和拨正”,画面表达的是“输出要经过人工校准”。

5. 确定短标注

文字只保留观察笔记式的短语:

原始输出
偏差
人工校准
可发布

不建议把完整句子写进图片。长句会让图变成一张课程页,也会增加错字和生成失败的概率。

四、Shot List 应该写到什么程度

Shot List 不是一句“画一张小恩配图”,也不是把最终 Prompt 提前写成一大段。

它是生成前的拍摄清单,要让作者、编辑和设计师能在生图之前审查逻辑。

仓库给出的模板包含这些字段:

图号:
放置位置:
图的主题:
核心认知:
构图类型:
抽象动词:
物理动作:
小恩动作:位置 + 姿态 + 工具 + 动作 + 结果
主要物件:
辅助物件:
信息流向:
建议标注:
颜色用途:
留白位置:
原创性检查:

一个可直接使用的 Shot List

以“AI 输出需要人工校准”这段内容为例:

图号:01
放置位置:解释“不能直接发布”的段落之后
图的主题:输出不是成品,校准才是发布前的关键动作
核心认知:AI 结果需要人工对照标准、发现偏差并修正
构图类型:单一动作场景
抽象动词:校准
物理动作:把偏离基准线的卡片拨回可用位置
小恩动作:站在输出机器出口,身体前倾,双手拿短刻度尺和夹子,
            对照一条橙色基准线,把一张歪斜卡片轻轻拨正
主要物件:简化输出机器、三张结果卡片和一条基准线
辅助物件:前方一个空白发布托盘
信息流向:机器吐出候选结果 -> 小恩检查偏差 -> 结果进入托盘
建议标注:原始输出/偏差/人工校准/可发布
颜色用途:橙色表示基准线和拨正动作,蓝色只表示机器返回的反馈
留白位置:画面右上方和左下方保留大块纯白
原创性检查:不使用传送带、漏斗、桥和旧案例中的断点结构,
            改用出口刻度线与拨正动作表达校准

这份清单已经足够指导单张生图,但没有把画面塞满。它只规定必要关系,给模型留下适度的视觉解释空间。

五、直接复制的三条调用 Prompt

Prompt 1:只提取认知锚点

适合文章还没有确定配几张图时:

Use $xiaoen-ai-observer-illustrations
先不要生成图片。阅读下面的中文文章,只提取真正值得视觉化的认知锚点。

要求:
1. 不要平均给每个段落配图。
2. 优先选择核心判断、认知转折、输入处理输出关系、流程卡点、
   状态变化和可复用结论。
3. 每个锚点用一句话说明“读者应该看懂什么”。
4. 说明为什么它值得配图,以及不配图会损失什么理解。
5. 最多输出 6 个候选锚点,并按重要性排序。
6. 不要生成图片,不要写成标题列表。

文章正文:
<粘贴文章>

Prompt 2:生成 Shot List

适合你已经选定了候选锚点:

Use $xiaoen-ai-observer-illustrations
先不要生图。根据下面的文章和认知锚点,输出 4 张 Shot List。

每张必须包含:
- 放置位置
- 核心认知
- 构图类型
- 抽象动词
- 物理动作
- 小恩的位置、姿态、工具、接触对象和动作结果
- 一个主要物件和最多一个辅助物件
- 信息流向
- 3 到 5 个短中文标注
- 橙色、蓝色或红色各自表示什么
- 大块留白放在哪里
- 与之前案例相比具体改变了哪三个构图元素

硬性限制:
- 每张只表达一个核心认知。
- 小恩必须亲自改变主物件的状态。
- 删除小恩后,画面不能完整表达原判断。
- 不使用 PPT、真实 UI、商业插画和赛博科技风。

文章正文:
<粘贴文章>

Prompt 3:由 Shot List 生成一张图

不要一次让模型把 4 张图拼在一张画布里。每个 Shot 单独调用:

Use $xiaoen-ai-observer-illustrations
根据下面这条 Shot List,只生成一张 16:9 横版正文配图。

这张图只表达一个核心认知:
<填写核心认知>

小恩必须完成这个动作:
<填写位置、姿态、工具、接触对象和结果>

主要物件:
<填写一个主物件>

短中文标注:
<填写 3 到 5 个短标注>

严格保持小恩角色参考、纯白背景、黑色极简手绘、大量留白和少量橙蓝批注。
禁止大标题、真实软件界面、品牌 Logo、PPT 信息图、复杂背景、
蓝紫发光科技感、商业矢量插画和可爱吉祥物风。

六、为什么要先做 Shot List

先做 Shot List 有三个现实好处。

1. 先检查逻辑,再消耗生图成本

一张图是否值得生成,和它能不能生成是两件事。

Shot List 阶段可以先问:

这些问题在文字阶段解决,比生图之后再返工便宜得多。

2. 避免整篇文章被同一种构图占满

仓库明确提醒,不要连续复刻传送带、漏斗、桥、鱼、信息井、发酵罐和断点接口等旧隐喻。

一个系列可以轮换:

第1张:观察
第2张:拆解
第3张:校准
第4张:归档
第5张:推动

动作轮换比“每张都画一个小恩站在设备旁边”更能让 IP 形成稳定但不重复的工作方式。

3. 方便多人协作

企业内容团队经常不是一个人从头做到尾。

作者负责确认判断,编辑负责删减锚点,设计师负责检查画面,工程师负责接入生成接口。Shot List 让每个人看到的是同一份中间产物,不用反复猜测“这张图为什么要这样画”。

七、上游 API 如何承接 Shot List 前后的模型任务

小恩 Skill 本身不要求 上游 API,也不能据此推断仓库已经原生集成了 上游 API。

更适合企业的分工是:

文章或研究资料
  -> 上游 API 统一调用文本模型提炼候选锚点
  -> 编辑确认 Shot List
  -> 小恩 Skill 固化动作、风格和角色规则
  -> 上游 API 路由图像模型完成生成
  -> 视觉模型或人工按 QA 复核
  -> 内容系统发布和归档

在这条链路里,上游 API 的价值不在于替小恩决定“画什么”,而在于让企业能够统一管理模型调用:

建议把一次配图任务视为一个可追踪的任务单,而不是一串无法回溯的聊天:

task_id
project_id
article_id
skill_version
prompt_version
selected_shots
text_model
image_model
qa_status
estimated_cost
actual_cost
failure_reason

字段名称可以按企业系统调整,关键是要能回答三件事:

  1. 这张图是谁、用什么规则生成的?
  2. 为什么它通过或没有通过?
  3. 这次返工究竟花了多少模型成本?

八、生成前的 Shot List 验收清单

认知验收

动作验收

构图验收

原创性验收

九、常见失败与处理顺序

失败一:看起来漂亮,但不知道在讲什么

先不要加字。回到“这张图只想说明什么”,删掉所有不能服务这个判断的对象。

失败二:小恩变成旁观者

把“站在旁边看”改成明确动作:

检查 -> 接触并对照
分析 -> 拆开并比较
优化 -> 拧动并改变
复盘 -> 分类并归档
推进 -> 托住并推动

失败三:一张图塞进四五个结论

优先保留最能解释文章转折的一个判断,其余内容交给下一张图或正文。

失败四:画面像 PPT

删除大标题、规整矩形、编号、长箭头和密集文字,把节点改成一个可触摸的主物件。

失败五:动作和隐喻重复

不只换标签。至少同时改变主物件、动作、空间关系和颜色用途中的三项。

十、今天就能完成的一次测试

拿一篇 500 到 1000 字的中文文章,按下面顺序做:

第1步:让 Skill 只提取 3 个认知锚点。
第2步:人工删除其中 1 个最弱锚点。
第3步:让 Skill 为剩余 2 个锚点输出 Shot List。
第4步:只选 1 个 Shot 生成单张图。
第5步:按“小恩是谁、正在做什么、为什么必须在这里”做三秒测试。
第6步:通过后再生成第二张。

第一次不要追求九张图,也不要先追求整套风格海报。先确认一个动作能否把一个判断讲清楚。

总结与系列导航

小恩 Skill 最值得学习的不是某一个画面,而是这套从文字到视觉的中间方法:

不要从“画什么”开始,
要从“读者应该看懂什么”开始。

不要把抽象词直接塞进 Prompt,
要把抽象词变成小恩正在完成的动作。

不要先批量生图,
先用 Shot List 把认知、动作、物件和留白审清楚。

第314期讲了项目是什么、怎么安装和怎么调用;本期把认知锚点与 Shot List 拆开了。下一期继续处理最容易翻车的部分:怎样用角色参考、视觉 DNA 和 QA 清单,减少小恩变成猫、机器人、商业吉祥物或普通黑色角色的情况。

项目地址:GitHub 项目仓库

企业需要把文章分析、图片生成、视觉审核和素材检索接进自己的系统时,可以用 上游 API 作为企业 API 网关,统一处理模型路由、Key 权限、日志审计、预算和成本治理;但具体模型、接口字段和商用授权,仍应以实际服务文档与企业合规要求为准。

结论

本文给出了问题定位、配置或创作流程的可执行路径。实际结果仍取决于当前版本、权限和运行环境,提交前应按官方文档复核可变字段,并保留失败证据和回滚边界。