gimi-illustration-skill:文章配图不求人,AI Agent 自动出怪诞手绘风
- Yxy
- Agent Skills , AI 配图
- 17 Jul, 2026
痛点切入
写文章最头疼的环节之一:配图。
你花了两小时写完一篇 3000 字的深度内容,排版也调好了,但文章发出去就是”光秃秃”的。你知道配图能提升阅读量,但打开 Canva 或 Midjourney,又不知道画什么——你不是设计师,脑子里没有画面。
更麻烦的是风格统一。如果你是系列内容创作者,每篇文章的配图风格不一致会让品牌感很弱。但让 AI 生成配图,每次都要重新描述风格,结果还是五花八门。
gimi-illustration-skill 解决的就是这个问题:你只管写文章,AI 自动帮你规划配图策略、组装 prompt、调用生图工具、质检输出。你甚至不需要知道”怪诞手绘风”是什么样的,skill 会处理好一切。
技能能做什么,不能做什么
gimi-illustration-skill 是一个可以安装到 Codex、Cursor 等编程助手的技能。它不是”输入文字就出图”的魔法工具,而是一个让 agent 知道怎么给文章配图的技能包。
技能提供的能力:
- 文章理解:分析文章结构,识别需要配图的观点、流程和隐喻
- 配图策略:规划每张图的位置、内容和作用
- Prompt 组装:根据策略自动组装生图 prompt
- 风格统一:支持怪诞手绘风、无角色、自定义 IP 三种模式
- QA 质检:自动检查生成图片的质量
- 批量输出:多张图统一命名,输出到 outputs/ 目录
技能不提供的东西:
- 不直接生图:生图由当前 AI 平台的内置工具执行(Codex 的 Image Gen、Cursor 的 GenerateImage)
- 不生成文字内容:只负责配图,不修改文章
- 不处理复杂排版:只生成独立图片,不负责图片在文章中的位置
- 不保证一次成功:可能需要调整 prompt 或重新生成
一句话总结:你提供文章,agent 规划配图策略并组装 prompt,平台生图工具执行,skill 质检输出。
完整使用流程
1. 安装技能
Codex(推荐):
git clone https://github.com/GiMi-Xiaomi/gimi-illustration-skill.git
cd gimi-illustration-skill
mkdir -p "${CODEX_HOME:-$HOME/.codex}/skills"
cp -R . "${CODEX_HOME:-$HOME/.codex}/skills/gimi-illustration"
Cursor:
mkdir -p ~/.cursor/skills
ln -s "$(pwd)" ~/.cursor/skills/gimi-illustration
或在项目内放置:.cursor/skills/gimi-illustration/
2. 触发配图
在对话中发送触发词 + 文章正文:
配图
[粘贴你的文章正文]
触发词: 配图 / 给文章配图 / 帮我配图 / illustration
AI 会按 SKILL.md 工作流自动完成:理解正文 → 规划配图策略 → 组装 prompt → 调用平台生图 → QA 质检 → 保存到 outputs/。
3. 自定义 IP(2.0)
如果你有自己的品牌 IP,可以录入:
录入 IP
也可说:自定义 IP / 上传形象 / 新建 IP。
AI 会按 references/ip/_template.md 走录入流程(先确认形象方案,再设定图 / 校准图),不会一上来就当海报配图。完成后配图时指定你的 IP id 即可。
4. 常用选项
| 选项 | 默认 | 说明 |
|---|---|---|
| 比例 | 16:9 | 可说「3:4 竖版」「小红书」等 |
| IP | gimi | 马帽女孩;「不要人物」→ none;或用你录入的 id |
| 张数 | 自动推断 | 可说「帮我配 3 张」 |
| 标题 | 无 | 可说「顶部加手写标题」 |
核心功能解析
文章理解与配图策略
skill 的核心不是”生图”,而是”规划配图”。它会分析你的文章:
- 识别关键观点:哪些地方需要图来辅助理解
- 规划图片位置:每张图放在哪里、起什么作用
- 设计图片内容:每张图应该画什么、表达什么
- 控制风格统一:确保所有图属于同一个系列
这个过程类似一个”视觉编辑”:你写文字,它帮你决定哪里需要图、图应该长什么样。
三种 IP 模式
Gimi IP(默认): 马帽女孩角色,怪诞手绘风。适合大多数场景,有统一的视觉识别度。
无角色模式: 只有抽象图形和符号,没有人/动物角色。适合技术内容、严肃话题。
自定义 IP: 你自己的品牌角色。需要先”录入”,提供设定图和校准图,确保生成图片与你的品牌一致。
Prompt 组装逻辑
skill 内置了一套 prompt 模板,会根据配图策略自动组装:
- 根据文章内容选择合适的视觉隐喻
- 根据 IP 模式决定是否包含角色
- 根据比例调整构图
- 根据风格模板控制画风
你不需要手动写 prompt,skill 会处理好这些细节。
QA 质检
生成的图片会经过自动质检:
- 检查图片是否清晰
- 检查风格是否一致
- 检查是否符合配图策略
- 检查是否有明显错误
有问题的图片会被标记,你可以选择重新生成。
使用场景
图文创作者
小红书、公众号、博客作者,给文章穿插配图。每篇文章 3-5 张图,提升阅读量和分享率。
职场写作者
汇报、方案、文档,用图提升可读性。比”纯文字 PPT”更有视觉冲击力。
口播 / 演讲视觉稿
每张图独立传达一个观点,适合做口播视频的背景图或演讲的配图。
自有 IP 作者
上传自己的形象 → 录入为配图角色 → 每篇文章都用统一的品牌形象配图。
注意事项
风格一致性
gimi-illustration-skill 的默认风格是”怪诞手绘风”,如果你需要其他风格(写实、扁平、像素等),需要调整 prompt 模板或使用其他工具。
生图质量依赖平台
skill 负责策略和 prompt,生图由平台内置工具执行。不同平台的生图质量不同,Codex 的 Image Gen 通常比其他平台更稳定。
自定义 IP 需要校准
录入自定义 IP 后,可能需要多次校准才能保证生成图片与设定一致。这个过程需要耐心。
不适合复杂场景
skill 擅长”一个观点一张图”的简单配图,不适合需要复杂构图、多角色互动、或精确控制的场景。
结论
gimi-illustration-skill 不是一个通用生图工具,它解决的是”文章配图”这个具体问题。
如果你经常写文章但不擅长配图,或者想让 AI 帮你批量生成风格统一的配图,这个技能值得试。它把”配图”从设计师的工作变成 agent 的工作,降低了内容创作的视觉门槛。