gimi-illustration-skill:文章配图不求人,AI Agent 自动出怪诞手绘风

痛点切入

写文章最头疼的环节之一:配图。

你花了两小时写完一篇 3000 字的深度内容,排版也调好了,但文章发出去就是”光秃秃”的。你知道配图能提升阅读量,但打开 Canva 或 Midjourney,又不知道画什么——你不是设计师,脑子里没有画面。

更麻烦的是风格统一。如果你是系列内容创作者,每篇文章的配图风格不一致会让品牌感很弱。但让 AI 生成配图,每次都要重新描述风格,结果还是五花八门。

gimi-illustration-skill 解决的就是这个问题:你只管写文章,AI 自动帮你规划配图策略、组装 prompt、调用生图工具、质检输出。你甚至不需要知道”怪诞手绘风”是什么样的,skill 会处理好一切。

技能能做什么,不能做什么

gimi-illustration-skill 是一个可以安装到 Codex、Cursor 等编程助手的技能。它不是”输入文字就出图”的魔法工具,而是一个让 agent 知道怎么给文章配图的技能包。

技能提供的能力:

  • 文章理解:分析文章结构,识别需要配图的观点、流程和隐喻
  • 配图策略:规划每张图的位置、内容和作用
  • Prompt 组装:根据策略自动组装生图 prompt
  • 风格统一:支持怪诞手绘风、无角色、自定义 IP 三种模式
  • QA 质检:自动检查生成图片的质量
  • 批量输出:多张图统一命名,输出到 outputs/ 目录

技能不提供的东西:

  • 不直接生图:生图由当前 AI 平台的内置工具执行(Codex 的 Image Gen、Cursor 的 GenerateImage)
  • 不生成文字内容:只负责配图,不修改文章
  • 不处理复杂排版:只生成独立图片,不负责图片在文章中的位置
  • 不保证一次成功:可能需要调整 prompt 或重新生成

一句话总结:你提供文章,agent 规划配图策略并组装 prompt,平台生图工具执行,skill 质检输出。

完整使用流程

1. 安装技能

Codex(推荐):

git clone https://github.com/GiMi-Xiaomi/gimi-illustration-skill.git
cd gimi-illustration-skill
mkdir -p "${CODEX_HOME:-$HOME/.codex}/skills"
cp -R . "${CODEX_HOME:-$HOME/.codex}/skills/gimi-illustration"

Cursor:

mkdir -p ~/.cursor/skills
ln -s "$(pwd)" ~/.cursor/skills/gimi-illustration

或在项目内放置:.cursor/skills/gimi-illustration/

2. 触发配图

在对话中发送触发词 + 文章正文:

配图

[粘贴你的文章正文]

触发词: 配图 / 给文章配图 / 帮我配图 / illustration

AI 会按 SKILL.md 工作流自动完成:理解正文 → 规划配图策略 → 组装 prompt → 调用平台生图 → QA 质检 → 保存到 outputs/。

3. 自定义 IP(2.0)

如果你有自己的品牌 IP,可以录入:

录入 IP

也可说:自定义 IP / 上传形象 / 新建 IP

AI 会按 references/ip/_template.md 走录入流程(先确认形象方案,再设定图 / 校准图),不会一上来就当海报配图。完成后配图时指定你的 IP id 即可。

4. 常用选项

选项默认说明
比例16:9可说「3:4 竖版」「小红书」等
IPgimi马帽女孩;「不要人物」→ none;或用你录入的 id
张数自动推断可说「帮我配 3 张」
标题可说「顶部加手写标题」

核心功能解析

文章理解与配图策略

skill 的核心不是”生图”,而是”规划配图”。它会分析你的文章:

  1. 识别关键观点:哪些地方需要图来辅助理解
  2. 规划图片位置:每张图放在哪里、起什么作用
  3. 设计图片内容:每张图应该画什么、表达什么
  4. 控制风格统一:确保所有图属于同一个系列

这个过程类似一个”视觉编辑”:你写文字,它帮你决定哪里需要图、图应该长什么样。

三种 IP 模式

Gimi IP(默认): 马帽女孩角色,怪诞手绘风。适合大多数场景,有统一的视觉识别度。

无角色模式: 只有抽象图形和符号,没有人/动物角色。适合技术内容、严肃话题。

自定义 IP: 你自己的品牌角色。需要先”录入”,提供设定图和校准图,确保生成图片与你的品牌一致。

Prompt 组装逻辑

skill 内置了一套 prompt 模板,会根据配图策略自动组装:

  • 根据文章内容选择合适的视觉隐喻
  • 根据 IP 模式决定是否包含角色
  • 根据比例调整构图
  • 根据风格模板控制画风

你不需要手动写 prompt,skill 会处理好这些细节。

QA 质检

生成的图片会经过自动质检:

  • 检查图片是否清晰
  • 检查风格是否一致
  • 检查是否符合配图策略
  • 检查是否有明显错误

有问题的图片会被标记,你可以选择重新生成。

使用场景

图文创作者

小红书、公众号、博客作者,给文章穿插配图。每篇文章 3-5 张图,提升阅读量和分享率。

职场写作者

汇报、方案、文档,用图提升可读性。比”纯文字 PPT”更有视觉冲击力。

口播 / 演讲视觉稿

每张图独立传达一个观点,适合做口播视频的背景图或演讲的配图。

自有 IP 作者

上传自己的形象 → 录入为配图角色 → 每篇文章都用统一的品牌形象配图。

注意事项

风格一致性

gimi-illustration-skill 的默认风格是”怪诞手绘风”,如果你需要其他风格(写实、扁平、像素等),需要调整 prompt 模板或使用其他工具。

生图质量依赖平台

skill 负责策略和 prompt,生图由平台内置工具执行。不同平台的生图质量不同,Codex 的 Image Gen 通常比其他平台更稳定。

自定义 IP 需要校准

录入自定义 IP 后,可能需要多次校准才能保证生成图片与设定一致。这个过程需要耐心。

不适合复杂场景

skill 擅长”一个观点一张图”的简单配图,不适合需要复杂构图、多角色互动、或精确控制的场景。

结论

gimi-illustration-skill 不是一个通用生图工具,它解决的是”文章配图”这个具体问题。

如果你经常写文章但不擅长配图,或者想让 AI 帮你批量生成风格统一的配图,这个技能值得试。它把”配图”从设计师的工作变成 agent 的工作,降低了内容创作的视觉门槛。

仓库:https://github.com/GiMi-Xiaomi/gimi-illustration-skill

相关文章

manim_skill:一个能让 AI 助手正确写 Manim 动画的 Agent Skill

解决痛点 让 ChatGPT 或 Claude 帮你写一段 Manim 动画代码,你大概率会拿到这样的东西: 有时候 import 从 manim 开始,有时候从 manimlib ...

edulab: 把数学题变成交互式 3D 课堂

一个学生盯着立体几何题发呆。"求直线 PQ 与平面 ABC 的夹角。" 课本上只有一张静态图。线叠在一起,角看不清楚。你没法旋转它,没法放大看交点,甚至无法直觉判断那个 120° 的答案在空间里到底对 ...

如何把真实世界的能力封装为 Agent Skill

通用 AI Agent 能力很强,但缺少每支团队都有的东西:程序性知识。你的代码审核清单、部署手册、API 规范——这些都不在模型的训练数据里。 这就是 Agent Skill 要解 ...

handdraw-story-video:手绘插图秒变短视频,AI Agent 直接出片

痛点切入 你画了一组手绘故事插图,想做成短视频发到抖音、小红书或视频号。 传统做法是什么?打开剪映或 Premiere,把图片一张张导入,手动设置每张的时长,加转场,配音乐,调整字幕位置。8 ...

跟 Claude 说一声,图就画好了:/drawio 在 Claude Code 里直接出图

跟 Claude 说一声,图就画好了:/drawio 在 Claude Code 里直接出图

你在跟 Claude Code 描述系统架构。它回复了一堆 ASCII art,差不多能看,但总觉得差点意思。你心想:"要是能直接让它画张图就好了。" 可以。 draw.io 的 Claude C ...

HyperFrames:写 HTML 就能出视频,专为 AI Agent 设计

做视频很慢。 传统视频工具是时间轴驱动的:拖素材、调关键帧、渲染、导出、修改、再渲染。你没法自动化这个流程,更没法让 AI 帮你做——因为 Premiere 不接受 prompt。 如果你想让代码 ...