让插图更好看的3种模式:AutoFigure AI图像增强功能(none/code/code2prompt)完整解析
让插图更好看的3种模式AutoFigure AI图像增强功能none/code/code2prompt完整解析【免费下载链接】AutoFigure项目地址: https://gitcode.com/gh_mirrors/au/AutoFigureAutoFigure 是一个开源的 AI 科学插图生成系统ICLR 2026能从文本描述或论文 PDF 自动生成可发表级别的科学插图。其中最实用的亮点是AI 图像增强Beautification功能——它提供none、code、code2prompt三种增强模式把简单的黑白布局草稿一键变成色彩专业、可直接用于论文和博客的精美科学插图。本文将带你完整看懂这三种模式的原理、区别和选择技巧。 AutoFigure 图像增强是做什么的在生成流程中AutoFigure 会先输出一张黑白布局图基于 mxGraph XML / SVG 的方框 箭头草稿。布局虽然准确但离 publication-ready可发表级别还差一步。图像增强就是在布局定稿后调用图像生成模型按你指定的艺术风格Art Style对草稿进行视觉美化把灰底的[icon]: 描述占位矩形替换成真正的小图标保留草稿中所有外部文字标签一个字符都不改应用你指定的配色、阴影、渐变等风格化效果增强功能的核心实现在 autofigure/enhancer.py 的ImageEnhancer.enhance()方法中input_type参数就对应三种模式none、code、code2prompt默认值在 autofigure/config.py 中定义为code2prompt。 三种模式一图看懂模式给 AI 的参考信息需要的 API适用场景none仅布局 PNG 图片只需图像生成 API快速美化、快速出图code布局 PNG 原始 SVG/XML 代码只需图像生成 API需要严格还原坐标与结构SDK 支持code2prompt布局 PNG LLM 生成的详细提示词需要 LLM 图像生成双 API追求最高质量官方推荐三种模式的提示词构建逻辑都在 autofigure/enhancer.py 的_build_enhancement_prompt()中可以按你的兴趣直接阅读源码。1️⃣ none 模式直接美化最省心none模式不使用任何代码参考直接把布局图片交给图像模型由 AI 视觉理解画面哪些方框要保持位置比例、哪些灰色占位块要换成图标、哪些文字必须原样保留。它的优点是链路最短——只需配置一个图像生成 API无需额外的 LLM。缺点是 AI 只能看图说话对复杂图形的细节还原依赖图像模型自身的能力。适合场景图比较简单、想快速看看美化效果、或者不想多配一套 LLM API 的情况。2️⃣ code 模式让代码当工程图纸code模式SVG code 参考模式会把原始 mxGraph XML / SVG 源码最多 5000 字符作为TECHNICAL REFERENCE技术参考随图片一起提交给图像模型提示它严格按照代码中的坐标、尺寸、连接关系来绘制。可以把它理解为none 给 AI 一张照片code 给 AI 一张工程图纸结构还原度更高。需要注意的是code 模式目前主要在Python SDK中支持在 autofigure/agent.py 的generate()参数里传enhancement_input_typecodeSDK 会自动读取生成的 SVG/XML 文件作为增强输入见 autofigure/agent.py。Web 端美化对话框只提供 none 和 code2prompt 两个选项。3️⃣ code2prompt 模式两步走的推荐方案code2prompt是界面中标注Recommended推荐的模式也是 autofigure/config.py 里的默认值。它分两步走第一步LLM大语言模型逐行分析 mxGraph XML 代码识别占位图标[icon]:前缀、箭头连接、文字标签和空间关系生成一份结构化的详细绘图提示词包含整体场景、视觉元素、需保留文字、风格实现、布局连接 5 个部分。核心函数是 autofigure/enhancer.py 的convert_code_to_text2image_prompt()。第二步图像模型图像模型拿着这份文字说明书 布局草稿 艺术风格来渲染最终插图。因为提示词已经把代码中的每个元素都翻译成了具体的视觉描述图像模型收到的指令远比看图美化精确最终效果最好。代价是需要同时配置 LLM API 和图像生成 API两套密钥。一个贴心的细节如果 LLM 转换提示词这一步失败后端会自动降级回 none 模式继续美化不会直接报错逻辑见 backend/autofigure_routes.py。️ 三步上手如何开启图像增强无论哪种模式都需要先完成布局定稿Finalize。之后的操作很轻量填写艺术风格在美化对话框中描述你想要的风格例如modern scientific illustration with pastel colors所有模式共用这一风格描述art_style参数。选择增强模式Web 界面打开美化对话框二选一Direct Beautification noneCode2Prompt code2prompt对应组件是 frontend/components/autofigure/BeautificationDialog.tsx模式类型定义在 frontend/lib/autofigure-types.ts。Python SDK调用generate()时传enable_enhancementTrue并用enhancement_input_type指定none/code/code2prompt三种模式中的任意一种。配置 API 密钥并选择变体数量所有模式都必填图像生成 APIProvider / API Key / Model / Base URLcode2prompt 额外必填 LLM API Key。enhancement_count参数可一次生成多个候选变体方便对比挑选。增强结果会保存为xxx_enhanced.png多变体时带_1、_2编号与原草稿放在同一输出目录对比查看很方便。❓ 新手常见问题Q1没有 LLM API Key 能用增强功能吗可以。选择 none 模式Web 和 SDK 都支持只配置图像生成 API 即可。Q2code 模式和 code2prompt 模式到底差在哪两者都是拿代码当参考。code 是直接把源码贴给图像模型code2prompt 是先让 LLM 把源码翻译成自然语言绘图指令再交给图像模型。后者指令更明确、对占位图标和文字保留的处理更精细因此官方推荐。Q3文字会不会被 AI 改错三种模式的提示词都明确要求外部文字必须逐字保留、[icon]:说明文字必须替换为图标且不留残余但 AI 生图仍有个别字符误差的可能建议开启多个变体并逐字核对关键标签。Q4支持哪些服务商图像生成侧支持 openrouter、bianxie、gemini 三家见 autofigure/config.py 的默认模型配置代码层面三者由 autofigure/enhancer.py 分别调用不同的 API 格式切换只需改enhancement_provider。 小结none只看图直接美化配置最简单适合快速出效果code附带源码当图纸结构还原更严格SDK 用户优选code2promptLLM 翻译 图像渲染两步走质量最佳是官方默认推荐三种模式共用同一套艺术风格描述与多变体机制配合 AutoFigure 的迭代生成能力从能看懂的草稿到能发论文的插图只差一次点击。想深入了解完整流水线可以继续阅读 autofigure/agent.py 中的生成与增强编排逻辑。【免费下载链接】AutoFigure项目地址: https://gitcode.com/gh_mirrors/au/AutoFigure创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

基于CNN的图像风格迁移毕设实战:VGG19原理、PyTorch源码与调参避坑指南

基于CNN的图像风格迁移毕设实战:VGG19原理、PyTorch源码与调参避坑指南

简介:这是一份面向计算机、人工智能、通信工程等专业学生与教师的毕业设计级项目源码,基于CNN卷积神经网络实现图像与视频风格迁移,适合课程设计、毕设答辩或项目初期立项演示,也便于具备一定Python基础的学习者在此基础上二次开发…

2026/10/11 1:25:27 阅读更多 →
深度学习台风路径预测:CNN+LSTM模型实战与工程避坑指南

深度学习台风路径预测:CNN+LSTM模型实战与工程避坑指南

简介:面向深度学习与气象交叉领域的开发者与科研人员,这份资源聚焦“基于深度学习的台风路径预测”完整项目,覆盖卷积神经网络、长短期记忆网络、自编码器等模型在历史气压、风速、海洋温度数据上的训练与调优,系统梳理数据预处理…

2026/10/11 1:25:27 阅读更多 →
基于Python的PCA人脸识别:从原理到调参的完整实践指南

基于Python的PCA人脸识别:从原理到调参的完整实践指南

简介:面向大学生课程设计与机器学习初学者的PCA人脸识别算法资源包,基于Python完整实现了从数据预处理、协方差矩阵计算、特征值分解到特征脸构建与识别的全过程。包内共21个文件,包含4个Python源码模块、16张运行效果或步骤示意图&#xff0…

2026/10/11 1:25:27 阅读更多 →

最新新闻

Linux网络性能优化实战:从内核参数调整到tcpdump抓包排查

Linux网络性能优化实战:从内核参数调整到tcpdump抓包排查

某个深夜,线上接口的P99延迟从60ms一路冲到700ms,我第一时间就想做一轮Linux网络性能优化与监控,于是把网上那套内核参数调优脚本挨个灌进去,tcp_tw_reuse、tcp_max_syn_backlog全都改了。结果延迟没降,反而有机器连接…

2026/10/11 2:22:00 阅读更多 →
Spring Boot JDBC多数据源动态切换实战:配置、路由与避坑指南

Spring Boot JDBC多数据源动态切换实战:配置、路由与避坑指南

简介:实际项目中常会遇到一个应用连接多个数据库的场景。这份“springboot-jdbc-多数据源”资源正是一套基于Spring Boot与JdbcTemplate的双数据源示例工程,面向Java开发者和需要处理跨库读写的中级程序员,目的是清晰展示多套数据源的定义、装…

2026/10/11 2:22:00 阅读更多 →
脑肿瘤MRI数据集的下载与整理:从NIfTI到训练集

脑肿瘤MRI数据集的下载与整理:从NIfTI到训练集

简介:面向医学影像与深度学习研究者,提供脑肿瘤MRI分类与分割两套配套数据。分类部分涵盖神经胶质瘤、脑膜瘤、垂体瘤及无肿瘤四种标签,便于训练图像分类模型;分割部分补充了肿瘤区域坐标标注,可支持语义分割与目标检测…

2026/10/11 2:22:00 阅读更多 →
阳光穿透树叶的丁达尔光斑动效:纯 CSS 径向渐变与混合模式叠加实战

阳光穿透树叶的丁达尔光斑动效:纯 CSS 径向渐变与混合模式叠加实战

在日语中,有一个极其唯美的专有词汇叫作“木漏れ日(Komorebi)”,专门用来指代“阳光穿透树叶的缝隙,在地面与墙面上洒下的摇曳光斑与丁达尔光柱”。 每当秋日微风拂过银杏树冠,金黄的枝叶随风轻轻晃动&…

2026/10/11 2:22:00 阅读更多 →
高校软件正版化落地指南:Navicat教育授权采购、部署与台账管理

高校软件正版化落地指南:Navicat教育授权采购、部署与台账管理

一说起校园里的软件正版化,很多人第一反应是“采购部门的事,跟我们搞技术的关系不大”。但这两年我在实际接触高校信息中心、计算机学院和科研团队的过程中,能明显感觉到一个变化:软件正版化已经不再是一张写在文件里的口号&#…

2026/10/11 2:22:00 阅读更多 →
FM020协议转换模块:实现PROFIBUS-DP与Modbus无缝对接

FM020协议转换模块:实现PROFIBUS-DP与Modbus无缝对接

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 2:20:59 阅读更多 →

日新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 5:23:50 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 21:32:20 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 10:38:42 阅读更多 →