/figures/ › 真图案例库
真实论文原图 · 按构图类型分组 · 每类一张「怎么画」配方卡 · 图卡点开对照着画
/figures/ 里的「顶会 Pipeline 案例解剖」给出的是 简化重绘 的示意图,用于剖析构图、流向与配色。 这页是它的镜像,直接放上 论文中的原始真图,帮你看清:原作里到底画了多少细节、文字怎么放、配色到底用了什么。 两页对照读,效果最好。
每组左侧是「怎么画」配方卡,滚动右侧真图时常驻可见;图卡默认收起,点开标题即可对照着画,每组第一张已替你展开。
所有原图均来自 arXiv 公开 PDF,仅做画幅裁切与 PNG 重编码;版权归各论文。点击图片跳转 arXiv 详情页。
分组直达: A · 横向多阶段 B · 对比式 C · 双流对称 / 汇聚 D · 重参数 / 编解码 E · 工业 LLM 架构 F · 通用教程
最常见的 pipeline 画法:左→右一条主轴,每段是显式步骤。适合训练阶段、数据加工、模型主链。
RLHF 训练流程图被引用最多的范本。每步是「数据 → 模型 → 产物」的小闭环,三步纵向对齐形成隐式时间轴。
整张图分上下两大舱:上半 = 模型架构,下半 = 多任务训练格式。舱之间用灰底块框住,避免与中间的 Transformer 流程混淆。
左侧问题示例(蓝色块)→ 中间 retriever(绿底圆角框)→ 中间文档索引(紫色堆叠)→ 右侧 generator(蓝色圆角框)→ 右侧答案示例(紫色块)。
典型的「领域知识 → 文本化 → LLM 推理」管线。上下两条平行子流(FFT processed data / Statistically processed data),最后汇入同一个 LoRA 微调后的 LLM。
把「过去做法」放左边、「我们的做法」放右边,复用同一坐标系让读者一眼看到「我们少做了什么 / 多做了什么」。
用同一个偏好数据作起点,左边走 RLHF(preference data → RM → 强化学习 → policy),右边走 DPO(preference data → 直接最大似然 → final LM)。
左半画 vanilla RAG 的两步「检索 K 段 → prompt LLM 生成」,右半画 Self-RAG 的三步「按需检索 → 并行生成 → critique 选最优」。
横向四个 variant(Standard / CoT / Act-only / ReAct)跑同一个 HotpotQA 题,纵向两个任务(HotpotQA / AlfWorld)跑同一套方法,四块网格直接拼成 4×2 的事实证据。
三个图元从同一「16-bit Transformer」基座出发,依次减少 optimizer state、冻结 base model、把 base model 量化到 4-bit,左→右就是论文贡献的累加。
两组处理流(视觉 vs 文本 / 源域 vs 目标域)从两端对称出发,最后汇聚到一个矩阵 / 一个共享空间。
上:文本「Pepper the aussie pup」→ Text Encoder → 文本向量序列。下:图片堆栈 → Image Encoder → 图向量序列。中间 N×N 矩阵的对角线高亮 = 匹配对。
源模态 vs 目标模态两块同色框(浅灰),三种方法沿一条横轴并排:(a) task-specific 新建模型;(b) 模型微调;(c) 模型重编程,重编程那栏最复杂,所以占最大篇幅。
表达「一个完整的算子被拆成两到三个简单子结构」。常用于参数高效微调、视觉预训练、自回归解码。
左侧大蓝块(frozen pretrained W ∈ ℝd×d),右侧两片橙色梯形(B = 0、A = 𝒩(0,σ²)),中间夹 rank r,三件套画完,全文就讲完了。
5 步串行:input(多数 patch 被灰块盖住)→ 可见 patch → encoder → latent tokens → decoder → target(原图)。中间两段用细窄「带状」画,形象表达「只过少量 token」。
把 LLM 当作诊断、解释、问答接口,嫁接到传统工业检测管线。多模块、多数据源、跨模态融合。
三层叠合:上层 frozen image decoder(异常定位)、中层 frozen image encoder + prompt learner、下层 frozen LLM(人机问答)。底部 legend 把「frozen / trained / 矩阵乘 / cosine / element-wise」五种操作就地解释。
金字塔顶层「LoRA / QLoRA 微调」,中层「三种加工路径(feature-based / data-based / embedding + patching)」,底座「原始振动信号」。三层之间用斜体灰色描述连系「数据从粗到细」。
A–E 每组左侧已经放了该构型的「怎么画」配方卡;本区收通用内容:工具教程、绘图纪律与可查证出处。前面 14 张顶会图 90% 出自 draw.io / PowerPoint / matplotlib 三件套,工具不重要,叙事才重要。想看完整方法论、投稿自查清单与 10 张可复制 matplotlib 模板,去 /figures/#howto。
从叙事到导出,所有 pipeline / 架构图都跑得过下面这张表。
| 步骤 | 干什么 | 检验标准 |
|---|---|---|
| 1. 写主线 | 用一句话说清「X 用几步得到 Y」 | 同门 10 秒能复述出来 |
| 2. 列模块 | 拆成 3–6 个模块,标 frozen/trainable + 数字 | 每个模块在框里能一行装下 |
| 3. 套模板 | 从本页 A–E 选一个构图 | 一眼看不出「这是哪种模板」就对了 |
| 4. 上色 | 固定 3–4 色,每个颜色 = 一种角色 | 跨模块、跨子图颜色守恒 |
| 5. 导出 | 矢量 PDF/SVG,字号 7–9pt | 缩到 50% 仍能读 |
| 场景 | 工具 | 上手 | 产出 |
|---|---|---|---|
| 想清楚结构 | 纸笔 / Excalidraw | 5 min | 草图 |
| 正式框图(顶会级) | draw.io | 30 min | SVG |
| 论文里直接拼素材 | PowerPoint | 30 min | PDF(矢量) |
| 代码化、批量、可复现 | matplotlib | 1 h | |
| LaTeX 原生、期刊要求 | TikZ | 2 h+ |
复制下面这段就能跑出上图。任何 pipeline 图都是这个骨架的扩展:改 box 数量 / 改文字 / 改颜色。
# 13 行画一张三框两箭头 pipeline(双栏宽 7.16 inch) import matplotlib.pyplot as plt from matplotlib.patches import FancyBboxPatch fig, ax = plt.subplots(figsize=(7.16, 1.6)) ax.set_xlim(0, 10); ax.set_ylim(0, 3); ax.axis("off") def box(x, text, fc="#e9f3fa", ec="#0072B2"): ax.add_patch(FancyBboxPatch((x, 1.1), 2.0, 0.9, boxstyle="round,pad=0.08", fc=fc, ec=ec, lw=1.4)) ax.text(x + 1.0, 1.55, text, ha="center", va="center", fontsize=11) def arrow(x0, x1): ax.annotate("", xy=(x1, 1.55), xytext=(x0, 1.55), arrowprops=dict(arrowstyle="->", color="#8b949e", lw=1.4)) for i, t in enumerate(["Raw Data", "Your Model", "Output"]): box(0.5 + i * 3.2, t) if i < 2: arrow(2.6 + i * 3.2, 3.6 + i * 3.2) fig.savefig("pipeline.pdf", bbox_inches="tight") # 矢量
.py 文件就能跑出这张图。需要更多模块、改颜色、改大小?都是改 box() 调用行的事。完整可运行的 10 个模板(横向 pipeline、Transformer 堆叠、训练曲线、雷达图、热力图、箱线图、小倍数图、帕累托前沿等,每个模板都写了物理尺寸和导出设置): /figures/#fig-method
draw.io 是顶会作者最常推荐的工具,免费、矢量、所见即所得。本节用 InstructGPT 风格的「三幕」做演练。
app.diagrams.net → Device → Blank Diagram;左侧 Shapes 选 General → 拖入三个 Rectangle。rounded 设为 1,fontSize 设 14。#e9f3fa 浅蓝,描边 #0072B2;选中按 Ctrl+D 复制两份。Align Middle + Distribute Horizontally。#8b949e。dashPattern 为 8 4。#f6f8fa、虚线 dashPattern 8 4 → 右键 Send to Back 把矩形放最底层,作为「幕」背景。File → Export as → SVG,勾选 Embed fonts 和 Include a copy of diagram。投稿时再导出 PDF 一份作为兜底。很多人论文里的「原图」其实是 PPT 拼出来的,尤其是融合多个 PDF 截图的图。下面是 PPT 画 pipeline 不会出错的几件事。
Align Middle + Distribute Horizontally(等距神器)。Right Arrow。不要用带渐变 / 阴影的「SmartArt」,印刷不友好。同样的 Align 步骤对齐到中线。下面这些坑一旦出现,几乎等同于「我看不懂你在画什么」。投稿前自查一遍。
| 常见反例 | 为什么坏 | 改正 |
|---|---|---|
| 彩虹色 / 高饱和渐变 | 读者无法把颜色和角色绑定 | 固定 3–4 色,每个颜色只代表一种角色 |
| 3D 效果 / 阴影 / 玻璃感 | 印刷不友好,IEEE/ACM 直接拒 | 全平面,纯色块 |
| 图标题写在图内 | 图标题是 caption 的事 | 图内只留图例、关键标签 |
| 字号 < 7 pt 或 > 12 pt | 缩到双栏宽度后不可读 / 喧宾夺主 | 图内字号 7–9 pt 与正文一致 |
| 箭头全用同一种 | 读者分不清数据流 / 参数更新 / 反馈环 | 实线 / 虚线 / 双向 = 不同语义 |
| 同一组用不同色 | 读者误以为左右两栏是不同模型 | 颜色守恒:角色 = 颜色 |
把上面 14 张图的套路沉淀成可对表的清单。每条都标了出处,方便投稿前自查时回到原始来源核对。
pdf.fonttype=42。纪律要可信,得有出处。下面 4 份是顶会级、被引最广的可公开验证资料,付费墙后的「内训资料」永远不应该取代它们。
经验方法都是公开的、可追溯的;缺一不可复制,缺三不可信任。