Boogu-Image 0.1:Base、Turbo、Edit 的推理差异与失真风险
从潜空间流匹配、少步蒸馏和编辑保持约束拆解三份开放权重,并比较 Base、Turbo 与 Edit 各自的失真风险。

模型解剖 / 图像生成与编辑
Boogu-Image 0.1 同时发布基础生成、蒸馏加速和单图编辑权重。三个 checkpoint 共用项目名,却有不同的采样步数和输入要求:Base 看多步质量,Turbo 看四步速度与伪影,Edit 看指令执行和非编辑区域保持。
从扩散模型到流匹配、从长轨迹到少步蒸馏、从纯文本生成到图像条件编辑,三次技术变化分别落在 Base、Turbo 与 Edit 上。它们拥有不同的训练目标、采样行为和微调空间,不能当作同一模型的三个速度档。

1. 从逐步去噪到连续速度场:图像生成轨迹如何变化
DDPM 将生成写成多次逆扩散:网络在一系列噪声水平上预测噪声或干净样本,采样器逐步还原图像。Latent Diffusion 把过程移到 VAE 潜空间,显著降低高分辨率计算;DiT 又以 Transformer 替代卷积 U-Net,让文本与图像 token 的长距离交互更直接。画面质量提升的同时,几十步采样成为交互速度的主要成本。
流匹配改用连续向量场描述从简单分布到图像分布的运动,训练目标围绕中间状态的速度展开。它为不同 ODE 求解器和时间表提供统一视角,也让轨迹蒸馏更自然:教师走过的长路径可以被学生近似为少数几个大步。Boogu-Image 的 Base 与 Turbo 正处在这两层关系中,后者改变了采样轨迹,而非从前者机械删去若干时间点。

2. 编辑权重的训练史:从 img2img 强度到语义保持
早期 img2img 常把输入图加噪后重新去噪,编辑幅度主要由噪声强度决定。方法简单,却难以表达“只改外套颜色、保留人物和背景”这种局部语义。指令编辑数据随后把原图、文字指令与目标图组成训练三元组,模型开始显式学习改变区域和保持区域之间的张力。
Edit checkpoint 因此需要与 Base 不同的数据和目标。身份、材质、镜头与背景保持来自图像条件,目标变化来自文本,两者在共享潜空间竞争。社区 LoRA、量化文件或合并权重可能继续改变这种平衡;只有版本名、训练者、基础权重和推理配置都明确时,编辑样例才有可追溯性。
3. 采样实验:步数、guidance 与版本选择如何影响成图
Base 权重通常允许较完整的时间表和 guidance 控制。步数增加给模型更多机会修正对象数量、手部和细小文字,也会出现收益递减;求解器、时间点分布与 CFG 会改变每一步的实际方向。同为二十步,不同 sampler 的轨迹并不相同。
Turbo 已针对短时间表蒸馏。它学习的是教师分布的一条近似捷径,常与特定 guidance 设置绑定。把 Base 的高 CFG 或长时间表直接套给 Turbo,可能造成过饱和、硬边和构图重复;反过来用 Turbo 参数运行 Base,也会让长轨迹来不及收敛。
Edit 还需要固定输入裁切、参考图尺寸和编辑条件。主体在画布中太小,身份编码不足;遮罩边缘过硬,光照和纹理在接缝处断开。比较编辑结果时,指令执行、主体保持和背景稳定是三项独立观察,单张“看起来更漂亮”的样例无法说明误差来源。
版本复现应记录 checkpoint、采样器、时间表、guidance、seed 与画布。seed 只在同一配置内定义初始噪声;更换精度、算子或图像尺寸后,同一数字未必产生逐像素对应。完整参数表比“Turbo 四步”更接近可复现实验。
4. 流匹配轨迹在 Base 与 Turbo 之间怎样缩短
扩散与流模型的基础权重学习的是一条从噪声分布通向图像分布的连续速度场。给定中间状态 x_t、文本条件 c 与时间 t,网络近似 v_θ(x_t,t,c),采样器再沿这条场积分。Base 版本保留较完整的积分轨迹,适合继续训练,也给复杂构图留下较多修正机会;代价是采样步数、计算量和随机轨迹都更长。
Turbo 的由来是轨迹蒸馏。教师模型用较多步数走过的路径,被学生压缩到少数几个大步。速度提升很直接,损失也有明确方向:大步积分更难在后段修正人物肢体、小字和规则纹理,随机种子之间的差异也可能被蒸馏分布压窄。它应被视为另一条生成轨迹,不能只在同一张表里写成“更快的 Base”。
编辑模型要同时解两道互相拉扯的题
编辑权重多了一幅输入图像。训练样本既要告诉模型指令改变了什么,也要约束没有被指令点名的区域继续保持。若编辑条件过强,背景、光线和人物身份会一起漂移;若保持约束过强,模型只做轻微润色,语义指令落不到像素。局部编辑的困难就来自这两股梯度长期竞争。
同一条指令在不同裁切上会产生不同答案。主体占画布很小时,模型获得的身份线索不足;遮罩边缘过硬时,纹理与照明在接缝处断开;把多张参考图简单拼进一张画布,还会改变模型理解的空间关系。Edit 权重提供的是图像条件接口,具体支持几张参考图、是否接受遮罩、如何编码身份,仍由模型配置与训练方式决定。
短步数生成的误差通常藏在局部周期里
海报边框、窗格、织物、栏杆和连续文字都有重复结构。模型只要在一次大步中把局部周期估错,后面的少数步骤就很难把每个单元重新排齐,于是出现重复物、断裂线条和相邻字形粘连。人像样例看起来锐利,并不能说明模型已经解决了这种高频结构误差。
更有解释力的对照会固定提示、画布、种子和采样器,只改变权重与步数,再观察全局布局、对象数量、文字序列和纹理周期分别在哪一步稳定下来。这样才能分清差异来自基础模型、蒸馏过程,还是采样配置,而不是把一次偶然好图写成版本能力。
开源生成模型的版本名还包含训练权利边界
Base、Turbo 和 Edit 虽然共享项目名,模型卡中的许可证、推荐用途与衍生权重条款仍可能分别约束再训练、商用和再分发。代码仓库证明实现公开,权重页面证明文件可取得,论文或技术报告解释训练方法;三者共同构成一个可复现发布,任何一项都不能替代另外两项。
因此,介绍这类项目时应保留具体 checkpoint 名称与发布日期。后续社区 LoRA、量化文件或合并权重可以扩展使用范围,却不自动继承原作者对质量的背书。版本史写清楚,读者才能判断看到的是基础研究产物、官方蒸馏版本,还是第三方继续训练后的分支。
流匹配中的采样器决定如何走过速度场
训练得到 v_θ 后,还需要数值求解器把 dx/dt=v_θ(x,t,c) 积分成图像。Euler 法用当前斜率走一步,二阶方法会额外估计中间或下一点,误差与网络调用次数不同。四步 Turbo 常针对特定时间表和求解方式蒸馏,随意更换 sampler 不一定带来提升。
guidance 改变条件方向的强度。文本引导过低,画面可能自然却漏掉对象;过高则容易出现饱和、硬边和构图拥挤。蒸馏模型若已把 guidance 行为吸收进训练,再套用基础模型的高 CFG,会偏离它学习的短轨迹。配置必须跟着具体权重阅读。
随机种子定义初始噪声,但模型版本、精度、算子和画布尺寸变化后,同一 seed 未必保持逐像素对应。可复现实验应记录完整生成参数,并把种子理解为该配置下的对照条件。只在页面上展示一个 seed 数字,无法保证跨版本重现。
Base 适合研究长轨迹、继续训练和结构控制,Turbo 面向低步数生成,Edit 还要处理输入图像条件。三个版本共享品牌与部分骨干,实验设计却应分别建立基线;这比把它们排成速度、质量、编辑三个标签更接近真实模型谱系。
5. Base 与 Turbo 共享目标,却不共享采样轨迹
L_FM=E[t,x₀,x₁] ||vθ(x_t,t,c)−u_t(x_t|x₀,x₁)||²vθ模型预测的速度场u_t训练目标轨迹c文本或图像条件
流匹配训练让网络逼近从噪声到图像潜变量的速度场。Base 沿较长轨迹积分,Turbo 学习少步近似;同一提示词下的四步结果不能用 Base 的步数经验直接解释。
Edit 还多了输入图像条件。对 Edit 的检查要把指令执行、主体保持和非编辑区域漂移分开,不能用生成样例的锐度替代。
论文、代码与权重可沿 Boogu-Image source / Boogu Base weights / Boogu Turbo weights 查阅。
6. Base、Turbo 与 Edit 的差异
Base、Turbo 与 Edit 来自同一项目的不同训练阶段,采样步数和输入条件随版本改变。
| 版本 | 默认推理 | 结构与取舍 |
|---|---|---|
| Base | 多步 flow matching | 细节、构图与长轨迹稳定性 |
| Turbo | 约 4 步 | 蒸馏伪影、文字与小物体 |
| Edit | 单图 + 指令 | 指令执行和背景保持 |
7. 同日发布三个 checkpoint,不等于共享一套复现条件
Boogu-Image 0.1 的项目仓库把 Base、Turbo 和 Edit 放在同一家族下,模型卡却分别保存权重、配置与使用说明。Base 维持较完整的生成轨迹,适合观察模型本身的容量与继续训练空间;Turbo 把教师轨迹压缩到少步采样;Edit 还要接收原图并学习指令与保持之间的分工。版本名相邻,输入张量和推荐推理参数并不相同。
少步蒸馏最容易在公开演示里显得“同质量、更快”,但局部重复纹理、细小文字、手部结构和复杂遮挡往往比主体轮廓更早暴露误差。复现实验应固定提示词、种子、分辨率和负面提示,分别采用 Base 与 Turbo 的推荐步数;把两者强行设成相同步数,只是在比较谁更不适合那套设置。
Edit 的实验还要增加区域保持检查。一次编辑可能正确改变衣服颜色,却同时漂移人物身份、背景招牌或镜头位置。只展示编辑后的单张图无法分辨变化来自指令、随机采样还是原图重建误差;至少应并排保留原图、目标指令、输出和差异区域,并在人物、文字、边缘与未编辑区域上分别记录。
开放仓库提供了继续微调的入口,权重许可和训练数据许可仍需分开阅读。项目对数据效率的表述属于其报告口径,不等于任意下游小数据集都能复现同样收益。把 checkpoint 名、提交版本、调度器、步数、guidance、分辨率与输入图预处理一并保存,才足以说明一张图来自哪条 Boogu 路线。
结语:三个版本对应三种生成问题
Base 保留较完整的生成轨迹与继续训练空间,Turbo 用蒸馏换取少步交互,Edit 增加原图条件并承担区域保持。它们共享项目谱系,却不共享同一采样设置和失真分布。
因此,版本比较应固定提示、画布和种子,再分别观察构图、文字、周期纹理和未编辑区域。将三份权重放回各自训练阶段,能比“质量版、快速版、编辑版”的标签提供更多技术信息。
Base 的长轨迹容纳更多细节,也可能在局部纹理中重复;Turbo 的短轨迹更容易形成发硬轮廓、过熟纹理和破碎小字。Edit 的误差则沿指令、主体身份与未编辑区域三个方向展开。
比较三份权重时,提示词、尺寸和随机种子应保持一致。单张发布样例可以展示模型能力,却无法代表海报、人物、商品、密集文字和复杂构图的完整分布。
项目自带提示集适合复现发布方结果,却不能代表海报、人物、商品和中文排版的全部分布。正式比较需要固定提示集和盲评。
Base、Turbo 与 Edit 的采样配置不能混写。步数变化会同时改变耗时与轨迹误差,编辑权重还要额外报告输入图、指令和未编辑区域的保持情况。