Krea 2:Krea AI 公开 Raw 与 Turbo 两组图像生成权重
Krea AI 公开 Krea 2 Raw 和 Krea 2 Turbo 两组开放权重。官方技术报告将其描述为从零训练的 12B 参数文生图扩散模型,并披露数据过滤、caption 管线、后训练、强化学习和安全许可边界。

技术解析 / Krea AI
文生图与图像实时编辑领域在经历 Stable Diffusion、SDXL、SD3、Flux.1 等路线之后,需求正在分成两类:一类关注单张图像的质量上限、复杂提示词理解和大模型能力;另一类关注快速反馈、风格探索、产品概念验证和创作工作流接入。此前,很多快速创作能力长期留在闭源产品或云端 API 里,开源社区很难同时拿到足够强的审美能力、可检查的权重边界和可继续训练的基础模型。
Krea 2 开放权重模型值得关注的不只是“又多了一个图像模型”。Krea AI 在 2026 年 6 月公开 Krea 2,并发布 Raw 与 Turbo 两组权重:Raw 是未蒸馏基础 checkpoint,面向微调、后训练和 LoRA 训练;Turbo 是 8-step 蒸馏 checkpoint,面向快速、高质量文生图推理。官方技术报告则把 Krea 2 描述为从零训练的 12B 文生图扩散模型,架构包括 Qwen Image VAE、12B dense DiT backbone 和 Qwen3-VL text encoder。
Krea 2 把基础模型、快速推理模型、LoRA 训练路径、技术报告、推理代码和许可边界放进同一套公开材料。它与只交付成图的重型黑盒、只提供加速补丁的方案都有区别。理解这套模型家族,需要同时看工程拆分、流匹配路线、3D Axial RoPE、prompt expander、数据过滤和强化学习;单张榜单或样图覆盖不了这些信息。
1. 开放权重之后:实时创作反馈的工程口径
传统文生图通常是“输入提示词、等待生成、拿到一张静态图片”。这种管线适合一次性出图,却不适合设计、插画、室内方案、广告视觉和产品概念等反复试探的工作流。创作者往往要在短时间内比较多个风格方向,调整语言、参考图、构图和材质,再沿选中的方案继续细化。
过去社区为了实现更快的反馈,常见做法是给 SDXL 或 SD 1.5 接上 LCM、Lightning、Hyper-SD 等蒸馏或加速路线,把几十步采样压缩到少数几步。这个方向确实改变了交互速度,但如果底层模型、蒸馏目标和后训练没有一起设计,画面常常会在高频纹理、边缘关系、材质层次和复杂结构上付出代价。速度有了,图像却容易出现“塑料感”、细节断层或构图漂移。
Krea 2 的技术路线更接近“从模型家族内部解决速度与可编辑性”。官方将它拆成 Raw 与 Turbo 两个 checkpoint:Raw 保留基础模型的多样性和可塑性,适合 LoRA 训练、后训练和研究;Turbo 则是面向快速推理的 8-step 蒸馏版本,用于日常文生图与创意迭代。这种拆法把训练底座和出图入口分清楚了,也让开源社区第一次能在同一套模型材料里同时看到“可训练”和“可快速使用”两条路径。
Krea 2 的变化在于:开放权重不再只是给研究者下载一个 checkpoint,也不只是把闭源 API 的结果截图搬出来展示。它把产品级审美、模型权重、推理代码、技术报告、LoRA 路线和许可责任放在同一张桌面上。对于创作者来说,它更像一块可反复塑形的视觉草稿板;对于开发者来说,它是一个可以检查、扩展和接入工作流的图像生成底座。
2. 图像生成技术演进史:从局部图像块到全局时空流
早期 Stable Diffusion 1.5 与 SDXL 代表的是 UNet 扩散模型时代。它们用卷积主干和交叉注意力把文本条件注入图像生成,生态成熟、插件丰富,但对长提示词、复杂空间关系和高分辨率细节的处理存在天然压力。随后 SD3、Flux.1 等模型把 Diffusion Transformer 推到前台,让文本和图像 token 在更统一的注意力空间里交互,提示词理解和全局结构能力明显增强。
代价也很清楚:重型 DiT 通常更吃算力,生成链路更长,工程集成与交互成本更高。为了让模型更快,社区长期依赖 Turbo、Lightning、LCM、Hyper-SD 等蒸馏路线,把几十步采样压缩到少数几步。但低步数蒸馏如果只被当作外挂补丁,容易牺牲纹理、边缘、材质和复杂结构。
Krea 2 属于以开放权重发布的现代 DiT 系统。官方开源页披露它使用 Qwen Image VAE、12B dense DiT backbone 和 Qwen3-VL text encoder;技术报告补充了 rectified-flow loss、v-parameterization、multi-layer feature aggregation、3D Axial RoPE、数据过滤、caption 管线、后训练和强化学习。训练链路最终形成 Raw 与 Turbo 两种用途,整个家族并不依赖一条单一小模型路线。
| 演进阶段 | 代表路线 | 核心进展 | 交互创作里的技术压力 |
|---|---|---|---|
| 传统 UNet 时代 (2022-2023) |
Stable Diffusion 1.5 / SDXL | 用 2D 下采样卷积网络结合交叉注意力,把文本条件注入潜空间扩散。 | 长提示词、复杂空间关系和高分辨率细节容易失控。 |
| 重核 DiT 时代 (2024-2025) |
SD3 / Flux.1 | 引入 Diffusion Transformer,让文本与图像 token 在统一注意力空间里交互。 | 模型更重,生成链路更长,难以天然服务高频迭代。 |
| 外挂蒸馏时代 (2025 前后) |
SDXL Turbo / LCM / Lightning / Hyper-SD | 通过一致性蒸馏、对抗蒸馏或少步数采样,把生成压缩到更短链路。 | 速度提升明显,但纹理、材质和复杂结构可能被压缩。 |
| 开放权重 DiT 家族 (2026) |
Krea 2 Raw / Krea 2 Turbo | 12B dense DiT、rectified-flow、3D Axial RoPE、Raw/Turbo 双 checkpoint。 | 重点从“单次大图”转向训练、推理、风格和工作流的协同取舍。 |
3. 架构拆解:Krea 2 的三层递进式设计
官方开源页给出的架构口径很直接:Krea 2 Open-Source 使用 Qwen Image VAE、12B dense DiT backbone 和 Qwen3-VL text encoder,并通过 multi-layer feature aggregation 提取文本编码器多层特征。它包含负责图像压缩与还原的视觉底座、负责全局生成的 DiT 主干,以及处理自然语言条件的多模态文本编码器,因而属于完整的文生图基础模型家族,不是轻量演示模型。
第一层是图像表示。VAE 决定模型如何把图像压缩到潜空间,再从潜空间还原为图像。Krea 2 采用 Qwen Image VAE,意味着它把图像生成的底层像素压缩与还原交给一个已经面向高质量图像生成优化过的自编码器。第二层是 12B dense DiT backbone,它承担从噪声到图像潜变量的主生成过程。第三层是 Qwen3-VL text encoder,它把自然语言提示转换成更适合图像生成主干使用的语义条件。
技术报告里有一个关键细节是 3D Axial RoPE。普通 RoPE 已经能表达相对位置关系,而 3D Axial RoPE 进一步把时间/步进、图像高度、图像宽度等维度拆开建模,让模型在处理二维图像 token 与采样轨迹时拥有更清晰的位置结构。对文生图来说,这会影响构图、物体关系、局部细节和高分辨率一致性。
Krea 把这套系统定位在创意探索:训练目标覆盖更宽的风格、情绪、材质和构图空间,没有只优化一个固定审美默认值。Prompt expander 与 LoRA 风格扩展延续同一思路;文字不够精确时,可以用更丰富的文本条件或可训练风格进入目标视觉区域。
4. 修正流匹配:少步数推理背后的数学取舍
Krea 2 技术报告写明最终模型使用 rectified-flow loss 和 v-parameterization。Rectified Flow 的直觉是把噪声分布到数据分布之间的传输路径尽量拉直,让模型学习一个速度场,而不是在推理时沿着高度弯曲的去噪轨迹小步摸索。轨迹越直,少步数采样越有机会保持稳定。
用最简化的插值形式表示,可以把噪声样本与目标样本之间的中间状态写成:
Turbo 的 8 步推理来自专门的蒸馏训练,不能只按“步数更少”理解。官方开源页和仓库把 Turbo 定义为 8-step distilled checkpoint,把 Raw 定义为面向研究、后训练和 LoRA 的未蒸馏基础 checkpoint。基础权重与蒸馏权重分别发布,训练和日常出图由此采用不同路径。
这也是 Krea 2 与很多外挂加速路线不同的地方:rectified-flow 训练、后训练、蒸馏和 Turbo checkpoint 被放在同一个公开模型家族里。Raw 负责保留模型地基,Turbo 负责把创作链路缩短。对用户来说,感知到的是更快的视觉反馈;对开发者来说,更重要的是模型边界被写清楚了。
5. 数据、Caption 与 RL:审美不是只靠模型结构堆出来
Krea 2 技术报告把相当多篇幅放在数据与后训练上。报告称其预训练数据不使用 AI 生成图像,并使用内部分类器过滤噪声、过度编辑、logo、水印、NSFW、meme、截图等内容;caption 管线结合 OCR、元数据和多模态理解,为图像生成更完整的文字描述。训练中还混入短用户式提示词,让模型同时接触长 caption 和真实创作 prompt。
这解释了 Krea 2 为什么不是只靠 12B 参数量讲故事。对文生图模型来说,数据过滤决定输入世界有多干净,caption 决定文字与图像之间能否建立可学习的对应关系,后训练决定模型是否更贴近用户通常会输入的提示词。一个模型如果数据噪声很重,即使主干强,也会在构图、审美、文字渲染和细节一致性上付出代价。
技术报告还描述了 midtraining、监督微调、偏好优化和强化学习流程。强化学习阶段使用多奖励方法,奖励模型关注综合审美、提示词跟随、文字渲染、结构和瑕疵;报告还提到 artifact reward model,用来抑制多指、肢体畸形、文字扭曲等结构性错误。这部分比“快不快”更能解释 Krea 2 的产品感:它在训练后段持续把模型往创作者偏好的输出分布上推。
| 技术环节 | 作用 | 对生成质量的影响 |
|---|---|---|
| Data filtering | 过滤噪声、低质量、重复、无关和高风险内容。 | 减少训练分布里的坏模式,让模型更少学到边框伪影、低质纹理和无效图文对应。 |
| Caption pipeline | 结合 OCR、元数据和多模态理解生成更完整描述。 | 让图像细节和文字条件之间的监督更密,帮助模型理解物体、材质、文字与场景关系。 |
| Prompt expander | 把短用户提示扩成更接近训练分布的详细描述。 | 缩短“用户随手输入”和“训练 caption 分布”之间的距离,让创意意图更容易被模型接住。 |
| Preference optimization / RL | 通过偏好数据和奖励模型校准审美、结构、文字和瑕疵。 | 把模型从基础可用推向更接近创作者偏好的输出分布,尤其影响整体审美和结构稳定性。 |
6. Raw 与 Turbo:同一模型家族的两条工程路径
Krea 2 最容易被误读的地方,是把 Raw 和 Turbo 当成同一个东西。官方 GitHub README 和开源页都把边界写得很清楚:Raw 是 base model,没有蒸馏,适合微调、后训练和 LoRA;Turbo 是 8-step distilled checkpoint,面向快速、高质量文生图。这个边界必须在新闻里写明,否则用户会拿错模型。
对研究者来说,Raw 的价值在于可塑性。它保留了更多训练空间,可以作为继续训练和 LoRA 训练的基础。Krea 官方也发布了多组 LoRA,并在 Hugging Face 页面中说明这些 LoRA 训练于 Raw、用于 Turbo。对普通创作和应用集成来说,Turbo 的价值在于直接推理路径清晰,官方示例也把它作为快速生成入口。
这套组合比“一个通用模型覆盖所有任务”更实际。Raw 负责保留地基,Turbo 负责把创作链路变短。它让下游生态可以在同一模型家族里完成训练、风格扩展和快速出图,而不是在研究 checkpoint、产品模型和社区 LoRA 之间来回断裂。
| Checkpoint | 官方定位 | 适合任务 | 主要边界 |
|---|---|---|---|
| Krea 2 Raw | 未蒸馏基础 checkpoint | 微调、后训练、LoRA 训练、研究实验 | 保留训练空间,日常快速出图以 Turbo 为主。 |
| Krea 2 Turbo | 8-step 蒸馏 checkpoint | 快速文生图、创意迭代、应用集成 | 面向推理入口,不承担 Raw 的训练底座角色。 |
7. 公开排行与模型横向位置
Krea 官方材料提到 Artificial Analysis 排名,GitHub README 也写到 Krea 2 是独立实验室中排名很高的文生图模型。这说明它在通用文生图偏好评测里也具备竞争力。横向比较还需要同时观察画质、提示词跟随、出图速度、开放权重、可训练性和工作流接入。
如果目标是一次性生成海报级视觉、并且可以接受更重的推理链路,Flux.1、SD3 这类重型路线仍然是重要参照;如果目标是快速探索风格、产品概念、情绪板和广告视觉方向,Krea 2 Turbo 的 8-step 路线更贴近“先大量试,再挑方向”的创作节奏;如果目标是训练垂直风格或做 LoRA,Krea 2 Raw 则承担更底层的可塑性角色。
| 模型 / 路线 | 公开定位 | 强项 | 工程取舍 |
|---|---|---|---|
| Krea 2 Turbo | 8-step 蒸馏开放权重 checkpoint | 快速文生图、风格探索、产品概念与视觉方向迭代。 | 适合推理与创作反馈,不是继续训练的基础 checkpoint。 |
| Krea 2 Raw | 未蒸馏基础开放权重 checkpoint | LoRA 训练、后训练、研究实验和风格扩展。 | 保留可塑性,不是日常最快出图入口。 |
| Flux.1 / SD3 类重型 DiT | 通用高画质文生图路线 | 复杂提示词、全局结构、单张终稿质量上限。 | 模型更重,创作反馈链路通常更长。 |
| SDXL Turbo / LCM / Lightning | 少步数加速与蒸馏生态 | 成熟生态、接入灵活、速度改善明显。 | 复杂材质、细节纹理和结构稳定性取决于底模与蒸馏质量。 |
这张对照按任务口径读:Krea 2 偏向审美探索、开放权重、Raw/Turbo 双路径和快速创作反馈;重型模型偏向单次高质量生成与通用上限;传统加速路线拥有更成熟的生态。选型时要明确工作流需要终稿质量、训练可塑性,还是快速试方向。
8. 生态解耦:开放权重带来的不是“无限制使用”
Krea 2 开放权重对下游生态的意义在于工程解耦。开发者可以围绕官方权重、推理代码和模型卡建立自己的实验链路;研究者可以从 Raw 出发做 LoRA、后训练或风格适配;创作者可以用 Turbo 快速检验视觉方向。模型从一个闭源产品能力,变成了可被下载、阅读、引用和实验的模型家族。
开放权重也带来了更明确的责任分工。Hugging Face 模型卡列出训练数据来源、安全措施、风险、许可和使用方责任;GitHub 仓库给出推理入口;技术报告解释训练与后训练路线。Krea 2 更偏向审美生成、风格探索和快速视觉方向验证;遇到严格文本排版、包装文案、品牌标识、连续角色或企业级内容安全时,仍需要配合专门的评测、过滤和人工审核流程。
Krea 2 把开放权重模型带回审美、风格探索与快速创作的工作流。它有较完整的公开证据,Raw / Turbo 分工清楚,也适合继续扩展;没有证据支持把它写成所有图像任务的通用答案。
结语:把开放权重放回具体工作流
评价 AI 图像模型时,可以沿语义、空间、审美、采样步数和开放边界逐项检查;参数规模本身不能替代这些取舍。
Krea 2 的意义在于,它把现代文生图模型的关键材料公开到同一条证据链上:官方发布页展示视觉目标,开源页说明 Raw 与 Turbo,技术报告解释训练与后训练,GitHub 仓库提供推理入口,Hugging Face 模型卡列出权重、数据、风险和许可。它让创作者和开发者面对的不再只是黑盒输出,而是一个可以被阅读、验证和继续构建的开放权重模型家族。