训练一个顶级的文生图模型,到底需要烧多少算力?

Z-Image的答案是314K H800 GPU小时。而SeFi-Image团队给出的答案是:125K A800 GPU小时——约为前者的10%到20%

用五分之一的算力,训出了一个在多项基准测试中持平甚至超越Qwen-Image和Z-Image的5B模型。SeFi-Image凭什么?

一、语义优先扩散:把“想清楚”和“画仔细”拆成两件事

传统扩散模型有一个结构性困境:语义和纹理耦合在同一个潜空间里同步去噪。模型一边要思考“画面里应该有什么”,一边要处理“皮肤纹理怎么画”,两者互相干扰,手指数不对、文字写不清楚是家常便饭。

20260716162956356.jpg

SeFi-Image的核心创新是语义优先扩散(Semantic-First Diffusion) ——把生成拆成两条独立的流:

  • 语义流:负责理解文本、定义布局、确定“画面里有什么”
  • 纹理流:负责填充细节、渲染材质、处理像素级精度

两条流不是同步走的。语义流提前一个时间步开始去噪,先确定好整体结构和空间关系,再让纹理流跟着结构锚点去填充细节。通俗说就是:先想清楚要画什么,再动笔画

这个设计天然解决了传统模型“边想边画”导致的结构崩溃问题——手指不会多一根,路牌上的字不会糊成一团。

二、用1/5的算力,交出了什么成绩?

SeFi-Image提供1B、2B、5B三种参数规模,其中5B模型是旗舰版本。

训练成本:5B模型仅用125K A800 GPU小时完成训练。作为对比,Z-Image用了314K H800 GPU小时。考虑到H800与A800的硬件代差,实际算力差距更大——SeFi团队自己估算约为10%-20%

20260716174826986.png

基准测试

基准

SeFi-Image-5B

说明

GenEval

0.88(第一)

指令遵循综合评估

LongTextBench

0.978

长文本渲染,显著领先竞品

CVTG-2K

0.895

字符级视觉文本生成准确率

OneIG-EN

第一

图像生成指令对齐

在长文本渲染和视觉文本生成这两个维度上,SeFi-Image的优势尤其突出——生成海报、标签、带有文字说明的场景图时,文字可读性远高于同类模型。

三、模型家族:Base、RL、Turbo三种口味

除了1B/2B/5B三种参数规模,每个规模还提供三种变体:

  • Base:标准版本,50步采样,guidance scale 4.0
  • RL:5B专属,引入强化学习微调,进一步提升指令遵循能力
  • Turbo:蒸馏加速版,仅需4步采样,guidance scale 1.0,适合低延迟场景

Turbo版的价值在于:把50步压缩到4步,生成速度提升超过10倍,同时保持可用的图像质量。对于需要快速迭代的应用场景,这是一个相当实用的选项。

在ComfyUI中已有社区开发者提供了定制节点支持,可以直接在图形界面上调用SeFi-Image的全部模型变体。

四、实际体验:结构稳了,细节跟上了

根据社区早期测试反馈,SeFi-Image最突出的体验是结构稳定性

传统扩散模型生成复杂场景时常见的“手指数不对”“人物肢体扭曲”“画面元素逻辑混乱”等问题,在SeFi-Image上得到了显著改善。语义优先的设计让模型在生成早期就锁定了正确的空间布局,后续纹理生成只是在这个框架内填充细节,不会跑偏。

长文本渲染是另一个亮点。输入包含大量文字描述的提示词时,SeFi-Image能相对准确地还原文字内容,而不是像很多模型那样把文字处理成“看起来像字但读不出来”的纹理。

当然,作为5B参数量的模型,它与10B+级别的超大模型在细节丰富度和风格多样性上仍有差距。但考虑到五分之一的训练成本,这个权衡是相当划算的。

20260716174712227.png

五、值不值得用?看场景

SeFi-Image的价值主张很清晰:用更少的算力,拿到接近SOTA的效果。

  • 如果你是研究者或开发者:开源权重+完整代码,125K GPU小时训出的5B模型作为研究基底,性价比极高。1B和2B版本还可以在更有限的硬件上运行。
  • 如果你是ComfyUI用户:已有社区节点支持,可以直接在工作流中调用SeFi-Image。
  • 如果你是普通用户:5B Base模型需要一定的GPU显存,但Turbo版4步采样的低延迟特性让它在消费级硬件上也可运行。

需要注意的是:模型权重采用CC BY-NC 4.0非商业许可,商业使用需单独授权。

SeFi-Image证明了一件事:堆算力不是通往SOTA的唯一路径。把架构想清楚,比把账单烧明白更重要。当开源社区用1/5的算力追平了头部闭源模型,文生图这条赛道的游戏规则,正在被重新书写。