摘要:SGLang Diffusion 团队在 8H200 上实测 MiniMax-H3 视频生成,密集无损路径较 Diffusers 快 1.85–1.95 倍,启用近似加速最高 6.24 倍,SSIM 保持 0.76–0.91。
视频生成的成本瓶颈不在模型,在推理效率。这篇测评把效率空间量化了。
测试环境:8× NVIDIA H200。
对比基线:Diffusers(HuggingFace 官方扩散推理库)。
结果一:密集无损路径 1.85–1.95× 提速,无近似损失。
结果二:启用近似加速最高 6.24×,SSIM 0.76–0.91。
两组数字要分开读,因为它们的意义完全不同。
1.95× 的无损加速是纯粹的工程收益。同样的输出质量,算力账单直接减半。这部分提速来自内核融合、调度优化、内存访问模式改进这类不改变数学结果的优化。对任何跑视频生成的团队来说,这是无脑该拿的收益——除了迁移推理栈的工程成本,没有任何代价。

6.24× 的近似加速需要判断。SSIM(结构相似性指数)0.76–0.91 这个区间跨度不小。SSIM 1.0 是完全一致,0.9 以上通常肉眼难辨差异,0.76 就属于能看出来了。所以这个加速比是有条件的:在能容忍质量下降的场景下才成立。
判断标准取决于内容用途。做草稿预览、做批量筛选、做低分辨率占位素材,0.76 完全够用,6 倍提速意味着迭代速度质变。做终稿交付、做客户可见的成品,就得回到无损路径。合理的产品设计是分级:预览用近似,定稿用无损,把成本花在真正需要质量的那一次。
这篇测评还有个容易被忽略的信息:它是第三方做的。LMSYS 是 Chatbot Arena 背后的团队,SGLang 是他们的推理引擎项目。厂商自己发的性能数据往往挑最有利的配置,第三方测评在方法透明度上更可信——尤其是当它同时给出无损和有损两条路径、并披露质量指标的时候。这种披露方式本身就是专业性的信号。
对做视频生成业务的团队,我建议的动作顺序是:先在自己的典型 prompt 集上复现无损路径的提速比(不同模型、不同分辨率、不同帧数的收益差别可能很大),确认收益成立后再评估迁移成本;近似路径单独做一轮人工盲评,用你自己的质量标准而不是 SSIM 数字来决定能不能上。
顺着这篇测评,可以多聊两句视频生成的成本结构,因为这块很多团队算不清。
视频生成的单位成本大致由四个变量决定:分辨率、帧数、去噪步数、以及是否需要多次采样挑选。前三个是线性或近线性关系,第四个是倍数关系——如果你的工作流是“生成四条挑一条”,实际成本就是理论成本的四倍。很多团队优化了半天推理效率,却没注意到废片率才是最大的成本项。
所以效率优化的优先级应该是:先降废片率(改进 prompt 工程、加前置的意图澄清、用低分辨率快速预览筛选),再降单次成本(推理栈优化、量化、近似加速),最后才考虑换更便宜的模型。顺序倒过来做,往往是花了大力气优化了一个本来就不该跑那么多次的流程。
这篇测评里的分级思路正好支撑第一步:用 6.24× 的近似路径做低成本预览,人工或自动筛掉不合格的构思,只把通过筛选的少数几条用无损路径重跑。假设废片率原本是 75%,这套流程能把总成本压到原来的三分之一以下,而且这个收益和推理栈优化的收益是可以叠加的。
补充一点:SSIM 作为质量指标有它的局限,它对结构差异敏感,对色彩偏移和时间维度上的闪烁不敏感。视频质量评估最好同时看 SSIM、LPIPS 这类感知指标,加上人工盲评。单一指标做决策容易翻车。
