摘要:Midjourney 向全部用户开放首个 V8.2 图像编辑模型测试,支持指令编辑、最多四张参考图的以图生图、局部重绘与扩画,兼容个性化、moodboards 与 srefs。
Midjourney 长期以来的短板是可控性,这次补的正是这块。
V8.2 编辑模型的能力清单:指令编辑(用自然语言描述要改什么)、以图生图(最多同时引用 4 张参考图)、局部重绘、扩画。同时兼容个性化模型、moodboards 和 srefs(风格参考)。入口在网页端和 Discord 的 --edit 命令,官方同步更新了 midjourney.com 与 alpha.midjourney.com 的界面。
对商业设计工作流来说,“最多 4 张参考图”这一条的分量最重。
设计需求很少是单一参考的。客户给你的通常是:这个色调、那个构图、这种材质感、加上我们品牌的既有元素。以前只能一张一张试,或者先把参考图拼成一张再喂进去——两种做法都在丢信息。四路参考并行输入,等于把设计师脑子里那套“多源合成”的工作方式直接搬进了模型。
指令编辑加局部重绘的组合则解决了另一个痛点:改稿。Midjourney 过去的使用模式接近抽奖,出图好但改不动,客户说“就这张,但把左边的杯子换成马克杯”,你只能重新抽。现在可以定点修。这一步是从“生成工具”迈向“生产工具”的必要条件——商业交付里,改稿次数往往比首稿质量更决定项目成本。
保持理性的部分:
编辑类模型的通病是一致性衰减。改一处,别处跟着变;连续改五轮,画面已经和初稿不是一个东西了。这个问题目前所有厂商都没彻底解决,实际使用中的应对办法是把改动拆细、每轮只改一处、及时保存中间版本。
另外 --edit 目前是测试状态,行为和输出质量可能会调整,商业项目排期时留出余量。
放在竞品格局里,图像生成这一层的差异化已经从“谁画得更好”转向“谁更好改”。Adobe 有工作流优势,Google 有多模态理解优势,Midjourney 的优势一直是审美调性——现在它把可控性这块短板补上,护城河会实一些。
具体到使用手法,有几条经验可以直接用。
四张参考图不要功能重叠。最有效的分工方式是让每张图承担一个不同维度:一张定色调、一张定构图、一张定材质质感、一张给具体元素。如果四张图都是“差不多的风格参考”,模型只会得到一个模糊的平均值,效果反而不如单图。
指令编辑要一次只改一件事。“把杯子换成马克杯并且把背景调暖一点”这种复合指令,模型经常只执行一半,或者两个改动互相干扰。拆成两轮,每轮验证一次,总耗时更短。
局部重绘的选区要留边。选区贴着物体边缘画,重绘出来的部分和周围接缝会很明显;往外扩一点,让模型有过渡空间,融合质量明显更好。这是老 inpainting 经验,在新模型上依然成立。
建立自己的 sref 库。既然支持风格参考,就把项目里验证过的风格种子系统性存下来,标注适用场景。这是可以跨项目复用的资产,长期看比记住某个 prompt 咒语有价值得多。
对设计团队的管理者,还有一件事值得推动:把 AI 生成资产的版本管理纳入现有流程。编辑类工具带来的最大混乱不是质量,是版本——一个需求改了十几轮,最后没人说得清客户批准的是哪一版。

