在扩图任务中,生成对抗网络与扩散模型看似都在“补全像素”,其生成机理却截然不同。扩图通常覆盖超分辨率与画面外延展两类需求:前者在固定画幅内提高像素密度,后者在边界之外续写与原图语义、风格一致的内容。两条技术路线对“一致性从哪里来、细节如何被约束”给出了不同答案。

GAN 将问题建模为生成器与判别器的零和博弈。生成器学习从低分辨率或带掩码的条件输入映射到完整高分辨率图像,判别器则区分真伪以提供对抗信号。其优势在于对高频纹理的敏锐还原:边缘锐度、材质颗粒等局部细节往往能在对抗压力下被推得更“像真图”。代价同样明确——训练过程对超参与数据分布高度敏感,容易出现模式崩溃,即生成结果在多样性和全局结构上塌缩;一旦判别器过强或过弱,扩展区域还可能出现局部伪影与风格漂移。因此,GAN 更擅长在约束较强、目标分布相对集中的超分场景中“磨细节”,对大范围 outpainting 所需的长程语义连贯则并不天然稳妥。
扩散模型走的是另一条路径:先通过前向过程逐步注入噪声,再学习反向去噪以恢复数据分布。扩图时,已知区域被当作条件锚定,未知区域在多步去噪中被逐步“写实”。这种逐步修正机制使模型更易在全局布局、光照逻辑与物体连贯性上保持一致,同时保留较高的样本多样性,因而在复杂纹理重建与边界外延展上表现突出。其代价主要体现在推理步数与算力开销:多步采样带来更稳定的分布匹配,却不如单次前向的 GAN 那样轻量。行业实践也表明,仅靠无约束扩散仍可能发生语义偏移,因而常引入文本、语义掩码或多模态控制,把“能生成”收敛为“生成对”。
本质差异可以概括为三点。第一,目标函数不同:GAN 优化的是对抗判别边界,强调“骗过判别器”的感知真实;扩散优化的是逐步去噪的似然近似,强调对完整数据分布的覆盖。第二,失败模式不同:GAN 更易在局部高频上“漂亮却不稳”,扩散更易在缺少强条件时“合理却偏题”。第三,工程取舍不同:追求极致细节与较低延迟时,GAN 系思路仍有价值;追求大范围一致性、可控扩展与多样性时,扩散及其条件化变体更占主导。二者并非简单替代关系,混合损失、多尺度架构以及参考引导、语义引导,正是为了同时拿到高频质感与全局语义约束。
对实际选型而言,应先分清任务主矛盾:是边界外大面积续写,还是画幅内倍率提升;是更看重主观纹理,还是更看重结构不穿帮。再据此决定条件信号强度、是否引入感知损失,以及是否接受多步采样成本。扩图质量最终不取决于贴上哪类模型标签,而取决于生成过程如何被原图语义牢牢 anchor 住。
参与讨论
暂无评论,快来发表你的观点吧!