ECCV 2026 Long Oral|MIMFlow:以 MIM 重塑语义潜空间,构建Normalizing Flow端到端生成新范式

大模型智能 · 人工智能

大模型智能 2026-09-06 00:00 吉林 大模型智能|分享 来源 | 南京大学 编辑 | 极市平台 图 1:MIM 在三类范式中的位置。MIMFlow 不再把 MIM 只用于自监督预训练或独立 tokenizer,而是把表示学习、重建和生成放进同一个端到端目标。图片来自原论文。 01 一句话概括 MIMFlow 要解决的核心矛盾是: Normalizing Flow 擅长精确建模分布,却会因为严格可逆而把大量建模容量分配给低层细节;Masked Image Modeling 擅长逼出高层语义,却往往与真正的生成模型分阶段训练。 MIMFlow 把两者接到同一条端到端训练链路中: Masked ViT Encoder 从被随机遮挡的图像中提取全局信息; Learnable Token Bottleneck 用固定数量的查询 token 汇聚语义,形成稳定、紧凑的连续 latent; Latent Normalizing Flow 对该 latent 做精确密度估计与反向采样; Generative ViT Decoder 负责像素重建和高频纹理合成。 它不是简单地给现有生成模型增加一个 MIM 辅助损失,而是重新划分生成任务中的职责: 传统 Flow 被要求同时处理两项性质不同的任务:一是建模对象、轮廓和布局等全局结构,二是保留毛发、边缘和噪声等局部细节。MIMFlow 重新分工:Encoder 提取全局语义,Flow 建模语义 latent 的概率分布,Decoder 合成高频细节。 论文的主要结果包括: 在 ImageNet 256×256 类别条件生成上,MIMFlow-L 达到 FID 2.50 ; 相比参数规模接近的 SimFlow-L,FID 从 3.72 降至 2.50,下降 32.8% ; latent 只使用 128 个 token ,比常见的 256-token latent 减少 50%; latent 的 ImageNet 线性探测准确率达到 71.3% ,说明它不只是便于重建,也确实包含更强的类别语义; 在相同 8×H800 设置下,相比 SimFlow-L,训练显存下降 28% ,吞吐提升约 10% ,单图采样时间接近减半。 2 什么 Normalizing Flow 会被像素细节“拖住”? 归一化流(Normalizing Flow,NF)的吸引力来自一套非常干净的数学机制:模型学习一个可逆映射,把复杂的数据分布变换成简单的高斯分布。由于变换可逆,它既能对所建模空间中的样本计算精确密度,也能从高斯噪声反向得到样本。在 MIMFlow 中,这种精确密度估计发生在 latent 空间。 设可逆变换为 ,图像 latent 为 ,则: 问题也恰佮来自"可逆"二字。 判别模型可以主动丢掉背景纹理、传感器噪声等与语义无关的信息;而 NF 为了维持双射,原则上必须解释输入空间中的每个维度。当 latent 混合了物体类别、轮廓、布局、毛发、草地纹理和随机噪声时,Flow 无法只选择自己最关心的部分。大量容量因此消耗在高频局部统计上,真正决定全局结构的语义反而得不到足够建模。 这也是为什么“把 NF 做得更深、更大”并不一定是最高效的答案:如果输入流形本身复杂而冗余,增加容量可能只是在更认真地拟合冗余。 MIM 提供了一个反直觉的突破口 Masked Image Modeling(MIM)会先遮住图像的大量 patch,再要求模型恢复缺失内容。由于局部像素已经不可见,编码器不能只复制纹理,只能依据剩余区域推断物体、结构和上下文。换句话说,遮挡天然形成了一个信息瓶颈: 看不全,模型就必须做全局推断; 不能依赖局部复制,latent 就更偏向语义; latent 更紧凑,后续密度模型面对的分布也更简单。 但把 MIM 直接接到 NF 上并不容易。经典 MAE 只编码可见 patch,不同 mask 会产生不同长度、不同位置结构的序列;这对需要稳定输入维度的 NF 很不友好。SimMIM 虽然保留固定长度,但被遮挡 token 与可见 token 的信息密度差异很大,随机 mask 会让 latent 分布持续抖动。 此外,已有不少“生成式 tokenizer”方法先用 MIM 训练 tokenizer,再冻结 latent、单独训练生成模型。这样虽然改善了表示,但 tokenizer 与生成模型仍然是两个阶段,重建最优的 latent 未必就是密度建模最容易的 latent。 MIMFlow 的关键变化是: 不再把 MIM 当作生成之前的预训练工具,而是让它直接参与语义潜空间与生成分布的共同塑形。 03 MIMFlow:用遮挡把“语义建模”和“纹理合成”拆开 图 2:MIMFlow 整体架构。Masked

查看原文