VAR: Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction
作者:Keyu Tian, Yi Jiang, Zehuan Yuan, Bingyue Peng, Liwei Wang
单位:Peking University, ByteDance Inc.
会议:NeurIPS 2024
研究动机
把图像离散成 token 后,最直接的做法是照搬语言模型:把二维 token 网格按光栅顺序拉平成一维,再从左到右、从上到下逐 token 生成。但图像并不是天然的一维序列,这种做法带来四个问题:

- 单向顺序与图像的二维联合分布并不自然匹配;
- 当前 token 只能使用“之前”的区域,难以执行需要双向上下文的任务;
- 拉平破坏了近邻像素或 patch 的空间局部性;
- $n\times n$ token 需要 $n^2$ 次串行解码,分辨率上升后速度迅速恶化。

VAR 的核心变化非常简单:不再预测“下一个 token”,而是预测“下一个尺度”。模型先生成低分辨率语义布局,再逐级补充更高分辨率的结构和纹理;同一尺度内的所有 token 可以并行预测。
这不仅是一项加速技巧。它重新定义了图像自回归的因果顺序:空间位置不再决定先后,信息尺度才决定先后。
核心方法

1. 多尺度离散视觉表示
第一阶段训练一个 multi-scale VQ autoencoder。编码器把图像映射到连续特征,再由多尺度量化器得到
其中 $r_k$ 是第 $k$ 个分辨率的离散 token map,尺度从粗到细。较低尺度首先表达类别、轮廓和全局布局;更高尺度在已有重建上继续编码细节残差。
这里的 tokenizer 是 VAR 成立的前提:如果只有单一分辨率 token,Transformer 就没有“下一尺度”可预测。论文保持 VQGAN 式编码器/解码器框架,并用重建、感知和对抗损失训练第一阶段。
2. Next-Scale Prediction
第二阶段把联合分布分解为:
第 $k$ 个尺度中的所有位置共享同一个条件前缀 $r_{<k}$,因此可以并行生成。训练时把类别起始 token $[s]$ 与较低尺度 token 上采样后拼入序列,并使用 block-wise causal mask:同一尺度可以互相注意,也能看见所有更粗尺度,但不能读取未来的更细尺度。
这个分解保留了自回归模型的似然训练和因果采样,又恢复了二维图像内部的双向空间关系。
3. 为什么会更快
传统光栅 AR 需要 $\mathcal O(n^2)$ 次串行步骤,论文按自注意力累计成本推导总复杂度为 $\mathcal O(n^6)$。VAR 的尺度数随分辨率近似对数增长,因此只需 $\mathcal O(\log n)$ 次串行步骤,总复杂度降为 $\mathcal O(n^4)$。
这个结论是在论文的 token/注意力设置下得到的理论量级;实际速度还会受到 tokenizer、KV cache、batch size 和硬件并行效率影响。实验中的 wall-clock 对比仍显示了约 20 倍于传统 VQGAN AR 的加速。
4. 结构保持朴素
VAR Transformer 基本沿用 GPT-2 风格 decoder-only Transformer,并加入生成模型常用的 AdaLN、classifier-free guidance、top-$k$ sampling 和 attention normalization。论文最关键的消融不是某个复杂模块,而是把训练目标从 AR 改为 VAR:
- 227M 的传统 AR 基线 FID 为 18.65;
- 207M 的基础 VAR-d16 在几乎不加额外技巧时 FID 已降到 5.22;
- 再加入 AdaLN、top-$k$、CFG 和 attention normalization 后为 3.30;
- 扩展到 2B 参数并使用 rejection sampling 后达到 1.73。
数据集
训练和评测均以 ImageNet 类条件生成作为主场景:
- 训练集约 128 万张图像;
- 主要评测分辨率为 $256\times256$,另有 $512\times512$ 实验;
- 缩放律实验训练 12 个模型,参数量从 18M 到 2B;
- 单个模型训练 200–350 epochs,最大训练 token 数约 305B。
论文还展示了不额外微调的图像修补、扩图和类别条件编辑,但没有在更广泛的文本到图像数据或开放域数据上验证同样的缩放结论。
算力
所有模型使用 AdamW,$\beta_1=0.9,\beta_2=0.95$,weight decay 0.05;基础学习率按 batch size 256 设为 $10^{-4}$。实际 batch size 为 768–1024,训练 200–350 epochs。
论文没有明确报告 GPU 型号、GPU 数量、训练时长和总能耗。最大模型达到 2B 参数并进行大规模多轮训练,因此训练成本并不“小”;VAR 的主要效率优势集中在并行生成和可预测的缩放行为。
实验结果

ImageNet 256×256
完整 VAR-d30(2B)不使用 rejection sampling 时 FID 1.92、IS 323.1;加入 rejection sampling 后 FID 1.73、IS 350.2。论文对比中的 DiT-XL/2 为 FID 2.27、IS 278.2,相对推理时间约为 VAR 的 45 倍;传统 VQGAN AR 为 FID 18.65、IS 80.4,相对时间为 19。
需要注意,1.73 是带 rejection sampling 的结果,不能与 1.92 混为同一推理配置。即便看不带拒绝采样的 1.92,VAR 仍展示了很强的质量—速度折中。
在 $512\times512$ 上,资源受限的 VAR-d36-s 达到 FID 2.63、IS 303.2,优于论文表中的 DiT-XL/2(FID 3.04、IS 240.8)。
缩放律

随着参数量从 18M 增长到 2B,测试 loss 与 token error rate 都近似遵循幂律下降;对数空间的 Pearson 相关系数接近 -0.998。论文还按最优训练计算量 $C_{\min}$ 拟合了类似关系。

样例中,模型规模和训练量增加后,物体结构、类别一致性与细节逐渐改善。不过缩放律是在固定 ImageNet、固定 tokenizer 和相近训练方案下测得,不能自动外推到任意数据域或多模态生成。
零样本任务

通过改变尺度 token 的已知区域和采样掩码,VAR 可以在不专门微调的情况下进行 in-painting、out-painting 与 class-conditional editing。这证明 next-scale 表示比单向光栅序列更容易利用双向上下文。
但这些实验以定性样例为主,尚不足以说明 VAR 已获得语言模型式的通用任务泛化。更准确的表述是:模型显示出了可复用的零样本编辑行为。
优势与不足
优势
- 重新选择了图像的自回归顺序。 从空间顺序改成信息尺度顺序,概念简单且直接解决并行性问题。
- 改进主要来自范式而非堆模块。 AR→VAR 的第一步消融就带来 FID 18.65→5.22 的巨大变化。
- 质量、速度和缩放性同时改善。 在论文设置下首次让 GPT 风格视觉 AR 与强扩散 Transformer 正面竞争。
- 多尺度 token 天然支持局部编辑。 同尺度双向关系比光栅单向关系更适合补全和扩图。
不足
- 性能高度依赖第一阶段 VQ tokenizer;量化误差、重建上限和多尺度设计都会限制第二阶段。
- 主实验集中在 ImageNet 类条件生成,尚未证明同样结论能无缝扩展到开放域文生图、视频或多模态任务。
- 最大模型仍为 2B,训练 200–350 epochs;推理更快不代表整体训练成本低。
- FID/IS 与定性零样本样例不能完整衡量语义遵循、组合生成和真实世界偏差。
记忆点
- 图像的“下一个”不一定是右边的 token,也可以是更细的尺度。
- 同尺度并行、跨尺度自回归,同时保留二维上下文与因果生成。
- tokenizer 决定生成上限。 VAR 改进 Transformer 之前,先要求一个真正可用的多尺度离散表示。
- 缩放律必须写清适用条件。 固定数据、tokenizer 和训练配方下的规律,不应被无条件外推。












