- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年9月30日 17:52
- 状态
- 单一信源
发生了什么
arXiv 论文 Looped Diffusion Transformer 提出在每次去噪步骤内重复运行共享 Transformer 块,以固定参数量增加计算深度。作者指出朴素循环会因中间循环监督不足和注意力更新失控而损害画质,于是加入跨中间循环的深度监督与自调制注意力。在参数量和计算量对齐的条件下,该方法持续优于非循环基线,260M 参数模型在多个文生图基准上超过 6.5 倍大的模型,推理计算低 4.9 倍。
为什么重要
此前提升文生图质量主要依赖扩大模型规模或增加去噪步数,两者都直接抬高训练与推理成本。该工作给出第三条路径:不增加参数、不增加推理预算,而是把计算重复投入共享块。若结果可复现,模型规模与质量之间的传统换算关系会被改写,小模型在同等算力下可能获得更高画质。
底层逻辑
扩散模型每一步去噪都需要从噪声中恢复局部细节。循环共享块让内部表示在同一去噪步骤内多次更新,相当于增加有效深度;但重复更新会削弱局部信息并放大中间层误差。深度监督为每个循环提供学习信号,自调制注意力则约束注意力更新幅度,使循环不退化。论文还观察到循环深度增加带来的收益大于增加去噪步数,深层循环可纠正前层错误。
产品与商业机会
对研发而言,同等推理算力下可用更小模型达到更大模型的画质,直接降低显存占用与单次生成成本。产品侧可在不牺牲出图速度的前提下提高分辨率或质量,或在移动端、边缘设备部署原本需要大模型才能完成的文生图能力。训练侧需引入跨循环监督,可能增加实现复杂度与调参成本。
- 在现有文生图推理管线中试点 260M 级循环模型,对比同算力非循环基线的画质与延迟
- 将循环计算用于已有多步去噪流程,测试在固定推理预算下循环深度与去噪步数的最优配比
- 针对移动端或低显存场景,评估循环小模型替代大模型的可行性与部署成本
仍待确认
- 论文仅在 arXiv 发布,尚未确认是否经过同行评审或有独立复现
- 260M 模型超过 6.5 倍大模型的具体基准、评测协议与对比模型未在摘要中说明
- 循环深度增加时训练稳定性与收敛所需步数是否显著上升
- 该方法在视频生成、图像编辑等其他扩散任务上是否同样有效