- 类型
- 论文
- 来源
- Hugging Face Daily Papers
- 发布
- 2026年9月4日 00:00
- 状态
- 单一信源
发生了什么
研究人员推出 LLaDA-Image,一个统一框架,将从头训练的 6B 扩散 Transformer 与基于 LLaDA2.0-Mini 扩散语言模型的冻结视觉语言理解模块配对。通过仅图像预训练和中训练建立视觉生成先验,训练管线包含 2.2 亿样本,其中 9800 万为真实图像。模型在 Qwen-Image-Bench 英文和中文赛道分别取得 53.53 和 53.38 的分数,创下开源模型新纪录,并已发布权重、代码和详细配方。
为什么重要
该模型在 Qwen-Image-Bench 上取得开源模型最佳成绩,且完全公开权重、代码和训练细节,降低了复现门槛,便于开发者在其基础上定制,可能推动图像生成领域的开放研究。
底层逻辑
采用仅图像预训练+中训练,减少对配对数据依赖;DiT 内使用无参数 RMSNorm 和 Muon 优化器以提升训练效率;并通过蒸馏得到 Turbo 模型以实现 2-4 步快速推理。
产品与商业机会
开发者可获得可复现的图像生成模型及训练配方,加速产品原型开发;蒸馏版本支持快速推理,有利于实时应用;开放权重降低集成成本,但需评估硬件需求和许可条款。
- 将 LLaDA-Image 集成到现有图像编辑工具中,支持细粒度指令编辑。
- 基于其训练配方优化自有图像生成管线的数据使用效率。
- 针对中文场景定制微调,提升中文图像生成质量。
仍待确认
- LLaDA-Image 的具体许可协议与商业使用条款。
- 模型推理时的实际计算资源需求与延迟表现。
- 蒸馏版 LLaDA-Image-Turbo 在各类 benchmark 上的量化表现尚未公布。