- 类型
- 论文
- 来源
- Hugging Face Daily Papers
- 发布
- 2026年9月15日 00:00
- 状态
- 单一信源
发生了什么
该论文提出 LynnReal-Omni,一个基于 32B 共享多模态 diffusion transformer 的原生多模态视频生成框架,统一了文生视频、图像条件生成、参考引导生成、结构控制、编辑、退化视频修复与长视频生成,可接收外观参考、可编辑 3D 渲染和游戏录像等异构视觉输入。另训练 27B 的 LynnReal-Omni-Flash 用于实时渲染,并构建数据管线与 MSAVP 评测方案。
为什么重要
此前视频扩散模型随机性强、难以精确控制,长时段场景易在观感、交互和时间一致性上漂移;智能体视觉创作虽提供显式参考与可编辑状态,却难保证对象与角色保真度。该工作尝试把两者放入同一模型,用统一条件组合替代重复采样。
底层逻辑
机制在于用 32B 共享多模态 diffusion transformer 承载多种生成与控制任务,让智能体把外观参考、3D 渲染和游戏录像等异构条件在同一模型内组合;同时以 27B Flash 版本和轻量 VAE 解码器降低推理成本,并用数据管线对齐多镜头音视频片段与多模态标注。
产品与商业机会
对产品与研发的直接影响是:视频生成可用 3D 渲染或游戏状态等结构化条件稳定控制,减少反复采样与人工筛选;统一的生成、编辑与修复接口可简化工具链;Flash 版本与解码加速若成立,将影响实时渲染类功能的成本与延迟。
- 将可编辑 3D 场景或游戏状态作为条件接入视频生成,做可控分镜与预演工具
- 在既有视频资产上提供参考引导生成、结构控制与退化视频修复的统一编辑入口
- 基于 MSAVP 的多维度指标搭建内部视频生成评测集,用于模型选型与回归测试
- 针对 Flash 版本验证实时渲染延迟,探索直播或交互式内容场景的可行性
仍待确认
- 证据未给出模型权重、代码或可访问的 demo 信息,实际可用性未知
- 32B 与 27B 模型的推理成本、显存需求和生成时延未披露
- MSAVP 的 100 条 prompt 与 20 项指标是否对外开放、能否复现尚不明确
- 异构输入(3D 渲染、游戏录像)的具体接入格式与保真度表现未有量化结果