文章在 Nebius 上部署 NVIDIA Cosmos 3 Super 世界模型:延迟与吞吐的权衡
此前关于世界模型和视频生成的讨论多集中在模型能力本身,而这次公开对比的是服务层的工程取舍:视频生成不像大语言模型那样只追求吞吐或延迟单点最优,副本数和并发度会同时改变单节点产出与单请求响应时间。把延迟、吞吐和输出质量校验放在同一套基准里,意味着世界模型开始进入可量化部署阶段。
TOPIC · CURATED VIEW
追踪视频生成、理解与编辑工具,关注模型能力如何进入真实创作流程。
此前关于世界模型和视频生成的讨论多集中在模型能力本身,而这次公开对比的是服务层的工程取舍:视频生成不像大语言模型那样只追求吞吐或延迟单点最优,副本数和并发度会同时改变单节点产出与单请求响应时间。把延迟、吞吐和输出质量校验放在同一套基准里,意味着世界模型开始进入可量化部署阶段。
OpenChatCut 是一款开源产品,定位为 AI agent 视频编辑器,其核心特点是提供真实时间线(real timeline)编辑界面,用户可借助 AI agent 完成剪辑操作。目前仅知它在 Product Hunt 上发布,具体开发者或团队信息尚未披露。
这是世界首个开放的3T级模型,通过新架构KDA和AttnRes以及Stable LatentMoE框架,激活16/896专家,整体缩放效率比上一代Kimi K2提升约2.5倍,使更大规模的开源多模态智能体模型成为可能。
此前 omni 模型主要强调感知与交互,而该模型把重心转向多模态理解、推理与长程任务,并通过原生多模态协同训练把文本域已有的 agentic 能力迁移到音频和视频任务,使多模态模型不再只是对话前端,而更接近可直接承担生产流程的智能体。
此前AI视频生成质量虽高但后期修改和指令控制困难,H3通过三段式架构实现更高可控性,且价格仅为同类三分之一,降低了视频生产成本。MiniMax同步推出Agent产品,或将改变视频创作流程,提升效率。
Premation 是一款开源的 AI 视频编辑产品,被定位为 Adobe After Effects 的替代品。它于 2026 年 7 月 30 日在 Product Hunt 上发布,目前公开信息有限,仅明确其开源属性和 AI 驱动的特点,旨在为用户提供视频特效制作的另一选择。
此前视频生成模型多以单次生成为主,本次发布将数字角色交互与视频流实时编辑拆分为两个独立模型,并延伸到 VR 头显场景,说明产品方向从离线生成转向实时交互与实时编辑。
此前评测多关注生成质量与提示词,而这份证据指出评测环节本身会被与被测画面无关的文本带偏。仅凭“工具调用成功”的日志,就能让开源评审模型大规模放行明显失败的片段,说明自动验证结果在闭环系统中可能不具备可信度。
相比此前仅分析最后 1 秒,新模型能分析 10 秒素材,场景扩展的连贯性显著提升,同时新增的 360p 草稿模式以更低成本和更快速度运行,让视频生成在创作迭代和成本控制上更实用,可能推动 AI 视频工具的普及。
MiniMax 将 H3 Max 的 768P 和 480P 高清视频生成能力接入其开放平台及 MiniMax Design 工具。海外开发者已基于该能力搭建出 Twitch 直播和 24 小时“AI 电视台”网站,表明该模型可用于实时或近乎实时的 AI 内容生成场景。
此前开源视频模型多在分辨率、时长或音频能力上有所取舍,H3同时支持2K分辨率、15秒时长和32kHz原生立体声,且统一处理多模态输入,标志着开源模型在多模态生成能力上的新水平。
此前的多模态视频生成多聚焦画面质量与指令跟随,较少把“说服效果”作为优化目标,也少有工作为通用议题而非商业广告服务。该工作把说服理论显式嵌入生成流程,并用生成—批评的反思循环逐阶段优化,意味着视频生成的目标函数从内容逼真向认知影响延伸。
此前生物神经元计算多停留在实验阶段,此次是将其作为可售卖的软件层绑定到商用文本生成视频产品上,并联合 AWS 渠道,意味着生物计算开始以附加组件形式进入现有 AI 视频商业链路。
QwenLM 团队发布了 Qwen-MM-Plugins,这是一套插件,旨在让智能体原生支持多模态能力。它能够处理图片、视频和文档,支持视频编辑以及 3D/CAD 数据处理,从而将多模态模型升级为多模态智能体。该项目的演示效果可在其 GitHub 仓库中查看。
此前 VLA 与世界动作模型多直接复用通用视觉语言或视频生成骨干,在杂乱场景和微小目标的精确定位上受限。GroundingPI 用更小参数在多项定位基准上超过更大模型,并作为视觉骨干在机器人操作和自动驾驶上带来可测提升,说明专一定位骨干可能替代通用骨干。
此前视频生成与编辑模型均为离线处理,需完整处理整段视频后才能查看结果,无法边播边改。JoyAI-Video-Edit首次将流式与实时结合,达到24帧流畅播放门槛,使实时编辑直播、视频通话等活视频流成为可能,改变了视频编辑的交互范式。
此前视频摘要方法依赖离散关键帧和片段描述,忽视了帧的全局重要性,可能导致理解不连贯和信息丢失。HAS从全局视角计算连续高亮分布并引导注意力,有望提升摘要的连贯性和信息完整性。
此前Black Forest Labs的视频生成模型仅输出无声画面,Flux 3首次实现视频与原生音频同步输出,时长达20秒,且内部测试成绩略超现有市场领先者Seedance 2.0,表明多模态视频生成质量迈上新台阶。
此前数字人直播智能体面临两难:小模型难以应对快速变化的业务配置,强模型延迟高。该方案通过将 Harness 状态纳入训练分布,让紧凑模型无需重训即可灵活适配动态业务规则,兼顾低延迟和高质量回复,为实时直播电商场景提供了可落地的技术路径。
此前 AI 视频生成通常不包含用户本人的形象,Google Vids 让用户能以数字分身“参演”,降低了个人化视频制作门槛。
此前视频理解和深度研究能力通常分开开发,视频模型难以获取外部知识,而检索模型缺乏时序感知。VideoRover 首次将二者统一到一个可迭代协调的框架中,使模型能主动定位稀疏视觉证据并获取外部知识,这可能为开放世界视频问答和智能体应用带来新的能力范式。
Maginary 此前已聚合 40 多个模型,本次新增 seedance2 和 GPT-images2 进一步扩大了可用模型种类,使用户能在统一界面中使用更多生成引擎,而无需分别注册不同服务。
此前文本生成视频的语义纠错多在采样前优化或采样后细化,生成过程中缺乏检测与纠正机制。此框架首次将 MLLM 反馈注入扩散采样循环,进行实时的轨迹纠正,解决了生成中语义偏差未被干预的问题,提高了生成质量。
尚无中文解读
过去具身生成方法常牺牲预训练的视觉知识,而该模型首次在多种机器人实体上实现高质量多视角场景生成,并引入结构化可控具身转移。它将世界基础模型的泛化能力保留并适应于具身场景,显著提升真实环境操作成功率。
这反映了市场对 AI 服务高额支出的普遍担忧,可能影响初创公司的预算分配和现金流规划,值得关注。
此前视频扩散模型随机性强、难以精确控制,长时段场景易在观感、交互和时间一致性上漂移;智能体视觉创作虽提供显式参考与可编辑状态,却难保证对象与角色保真度。该工作尝试把两者放入同一模型,用统一条件组合替代重复采样。
与 VGA-Bench 相比,VGA-BenchV2 将人工标注规模大幅扩大,美学质量、美学标注和生成质量的标注量分别增至原来的 13.46 倍、11.15 倍和 1.55 倍,并首次将评估器用作奖励模型,实现从评估到优化的闭环,这标志着视频生成质量评估从纯评价走向可指导模型改进的新阶段。
现有视频文化基准将三种能力合并评分,掩盖了模型的具体短板。CMB首次分别评估概念命名、视觉识别和时间定位,揭示了最强模型在综合任务中得分极低,并发现音频对非拉丁文字文化概念常产生干扰,为该领域评测提供了更细粒度的方法。
此前安全基准多聚焦于单一提示或固定输入接口,难以覆盖多模态条件组合带来的新风险。Multi2AV-Safety首次系统覆盖全部11种非单一条件配置,并揭示安全防护在组合风险感知上的能力缺口,为多模态生成安全评估提供了标准化工具。