AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
返回主题地图

TOPIC · CURATED VIEW

AI 视频

追踪视频生成、理解与编辑工具,关注模型能力如何进入真实创作流程。

全部 Story
39
近 7 天
1
当前结果
39
全部新闻论文产品模型

主题情报

#Story为什么值得看类别评分
01

文章在 Nebius 上部署 NVIDIA Cosmos 3 Super 世界模型:延迟与吞吐的权衡

筛选线索AI 视频大模型与推理AI 主题AI 公司1 个独立信源

此前关于世界模型和视频生成的讨论多集中在模型能力本身,而这次公开对比的是服务层的工程取舍:视频生成不像大语言模型那样只追求吞吐或延迟单点最优,副本数和并发度会同时改变单节点产出与单请求响应时间。把延迟、吞吐和输出质量校验放在同一套基准里,意味着世界模型开始进入可量化部署阶段。

YouTube · NVIDIA Developer/9月23日 20:12
60
02

产品OpenChatCut:开源AI agent视频编辑器,带真实时间线

筛选线索开源模型与生态Agent 智能体AI 主题智能体1 个独立信源

OpenChatCut 是一款开源产品,定位为 AI agent 视频编辑器,其核心特点是提供真实时间线(real timeline)编辑界面,用户可借助 AI agent 完成剪辑操作。目前仅知它在 Product Hunt 上发布,具体开发者或团队信息尚未披露。

Product Hunt/7月21日 02:24
44
03

模型Kimi-K3:开放权重多模态智能体模型

筛选线索多模态开源模型与生态AI 公司模型家族1 个独立信源

这是世界首个开放的3T级模型,通过新架构KDA和AttnRes以及Stable LatentMoE框架,激活16/896专家,整体缩放效率比上一代Kimi K2提升约2.5倍,使更大规模的开源多模态智能体模型成为可能。

Hugging Face Model Radar/6月13日 06:42
63
04

论文Qwen3.8-Omni:走向原生全模态智能体

筛选线索多模态开源模型与生态模型家族推理能力1 个独立信源

此前 omni 模型主要强调感知与交互,而该模型把重心转向多模态理解、推理与长程任务,并通过原生多模态协同训练把文本域已有的 agentic 能力迁移到音频和视频任务,使多模态模型不再只是对话前端,而更接近可直接承担生产流程的智能体。

arXiv AI/9月22日 03:07
81
05

新闻MiniMax 布局视频领域,对标 Claude Code 推出 Agent 产品

筛选线索多模态Agent 智能体AI 主题模型家族1 个独立信源

此前AI视频生成质量虽高但后期修改和指令控制困难,H3通过三段式架构实现更高可控性,且价格仅为同类三分之一,降低了视频生产成本。MiniMax同步推出Agent产品,或将改变视频创作流程,提升效率。

公众号 · 极客公园/8月20日 14:56
42
06

产品Premation:开源 AI 版 After Effects 替代品

筛选线索开源模型与生态AI 视频AI 主题开源1 个独立信源

Premation 是一款开源的 AI 视频编辑产品,被定位为 Adobe After Effects 的替代品。它于 2026 年 7 月 30 日在 Product Hunt 上发布,目前公开信息有限,仅明确其开源属性和 AI 驱动的特点,旨在为用户提供视频特效制作的另一选择。

Product Hunt/7月30日 02:08
38
07

模型生数科技发布 Vidu S2,含 Avatar 与 Editing 双模型并探索空间视频

筛选线索AI 视频模型雷达1 个独立信源

此前视频生成模型多以单次生成为主,本次发布将数字角色交互与视频流实时编辑拆分为两个独立模型,并延伸到 VR 头显场景,说明产品方向从离线生成转向实时交互与实时编辑。

AIHOT · X / 公众号精选/9月15日 14:30
58
08

论文别读日志:执行轨迹污染视频生成智能体的验证器

筛选线索多模态开源模型与生态模型家族大语言模型1 个独立信源

此前评测多关注生成质量与提示词,而这份证据指出评测环节本身会被与被测画面无关的文本带偏。仅凭“工具调用成功”的日志,就能让开源评审模型大规模放行明显失败的片段,说明自动验证结果在闭环系统中可能不具备可信度。

arXiv AI/9月23日 10:53
79
09

新闻谷歌 Gemini Omni 1.1 Flash 让 AI 视频生成更便宜灵活

筛选线索AI 视频AI 主题模型家族1 个独立信源

相比此前仅分析最后 1 秒,新模型能分析 10 秒素材,场景扩展的连贯性显著提升,同时新增的 360p 草稿模式以更低成本和更快速度运行,让视频生成在创作迭代和成本控制上更实用,可能推动 AI 视频工具的普及。

The Decoder AI News/8月27日 17:01
40
10

产品MiniMax H3 Max 推出 24 小时 AI 直播网站

筛选线索AI 视频AI 主题发布动态1 个独立信源

MiniMax 将 H3 Max 的 768P 和 480P 高清视频生成能力接入其开放平台及 MiniMax Design 工具。海外开发者已基于该能力搭建出 Twitch 直播和 24 小时“AI 电视台”网站,表明该模型可用于实时或近乎实时的 AI 内容生成场景。

AIHOT · X / 公众号精选/8月31日 00:36
38
11

模型MiniMax H3正式开源,支持2K视频与原生立体声的全模态生成系统

筛选线索多模态开源模型与生态模型雷达1 个独立信源

此前开源视频模型多在分辨率、时长或音频能力上有所取舍,H3同时支持2K分辨率、15秒时长和32kHz原生立体声,且统一处理多模态输入,标志着开源模型在多模态生成能力上的新水平。

AIHOT · X / 公众号精选/8月3日 02:44
49
12

论文CogenPVG:面向说服性视频生成的认知增强反思式多智能体框架

筛选线索多模态Agent 智能体AI 主题推理能力1 个独立信源

此前的多模态视频生成多聚焦画面质量与指令跟随,较少把“说服效果”作为优化目标,也少有工作为通用议题而非商业广告服务。该工作把说服理论显式嵌入生成流程,并用生成—批评的反思循环逐阶段优化,意味着视频生成的目标函数从内容逼真向认知影响延伸。

arXiv AI/9月22日 07:48
78
13

新闻实验室培育神经元衍生软件层,宣称让 AI 视频更快更便宜

筛选线索AI 视频大模型与推理AI 主题性能改进1 个独立信源

此前生物神经元计算多停留在实验阶段,此次是将其作为可售卖的软件层绑定到商用文本生成视频产品上,并联合 AWS 渠道,意味着生物计算开始以附加组件形式进入现有 AI 视频商业链路。

The Decoder AI News/9月22日 13:58
40
14

产品Qwen-MM-Plugins:让智能体原生支持多模态

筛选线索多模态Agent 智能体模型家族发布动态1 个独立信源

QwenLM 团队发布了 Qwen-MM-Plugins,这是一套插件,旨在让智能体原生支持多模态能力。它能够处理图片、视频和文档,支持视频编辑以及 3D/CAD 数据处理,从而将多模态模型升级为多模态智能体。该项目的演示效果可在其 GitHub 仓库中查看。

AIHOT · X / 公众号精选/8月10日 04:04
36
15

论文GroundingPI:面向物理智能、以视觉基元做 grounding 的基础模型

筛选线索多模态AI 视频模型家族基础模型1 个独立信源

此前 VLA 与世界动作模型多直接复用通用视觉语言或视频生成骨干,在杂乱场景和微小目标的精确定位上受限。GroundingPI 用更小参数在多项定位基准上超过更大模型,并作为视觉骨干在机器人操作和自动驾驶上带来可测提升,说明专一定位骨干可能替代通用骨干。

arXiv AI/9月30日 12:20
77
16

新闻京东开源流式实时视频编辑模型 JoyAI-Video-Edit,支持任意时长编辑

筛选线索多模态开源模型与生态AI 主题AI 公司1 个独立信源

此前视频生成与编辑模型均为离线处理,需完整处理整段视频后才能查看结果,无法边播边改。JoyAI-Video-Edit首次将流式与实时结合,达到24帧流畅播放门槛,使实时编辑直播、视频通话等活视频流成为可能,改变了视频编辑的交互范式。

公众号 · 新智元/8月7日 04:07
39
17

论文HAS:基于高亮引导注意力调控的多模态大语言模型视频摘要

筛选线索多模态AI 视频AI 主题人工智能1 个独立信源

此前视频摘要方法依赖离散关键帧和片段描述,忽视了帧的全局重要性,可能导致理解不连贯和信息丢失。HAS从全局视角计算连续高亮分布并引导注意力,有望提升摘要的连贯性和信息完整性。

arXiv AI/7月20日 14:27
71
18

新闻Flux 3可生成20秒带原生音频视频,Black Forest Labs首次实现

筛选线索图像生成多模态基础模型多模态1 个独立信源

此前Black Forest Labs的视频生成模型仅输出无声画面,Flux 3首次实现视频与原生音频同步输出,时长达20秒,且内部测试成绩略超现有市场领先者Seedance 2.0,表明多模态视频生成质量迈上新台阶。

The Decoder AI News/7月23日 18:03
38
19

论文TaoLive 数字人智能体技术报告:训练智能体随 Harness 共同演进

筛选线索Agent 智能体AI 视频AI 主题大语言模型1 个独立信源

此前数字人直播智能体面临两难:小模型难以应对快速变化的业务配置,强模型延迟高。该方案通过将 Harness 状态纳入训练分布,让紧凑模型无需重训即可灵活适配动态业务规则,兼顾低延迟和高质量回复,为实时直播电商场景提供了可落地的技术路径。

arXiv AI/8月16日 14:32
70
20

新闻Google Vids 新增个性化 AI 头像,用户可创建自己的数字分身视频

筛选线索图像生成AI 视频AI 主题模型家族1 个独立信源

此前 AI 视频生成通常不包含用户本人的形象,Google Vids 让用户能以数字分身“参演”,降低了个人化视频制作门槛。

TechCrunch AI/7月16日 18:32
37
21

论文超越视频:统一视频推理与深度研究,构建开放世界视频智能体

筛选线索多模态开源模型与生态推理能力多模态1 个独立信源

此前视频理解和深度研究能力通常分开开发,视频模型难以获取外部知识,而检索模型缺乏时序感知。VideoRover 首次将二者统一到一个可迭代协调的框架中,使模型能主动定位稀疏视觉证据并获取外部知识,这可能为开放世界视频问答和智能体应用带来新的能力范式。

arXiv AI/8月24日 14:42
68
22

文章展示:Maginary.ai 新增 seedance2 与 GPT-images2 支持

筛选线索图像生成Agent 智能体模型家族智能体1 个独立信源

Maginary 此前已聚合 40 多个模型,本次新增 seedance2 和 GPT-images2 进一步扩大了可用模型种类,使用户能在统一界面中使用更多生成引擎,而无需分别注册不同服务。

Hacker News AI/7月26日 20:56
37
23

论文多模态大语言模型引导的文本生成视频语义纠正

筛选线索多模态AI 视频大语言模型多模态1 个独立信源

此前文本生成视频的语义纠错多在采样前优化或采样后细化,生成过程中缺乏检测与纠正机制。此框架首次将 MLLM 反馈注入扩散采样循环,进行实时的轨迹纠正,解决了生成中语义偏差未被干预的问题,提高了生成质量。

arXiv AI/8月17日 12:54
67
24

文章Vidmoat:任何AI代理均可操作的视频编辑流水线

筛选线索Agent 智能体AI 视频AI 主题智能体1 个独立信源

尚无中文解读

Hacker News AI/7月21日 00:09
34
25

论文统一具身合成与世界基础模型:小米机器人U0

筛选线索图像生成多模态模型家族基础模型1 个独立信源

过去具身生成方法常牺牲预训练的视觉知识,而该模型首次在多种机器人实体上实现高质量多视角场景生成,并引入结构化可控具身转移。它将世界基础模型的泛化能力保留并适应于具身场景,显著提升真实环境操作成功率。

arXiv AI/7月13日 14:57
66
26

文章OpenAI 或 Anthropic 的 AI 支出是否开始消耗你们的运营资金?

筛选线索AI 视频AI 主题AI 公司1 个独立信源

这反映了市场对 AI 服务高额支出的普遍担忧,可能影响初创公司的预算分配和现金流规划,值得关注。

Hacker News AI/8月20日 22:23
33
27

论文LynnReal-Omni:面向智能体视觉工作流的原生多模态视频生成

筛选线索图像生成多模态智能体多模态1 个独立信源

此前视频扩散模型随机性强、难以精确控制,长时段场景易在观感、交互和时间一致性上漂移;智能体视觉创作虽提供显式参考与可编辑状态,却难保证对象与角色保真度。该工作尝试把两者放入同一模型,用统一条件组合替代重复采样。

Hugging Face Daily Papers/9月15日 00:00
66
28

论文VGA-BenchV2:扩展的统一基准与多模型框架,用于评估视频美学与生成质量

筛选线索多模态AI 视频模型家族多模态1 个独立信源

与 VGA-Bench 相比,VGA-BenchV2 将人工标注规模大幅扩大,美学质量、美学标注和生成质量的标注量分别增至原来的 13.46 倍、11.15 倍和 1.55 倍,并首次将评估器用作奖励模型,实现从评估到优化的闭环,这标志着视频生成质量评估从纯评价走向可指导模型改进的新阶段。

arXiv AI/8月26日 07:16
65
29

论文文化时刻基准:评估视频文化推理与定位能力(东南亚)

筛选线索多模态AI 视频推理能力多模态1 个独立信源

现有视频文化基准将三种能力合并评分,掩盖了模型的具体短板。CMB首次分别评估概念命名、视觉识别和时间定位,揭示了最强模型在综合任务中得分极低,并发现音频对非拉丁文字文化概念常产生干扰,为该领域评测提供了更细粒度的方法。

arXiv AI/8月24日 10:11
65
30

论文Multi2AV-Safety:多模态到音频-视频生成的安全基准测试

筛选线索多模态AI 视频多模态发布动态1 个独立信源

此前安全基准多聚焦于单一提示或固定输入接口,难以覆盖多模态条件组合带来的新风险。Multi2AV-Safety首次系统覆盖全部11种非单一条件配置,并揭示安全防护在组合风险感知上的能力缺口,为多模态生成安全评估提供了标准化工具。

arXiv AI/8月27日 02:12
65
当前展示各类别评分靠前的 30 条,共 39 条