- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年9月29日 12:53
- 状态
- 单一信源
发生了什么
研究者提出 LazySloth,一种基于树搜索的视频理解加速方法。它让 VLM 判断视频中哪些片段无关,只对这些片段做有界描述,从而减少描述开销。相比现有 agentic 方法,速度提升 2.9 至 8.3 倍;在 Gemma 4 31B 与 Qwen3.6 27B 两个开源基座模型、四个基准上,准确率与专用视频 VLM 及 RAG 方法相当或更好,并缩小了与 GPT-4o 的差距。消融显示,用 CLIP 检索替代 VLM 场景理解会损失 8.8% 至 19.9% 准确率,惰性树构建以更低描述成本达到与激进构建相当的效果。
为什么重要
此前长视频理解多依赖逐帧粗描述或带损嵌入的多模态 RAG,计算开销大且丢失时序与细节;LazySloth 把检索优化问题聚焦到 VLM 自身的查询相关信息筛选上,在不明显损失准确率的前提下大幅提速,并缩小开源模型与闭源模型差距。
底层逻辑
机制是用 VLM 对视频片段做相关性判断,只对判定为不相关的部分生成有界描述,并以此构建惰性树结构,避免对全部帧做完整描述和依赖大上下文窗口;检索阶段则基于树搜索定位与查询相关的片段。消融表明 VLM 场景理解比 CLIP 检索更关键,惰性构建与激进构建效果接近但成本更低。
产品与商业机会
对视频理解类产品,该方法意味着可在不更换基座模型的前提下降低推理成本并加快响应,长视频问答、检索和摘要的可用性提升;研发上可将 VLM 判断与树搜索结合,减少对超长上下文和逐帧描述的依赖。
- 在长视频问答或检索产品中引入 VLM 相关性判断加惰性树搜索,替换逐帧描述流程以降低推理成本。
- 面向监控、教育、内容审核等长视频场景,提供基于该方法的按需检索接口,优先返回与查询相关的片段。
- 基于 Gemma 4 31B 或 Qwen3.6 27B 搭建可复现的评测基线,对比自身 RAG 方案的速度与准确率。
仍待确认
- 该方法的 2.9 至 8.3 倍加速是在何种视频长度、硬件与查询分布下测得,是否可外推到其他场景。
- 四个基准的具体名称与任务类型未在证据中列出,覆盖范围是否包括开放域长视频仍待确认。
- GPT-4o 对比的差距缩小幅度缺少具体数值。
- 有界描述策略在高度相关视频上的表现,以及是否引入漏检风险,尚未说明。