- 类型
- 论文
- 来源
- Hugging Face Daily Papers
- 发布
- 2026年9月2日 00:00
- 状态
- 单一信源
发生了什么
一篇论文提出“agentic data cracking”方法,让LLM代理在回答问题时自适应、推测性地将非结构化数据(如网页、报告、合同)转化为结构化数据,避免重复打开大文档。在FanOutQA基准上,理想预结构化存储使推理成本降低28倍,该方法能以接近RAG的成本保持代理准确性。
为什么重要
此前LLM代理处理非结构化数据时每次提问需重复读取大文档,消耗高达百万token。若预先结构化全部数据则成本过高且不现实。该方法让结构化为推理的副产品,随查询动态生成,使成本降至接近RAG水平,可能改变企业AI处理文档的性价比。
底层逻辑
其机制是:当代理打开文档回答问题时,一个“cracking”子代理利用已加载的上下文,以边际成本提取与未来查询相关的结构化信息。结构化决策由观察到的查询驱动,且推测性生成可能有用的结构。随时间推移,越来越多查询直接由结构化数据回答,无需打开原始文档,从而降低推理成本。
产品与商业机会
对产品影响:可降低依赖LLM代理进行文档问答的产品的API成本或推理开销,提升响应速度。研发上需设计查询驱动的缓存与结构化提取模块,并平衡提取精度与成本。用户体验上,复杂查询的成本下降可能使更多用户接受基于代理的分析功能。
- 将agentic data cracking集成到企业文档问答产品,按查询频率动态缓存结构化数据,降低API调用成本。
- 面向金融或法律领域,开发自适应结构化提取插件,使代理在处理财报或合同后生成可复用结构化摘要。
- 在RAG系统中增加“cracking”层,根据用户查询模式预提取高频文档的结构化字段,优化检索成本。
仍待确认
- 该方法在FanOutQA以外的真实复杂文档集上效果如何?
- 提取的结构化数据的准确性如何保证,错误结构会怎样影响下游推理?
- 实践中边际成本与收益的权衡点是什么?
- 与现有结构化缓存或数据库方案相比的具体成本节省幅度?