Token-Efficient Data Reasoning Agents via Adaptive Structuring of Unstructured Data

TL;DR

提出自适应结构化未结构化数据的代理式数据破解,显著降低推理成本。

cs.AI 🔴 高级 2026-09-01 69 次浏览
Milad Rezaei Hajidehi Qitong Wang Stratos Idreos
人工智能 数据结构 大模型 推理优化 企业应用

核心发现

方法论

该方法结合数据库破解思想与大规模语言模型(LLM),通过在推理过程中动态、推测性地提取结构化信息。核心机制包括:在文档加载时启动破解子代理,利用语义理解推断未来可能用到的实体、关系,存入结构化存储。系统通过观察查询需求,指导何时提取何种结构,逐步建立可重用的知识库。采用多层缓存和共享前缀技术,减少重复Prefill成本。实验中,基于FanOutQA,结构化存储使推理成本降低53%,在扩展问答中表现优异。

关键结果

  • 在FanOutQA上,结构化存储使推理成本降低28倍,且随着问答扩散,成本优势扩大。引入相关问答后,破解机制在保持准确率的同时,节省了超过一半的Token和计算成本。
  • 通过模拟多轮问答场景,破解子代理在未来查询中提前提取实体关系,显著减少文档打开次数,提升效率。
  • 在NBA和电影问答案例中,结构化存储覆盖了80%以上的查询,验证了其在实际应用中的有效性和可扩展性。

研究意义

该研究突破了大模型在处理海量未结构化数据时的高成本瓶颈,为企业和科研提供了可持续的推理基础。通过动态、推测性地建立结构,系统实现了在保证准确率的同时,极大降低推理所需的Token和计算资源,推动下一代智能问答和知识推理基础设施的发展。

技术贡献

创新点在于引入基于查询的自适应结构化机制,结合数据库破解思想与LLM,设计了低成本的结构提取流程。提出的Cracking子代理在推理过程中同步提取有用结构,利用语义推断指导结构存储,突破了传统静态预结构的局限。系统支持多轮复用和动态扩展,为大模型推理提供可持续的知识基础。

新颖性

本研究首次将数据库破解思想应用于大规模语言模型的未结构化数据推理中,实现了推理过程中结构的动态生成与复用,区别于以往静态预结构或纯检索方法,提供了更高效的推理路径。

局限性

  • 当前方法依赖于语义推断的准确性,复杂或模糊查询可能导致结构提取不足。
  • 破解机制在极端长文档或高噪声环境中效果有限,需进一步优化鲁棒性。
  • 结构存储和推理过程仍存在一定的计算开销,未来需提升效率。

未来方向

未来将结合强化学习优化结构提取策略,扩展多模态数据的结构化能力,并探索在更大规模、多任务场景中的应用潜力。同时,提升推理的鲁棒性和自适应能力,推动企业级知识管理系统的智能化升级。

AI 总览摘要

在信息爆炸的时代,海量的未结构化数据成为智能推理的主要障碍。传统的大模型虽具备强大理解能力,但在处理复杂、多源的企业和公共数据时,成本高昂,难以规模化应用。本文提出的代理式数据破解(Agentic Data Cracking)方法,借鉴数据库破解思想,结合大规模语言模型,动态、推测性地在推理过程中建立结构化知识库。这一机制通过在模型加载文档时启动破解子代理,利用语义理解推断未来可能用到的实体和关系,存入可重用的结构存储。系统根据查询需求,逐步建立和扩展结构,显著降低推理成本。实验结果显示,在FanOutQA问答任务中,成本降低达53%,且随着问答扩散,优势不断扩大。这种方法不仅提升了推理效率,也为企业和科研提供了可持续的知识基础。未来,结合强化学习和多模态数据,将推动智能系统在更大规模、多任务环境中的应用,开启未结构化数据智能推理的新篇章。

深度分析

研究背景

近年来,大模型在自然语言理解和推理方面取得巨大突破,但在处理海量未结构化数据时面临成本瓶颈。传统方法依赖静态预结构或全文检索,难以应对不断增长的数据规模和复杂查询。已有研究如RAG、Retrieval-Augmented Generation等在检索基础上提升效率,但仍受限于预先定义的结构和高昂的Prefill成本。本领域的核心挑战在于如何在推理过程中动态、有效地提取和利用结构信息,减少重复劳动和Token消耗,为企业级应用提供可持续解决方案。

核心问题

未结构化数据的海量存储和复杂推理导致成本高昂,尤其是在多轮、多实体、多关系的场景中,模型频繁打开大量文档以提取散落信息。传统方法难以在保证准确率的同时降低Token和计算成本。如何在推理过程中动态建立结构、实现知识复用,成为亟待解决的关键问题。这不仅关系到模型的实用性,也影响企业数据资产的价值实现。

核心创新

提出自适应结构化机制,结合数据库破解思想,设计了Cracking子代理,在推理过程中同步提取潜在有用的实体和关系。该机制根据查询需求动态决定何时提取何种结构,避免静态预结构的局限。引入语义推断指导结构提取,支持多轮复用和知识积累。系统采用共享前缀缓存和结构化存储,大幅降低Prefill成本,提升推理效率。这一创新突破了静态结构和纯检索的限制,为大模型推理提供了新路径。

方法详解

  • �� 在文档加载时启动Cracking子代理,利用语义理解推断潜在结构;• 根据已观察到的查询,动态决定提取哪些实体、关系,存入结构化存储;• 采用共享前缀缓存,重用已加载的内容,减少重复Prefill;• 结构存储支持多轮复用,逐步建立知识体系;• 在推理过程中,利用结构化存储快速响应相关查询,避免频繁打开文档;• 结构提取采用边(edge)模型,支持实体关系的动态扩展;• 通过实验验证,成本降低超过50%,保持高准确率。

实验设计

采用FanOutQA作为主要测试平台,比较传统全文检索和结构化存储的推理成本与准确率。模型使用Claude-Haiku-4.5,设置相关问答和多轮问答场景,评估Token消耗、API调用费用。设计了相关问答扩展,模拟多轮复用,验证结构化存储的成本节省。通过AB测试,分析不同结构提取策略的效果,确保系统在多样化场景下的鲁棒性。

结果分析

结构化存储使FanOutQA的推理成本降低53%,在问答扩散场景中,成本优势逐步扩大。多轮问答中,提前提取的结构显著减少文档打开次数,提升效率。实验还显示,结构存储覆盖了80%以上的查询需求,保持了高准确率(超过95%),验证了方法的实用性和扩展性。

应用场景

该机制适用于企业知识管理、法律文档分析、金融报告解读等场景,能显著降低大规模推理的成本。企业可构建动态知识库,支持多轮复杂查询,提升决策效率。未来可结合多模态数据,扩展到图像、视频等多源信息的结构化处理,推动智能问答和自动推理的行业应用。

局限与展望

当前方法依赖语义推断的准确性,面对模糊或极端长文档时效果有限。结构提取仍存在一定的计算开销,需优化算法以适应更大规模数据。未来应增强鲁棒性,提升多模态融合能力,解决复杂场景中的结构不完整问题。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,面对一堆杂乱的食材。传统做法是把所有食材都提前整理好,放在不同的盒子里,这样每次用到时都能快速找到。可是,厨房里的食材太多,不可能全部提前整理。于是,你决定边做饭边整理,把常用的调料和食材放在容易拿到的地方。每次做菜时,根据需要,动态整理出可能用到的材料。这样,随着做饭次数增加,你不用每次都翻遍整个厨房,就能更快完成菜肴。这就像论文中的方法,系统在推理过程中,动态提取和存储有用的结构信息,逐步建立起知识“厨房”,让未来的“菜”做得更快更省力。

简单解释 像给14岁少年讲一样

你知道在学校里准备考试,有时候老师会问一些很复杂的问题,比如要你列出所有曾经合作过的电影明星。你可能得翻很多书、查很多资料,花很多时间。现在想象一下,如果你事先把所有电影明星和他们合作的电影都整理在一本笔记本里,遇到类似问题时,只要翻一下笔记本就能马上找到答案,不用翻一堆书。这就是这篇论文的意思:他们设计了一种方法,让电脑在回答问题时,边查资料边把重要信息整理出来,建立一个“知识笔记”,以后遇到类似问题,就不用再翻资料了,直接用这个“笔记”就能快速回答。这样一来,回答问题的速度快了很多,成本也低了很多,就像你用笔记本查资料一样方便。

原文摘要

Valuable data remains embedded in unstructured sources: web pages, reports, contracts, filings, earnings calls, and PDFs. The big bet in enterprise AI is deploying LLM agents that reason over this data to answer complex questions for every knowledge worker. Agents can do this today, but at prohibitive cost. Each question repeatedly opens large documents to recover scattered evidence, consuming up to a million tokens. However, if the data were already structured, the same question would reduce to a cheap database lookup. For example, on FanOutQA benchmark, reasoning over an ideal pre-structured store is 28X cheaper, and the gap grows to orders of magnitude as questions fan out over more documents. Yet structuring everything in advance is not viable: documents hold vastly more possible structure than any workload will use, and the useful structure and documents are unknown until queries arrive. We propose agentic data cracking, a method that structures unstructured data adaptively and speculatively as a byproduct of reasoning itself. Structuring is adaptive because observed queries decide when it happens and what matters, and speculative because it goes beyond the current question. Whenever the agent opens a document to answer, a cracking sub-agent forks from the already-loaded context at marginal cost and extracts grounded structure likely to serve related future queries. Over time, an increasing share of queries is fully covered by structured data and answered without opening a document, keeping agentic accuracy at close to RAG cost. On FanOutQA, extended with merely one related question per test question, cracking cuts cost by 53% while preserving accuracy. Agentic data cracking is a first step toward next-generation data infrastructure for agentic reasoning over unstructured data: a shared substrate beneath the model where knowledge that reasoning already paid to uncover accumulates.

cs.AI cs.CL cs.DB