XGrammar-2: Dynamic and Efficient Structured Generation Engine for Agentic LLMs

TL;DR

提出XGrammar-2,基于TagDispatch与交叉语法缓存的动态结构生成引擎,提升编译速度6倍。

cs.AI 🔴 高级 2026-01-08 5 引用 80 次浏览
Linzhang Li Yixin Dong Guanjie Wang Ziyi Xu Alexander Jiang Tianqi Chen
大规模语言模型 结构化生成 动态推理 语法调度 缓存优化

核心发现

方法论

本文提出的XGrammar-2采用两大创新:一是引入TagDispatch机制,支持请求内的结构切换,二是设计交叉语法缓存(Cross-Grammar Cache),实现不同请求间子结构的重用。核心算法包括基于Earley解析的自适应Token Mask缓存、JIT即时编译技术,以及重复状态压缩。TagDispatch通过正则匹配多标签,实现请求内的结构动态切换;交叉语法缓存利用FSM的结构哈希,识别并重用共享子结构,从而大幅减少重复编译时间。系统还结合了Earley解析的非确定性语法处理能力,优化复杂语法的生成效率。实验在多个大模型推理平台上验证,显示编译速度提升超过6倍,且几乎无端到端延迟增加。

关键结果

  • XGrammar-2在工具调用场景中实现了超过6倍的编译速度提升,相较于传统静态语法引擎,显著缩短了请求处理时间,尤其在工具集庞大、多变的环境中表现优异。
  • 在多模型、多任务环境下,XGrammar-2的端到端性能几乎没有额外开销,满足现代LLM服务的实时性需求,验证了其在工业级应用中的实用性。
  • 通过引入TagDispatch机制,有效支持请求内的结构动态切换,提升了生成的表达能力和准确性,增强了模型对复杂响应协议的适应性。

研究意义

该研究突破了现有结构化生成引擎在动态请求环境中的瓶颈,解决工具调用和响应协议中结构变化频繁带来的效率挑战。其创新的TagDispatch与交叉语法缓存机制,为大规模语言模型在多变场景中的应用提供了强有力的技术支撑,推动了智能代理和自动化系统的快速发展。未来,结合更复杂的语法表达和多模态输入,XGrammar-2有望成为下一代高效、灵活的结构化生成基础平台,极大拓展LLM的应用边界。

技术贡献

本文的核心技术贡献包括:第一,提出TagDispatch机制,作为第一类语法结构支持请求内的结构切换,突破传统静态语法的限制;第二,设计基于FSM的交叉语法缓存算法,有效识别并重用不同请求间的共享子结构,减少重复编译成本;第三,结合Earley解析的自适应Token Mask缓存,提升复杂语法的生成效率;第四,采用JIT即时编译技术,将语法编译成本地化、动态化,显著降低请求延迟;第五,提出重复状态压缩算法,增强对重复结构的鲁棒性。整体架构实现了在现代LLM推理系统中的高效集成,极大提升了结构化生成的速度和灵活性。

新颖性

本研究的创新点在于首次将TagDispatch机制引入结构化生成领域,支持请求内的动态结构切换,结合交叉语法缓存实现不同请求间的子结构重用,解决了动态环境下的效率瓶颈。相较于之前的XGrammar,本文突破了静态语法的限制,适应了更复杂、多变的请求场景,提供了理论上的语法匹配保证和工程上的高效实现。此方法在工具调用和响应协议中展现出优越的适应性和扩展性,为未来动态结构生成提供了新的技术范式。

局限性

  • 尽管XGrammar-2在多模型、多请求场景中表现优异,但在极端复杂的语法结构或超大规模工具集下,缓存管理和哈希冲突可能带来性能瓶颈。
  • 系统依赖于请求内的标签设计和协议定义,若标签设计不合理或协议变化频繁,可能影响结构切换的效率和准确性。
  • 在极端低资源环境或硬件限制条件下,JIT编译和缓存维护可能引入额外开销,影响实时性能。

未来方向

未来,作者计划结合多模态输入(如图像、语音)扩展TagDispatch的表达能力,支持更复杂的交互场景。同时,将探索深度学习优化的语法匹配策略,进一步降低缓存冲突和哈希碰撞的概率。此外,结合分布式架构实现大规模语法缓存的高效管理,推动XGrammar-2在大规模工业应用中的部署。还将研究多任务、多用户环境下的个性化结构调度策略,以提升系统的适应性和智能水平。

AI 总览摘要

在当今人工智能快速发展的背景下,大规模语言模型(LLMs)已成为推动智能系统创新的核心技术。然而,随着应用场景的复杂化,模型在执行多样化任务时对结构化生成的需求日益增长。传统的结构化生成引擎多依赖静态语法规则,难以应对请求内外的动态变化,导致效率瓶颈和扩展性不足。特别是在工具调用和响应协议中,模型需要根据上下文动态切换结构,现有方案难以高效支持。

为解决这一难题,本文提出了XGrammar-2,一种基于TagDispatch机制和交叉语法缓存的动态结构生成引擎。TagDispatch作为一种新颖的语法构造,支持请求内的标签触发结构切换,使模型能够灵活应对不同的响应协议。而交叉语法缓存则利用FSM的结构哈希,识别并重用不同请求中的共享子结构,大幅减少重复编译时间。结合Earley解析的自适应Token Mask缓存、JIT即时编译技术和重复状态压缩,XGrammar-2实现了在复杂语法环境下的高效运行。

实验结果显示,XGrammar-2在多个模型和场景中,工具调用的编译速度提升超过6倍,几乎没有额外的端到端延迟。这一突破极大推动了结构化生成在工业界的应用落地,为智能代理、自动化客服、交互式系统等提供了强有力的技术支撑。未来,随着多模态、多任务的融合,XGrammar-2有望成为支持复杂交互的基础平台,推动AI系统向更高的智能化水平迈进。

总之,本文的创新不仅在于技术层面的突破,更在于为动态、多变的应用场景提供了可行的解决方案,开启了结构化生成的新时代。它的成功实现,为未来智能系统的灵活性和效率树立了新标杆,也为相关研究提供了丰富的理论和工程基础。

深度解读

原文摘要

Modern LLM agents increasingly rely on dynamic structured generation, such as tool calling and response protocols. Unlike traditional structured generation with static structures, these workloads vary both across requests and within a request, posing new challenges to existing engines. We present XGrammar-2, a structured generation engine for dynamic agentic workloads. Our design is based on two key ideas: first-class support for tag-triggered structure switching, and fine-grained reuse across requests with different output structures. Concretely, XGrammar-2 introduces TagDispatch for dynamic structural dispatching and Cross-Grammar Cache for substructure-level cache reuse across grammars. It further improves efficiency with an Earley-based adaptive token mask cache, just-in-time compilation, and repetition state compression. Experiments show that XGrammar-2 achieves over 6x faster compilation than prior structured generation engines, and incurs near-zero end-to-end overhead in modern LLM serving systems.

cs.AI

参考文献 (20)

Synchromesh: Reliable code generation from pre-trained language models

Gabriel Poesia, Oleksandr Polozov, Vu Le 等

2022 224 引用 查看解读 →

Training Stochastic Model Recognition Algorithms as Networks can Lead to Maximum Mutual Information Estimation of Parameters

J. Bridle

1989 654 引用

Singularity

S. Weber

2017 133 引用

The Berkeley Function Calling Leaderboard (BFCL): From Tool Use to Agentic Evaluation of Large Language Models

Shishir G. Patil, Huanzhi Mao, Fanjia Yan 等

2025 464 引用

Three models for the description of language

N. Chomsky

1956 2829 引用

An efficient context-free parsing algorithm

J. Earley

1970 1913 引用

Efficient string matching

A. Aho, M. J. Corasick

1975 2208 引用

May the source be with you.

S. Mathieson

2003 282 引用

A General-Purpose Algorithm for Constrained Sequential Inference

Daniel Deutsch, Shyam Upadhyay, Dan Roth

2019 47 引用

Directed Graph Hashing

Caleb Helbling

2020 6 引用 查看解读 →

PICARD: Parsing Incrementally for Constrained Auto-Regressive Decoding from Language Models

Torsten Scholak, Nathan Schucher, Dzmitry Bahdanau

2021 677 引用 查看解读 →

WGRAMMAR: Leverage Prior Knowledge to Accelerate Structured Decoding

Ran Wang, Xiaoxuan Liu, Hao Ren 等

2025 3 引用 查看解读 →

Validating Large Language Models with ReLM

Michael Kuchnik, V. Smith, George Amvrosiadis

2022 46 引用 查看解读 →

Generative Agents: Interactive Simulacra of Human Behavior

J. Park, Joseph O'Brien, Carrie J. Cai 等

2023 5332 引用 查看解读 →

Grammar Prompting for Domain-Specific Language Generation with Large Language Models

Bailin Wang, Zi Wang, Xuezhi Wang 等

2023 132 引用 查看解读 →

Efficient Semiring-Weighted Earley Parsing

Andreas Opedal, Ran Zmigrod, Tim Vieira 等

2023 4 引用 查看解读 →

Code Llama: Open Foundation Models for Code

Baptiste Rozière, Jonas Gehring, Fabian Gloeckle 等

2023 3521 引用 查看解读 →

Efficient Memory Management for Large Language Model Serving with PagedAttention

Woosuk Kwon, Zhuohan Li, Siyuan Zhuang 等

2023 7936 引用 查看解读 →

XGrammar: Flexible and Efficient Structured Generation Engine for Large Language Models

Yixin Dong, Charlie F. Ruan, Yaxing Cai 等

2024 80 引用 查看解读 →

FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving

Zihao Ye, Lequn Chen, Ruihang Lai 等

2025 303 引用 查看解读 →

被引用 (5)

Parser States Already Know: Structure-Conditioned KV Persistence for Structured Generation

Neurosymbolic Embodied Agents

Accelerating Constrained Decoding with Token Space Compression

Future Validity is the Missing Statistic: From Impossibility to Φ-Estimation for Grammar-Faithful Speculative Decoding

2026 1 引用 查看解读 →

VibeServe: Can AI Agents Build Bespoke LLM Serving Systems?

2026 1 引用 查看解读 →