Beyond Query Memorization: Large Language Model Routing with Query Decomposition and Historical Matching
DecoR通过查询分解与历史匹配优化LLM路由,提升准确率并降低推理成本。
Bo Lv, Jingbo Sun
DecoR通过查询分解与历史匹配优化LLM路由,提升准确率并降低推理成本。
Bo Lv, Jingbo Sun
BrickAnything利用几何条件和结构感知的Tokenization生成可建造的砖块结构,显著提升稳定性和几何保真。
Zhengyang Ni, Feng Yan, Yu Guo 等
Meta-Agent以构建与执行双重验证,将任务成功率提升至平均82.7%。
Andy Xu, Yu-Wing Tai
通过引导随机探索提升推理:在Sudoku-Extreme上准确率从85.9%提升到98.0%。
Andrew Corbett, Archit Sood, Anna Tzatzopoulou 等
PANDO通过在线技能蒸馏提高多模态AI代理效率,成功率达58.3%。
Yubo Li, Yidi Miao, Yuntian Shen 等
FinCAD通过上下文感知解码减少历史结果记忆的影响,修正回测偏差。
Weixian Waylon Li, Mengyu Wang, Tiejun Ma
提出状态自适应记忆(SAM),通过外部存储实现长远推理,显著优于基线。
Yuyang Hu, Hongjin Qian, Shuting Wang 等
MOSS系统通过源码层自我改写,在OpenClaw上单轮演化将四任务平均评分从0.25提升至0.61。
Qianshu Cai, Yonggang Zhang, Xianzhang Jia 等
LCGuard通过对Transformer KV缓存进行对抗训练变换,有效降低多智能体系统中的敏感信息重构率,保持任务性能。
Sadia Asif, Mohammad Mohammadi Amiri, Momin Abbas 等
通过优先级排序直接评估Harness优化器,相关性ρ=0.602。
Kai Tzu-iunn Ong, Minseok Kang, Dongwook Choi 等
提出三类基于大模型的规划生成方法,强调在构建阶段利用LLMs提升可靠性与效率。
Michael Katz, Harsha Kokel, Kavitha Srinivas 等
Insights Generator通过多代理系统提高LLM诊断效率,提升30.4pp性能。
Akshay Manglik, Apaar Shanker, Kaustubh Deshpande 等
NeuroNL2LTL结合神经符号方法,实现自然语言到线性时序逻辑的高效翻译,达28%语义等价率。
Paapa Kwesi Quansah, Ernest Bonnah
提出TaskGround框架,实现全场景家庭推理,提升任务成功率达20%以上。
ZhiYuan Feng, Yu Deng, Ruichuan An 等
EXG通过经验图实现自进化代理,在线任务性能提升150%,离线效率提高45.7%。
Yuxin Jin, Siyuan Zhang, Hanchen Wang 等
A2RBench通过自动化流程生成可验证的抽象推理基准,发现LLMs在抽象推理上表现不佳。
Qingchuan Ma, Yuexiao Ma, Yongkang Xie 等
ECC算法通过校准语义嵌入与模型比较,提升LLM能力排名17.64%。
Fangzhou Wu, Sandeep Silwal, Qiuyi Zhang
RAGA采用LLM驱动的自主知识图谱构建与检索融合,支持全生命周期CRUD操作。
Chengrui Han, Zesheng Cheng
ShopGym通过ShopArena和ShopGuru实现真实模拟与大规模评测,解决环境非稳定与控制不足问题。
Chinmay Savadikar, Mingyu Zhao, Yuanzheng Zhu 等
SkillFlow采用流匹配损失实现多策略多路径优化,推动自主技能演化。
Mingda Zhang, Tiesunlong Shen, Haoran Luo 等