Verifiable Geometry Problem Solving: Solver-Driven Autoformalization and Theorem Proposing
提出SD-GPS框架,结合QwenVL3-2B实现自动形式化与引理提议,显著提升几何问题解答准确率。
Can Li, Ting Zhang, Junbo Zhao 等
提出SD-GPS框架,结合QwenVL3-2B实现自动形式化与引理提议,显著提升几何问题解答准确率。
Can Li, Ting Zhang, Junbo Zhao 等
ATOD结合退火调度与Turn级不确定性加权,有效提升多轮交互任务性能。
Qitai Tan, Zefang Zong, Mo Li 等
BINEVAL通过二元问题分解评估指标,提升LLM输出的可解释性和性能。
Sangwoo Cho, Kushal Chawla, Pengshan Cai 等
JERP通过同时更新经验规则池和策略,提升多步交互任务中的决策性能。
Shicheng Ye, Chao Yu
AgentX通过多智能体系统实现工业推荐系统的自主自我迭代,提升效率和业务价值。
Changxin Lao, Fei Pan, Guozhuang Ma 等
提出AHOIS多智能体系统,利用苏格拉底式问询实现高维物理系统的自主科学发现,验证于多模光纤平台。
Xianrui Zeng, Pengfei Liu, Yirui Zang 等
Autodata通过元优化训练的代理数据科学家生成高质量合成数据,显著提升模型性能。
Ilia Kulikov, Chenxi Whitehouse, Tianhao Wu 等
MM-R2框架在多模态RAG中通过先推理后检索提升准确率。
Tianyu Yang, Shir Simon, Zhenzhen Li 等
利用推理“tokens”模拟反应时间,分析视觉语言模型的搜索行为,发现其部分行为与人类相似。
Farahnaz Wick
提出结构化认证框架,利用深度组合目标过滤特定转移,误差界为O(1/n)+δ,实现对部分转移的内部模型验证。
Yikai Lu, Yifei Wu, Xinyu Lu 等
本文分析 Andreas & Günther 的七个因果定义,揭示其实质等同性与逻辑矛盾,质疑差异制造的分类有效性。
Sander Beckers
FlowR2A通过学习奖励条件的动作分布,融合密集奖励监督与生成Proposal,提升多模态驾驶规划性能。
Xirui Li, Zhe Liu, Xiaoqing Ye 等
RIFT-Bench提供了一种动态红队测试方法,统一评估多样的代理AI系统。
Yarin Yerushalmi Levi, Roy Betser, Amit Giloni 等
VeriEvol通过逐步演化提示和答案验证,将视觉数学推理数据规模从10K提升至250K,提升准确率19.31%。
Haoling Li, Kai Zheng, Jie Wu 等
提出EHR-Complex,基于MIMIC-IV的交互式临床数据库推理基准,平均SQL结构组件31.93,模型最高准确62.3%。
Yitong Qiao, Lei Liu, Yue Shen 等
提出基于公式的OPD分类,分析其稳定性与性能,强调时间信用与词汇路由。
Bowen Zhang
PAPERCLAW利用多智能体系统实现从领域管理到论文生成的全流程自动化,核心在于可停止的假设图与人机交互。
Weiwei Ye, Hangchen Liu, Dongyuan Li 等
提出基于JS散度的GRPO后训练方法,在LlamaGen和Janus-7B上平衡性能与多样性。
Yuanhao Chiang, Hongbo Duan, Chunru Yang 等
答案工程通过局部轨迹编辑提高大语言模型的协议一致性,SSNHL合规率从25.1%提升至83.5%。
Victor Lavrenko, Anastasiia Molodnitskaia
FaraGen1.5通过模块化环境、求解器和验证器实现计算机使用代理的可扩展数据生成,Fara1.5-27B在Online-Mind2Web上达到72.3%。
Ahmed Awadallah, Sahil Gupta, Yash Lara 等