Building2Building: A Large Scale Benchmark for Generalizable Real-World Reinforcement Learning
B2B用EnergyPlus生成6000栋建筑,系统评测RL的目标、动力学、动作空间与跨域泛化。
Vincent Taboga, Justin Veilleux, Doseok Jang 等
B2B用EnergyPlus生成6000栋建筑,系统评测RL的目标、动力学、动作空间与跨域泛化。
Vincent Taboga, Justin Veilleux, Doseok Jang 等
提出基于抽象语法树的AoA证明代理,显著降低API成本和提升效率。
Qiyuan Xu, Joshua Ong Jun Leang, Renxi Wang 等
MDND结合可微与不可微方法,实现形状对应的无监督学习,显著提升非等距形状的匹配精度。
Qinsong Li, Jing Meng, Haibo Wang 等
论文提出结合检查点适用性、敏感性分析与Conformal Risk Control的代理模型,在5188个配置上预测修复影响。
Nada Hanad, Mehdi Acheli, Ali NourEldin 等
提出IoU-PD,利用真实边界框作为训练中的特权信息,提升多模态大模型的视觉定位精度。
Xiuyuan Zhu, Ke Lu, Hao Wu 等
提出异步快慢视觉语言动作推理架构,将路线完成率从37.0提升至94.0。
Yun Li, Jiachen Gong, Simon Thompson 等
ASK-NN使用不对称最近邻测试检测自然语言中的分布漂移。
Sergey Zakharov, Rodion Oblovatny, Alexey Zaytsev
提出递归自我提升的RHI方法,通过少量迭代优化用户构建的任务特定harness,显著提升低推理成本代理性能,减少推理成本达60%。
Hyunin Lee, Jinglue Xu, Jeffrey Seely 等
提出Plover,基于计划的视觉GUI自动化系统,通过外部化任务计划实现可检视、可修正,提升透明度与控制性。
Madhumitha Venkatesan, Shicheng Wen, Jiajing Guo 等
通过线性探测验证神经语言模型中语法性编码,显示模型能系统区分语法与非语法句子。
Jane Li, Najoung Kim
提出多轴Max@K强化学习提升文本到图像模型的目标模式覆盖率,显著改善多样性和公平性。
Ku Onoda, Paavo Parmas, Hiroki Furuta 等
TanGO利用切空间指导和优化,实现无训练3D编辑,显著减少结构伪影。
Siwoo Lim, Sunjae Yoon, Gwanhyeong Koo 等
D-cut通过跨请求修剪和运行时自适应,提升高并发推理速度,最高达3倍。
Tianyu Liu, Yuhao Shen, Rui Cen 等
提出MCPEvol-Bench,通过11个突变算子模拟MCP服务器演化,评估12个LLM模型在动态工具环境中的适应性。
Huanxi Liu, Kun Hu, Jiaqi Liao 等
MathCoPilot结合人机协作,通过动态蓝图和多技能调度提升数学证明效率。
Junjie Zhang, Jiayu Liu, Wenbin Liu 等
HyMobileAgent通过数据与环境共扩展实现高效GUI代理,AndroidWorld成功率82.6%。
Hy Vision Team, Huawen Shen, Zhengyang Tang 等
AdaTurn通过预算感知的测试时刻调节显著提升低预算下的视觉推理性能。
Susan Liang, Chao Huang, Filippos Bellos 等
提出连续时间强化学习框架优化离散扩散模型,提升数学推理和编码任务表现。
Zikun Zhang, Jiayuan Sheng, David D. Yao 等
Uni-AdaVD通过正交值分解实现视觉生成中的概念擦除,实验表明其在多种生成模型上表现优异。
Qifan Zhou, Yuan Wang, Yanbin Hao 等
G2SR利用多视几何实现快速、低存储的高精度Gaussian表面重建,达69-89次/秒。
Dasong Gao, Vivienne Sze, Sertac Karaman