iVGR: Internalizing Visually Grounded Reasoning for MLLMs with Reinforcement Learning
iVGR通过强化学习将视觉定位能力内化到文本推理中,显著提升MLLMs性能。
Chang-Bin Zhang, Yujie Zhong, Qiang Zhang 等
iVGR通过强化学习将视觉定位能力内化到文本推理中,显著提升MLLMs性能。
Chang-Bin Zhang, Yujie Zhong, Qiang Zhang 等
提出RHELM基准,结合多源异构数据与动态用户画像,评估长时记忆能力。
Han Zhang, Zihao Tang, Xin Yu 等
引入基于最新真实经济数据的多解集生成方法,利用先进的元启发式算法优化线性排序问题,显著提升解的多样性与质量。
Fabrizio Fagiolo, Marco Baioletti, Valentino Santucci
退火Softmax贪心算法在多臂贝叶斯赌博机中实现了近似最优的Bayes遗憾率。
William Overman, Mohsen Bayati
DiffoR:利用扩散模型实现连续生成的统一框架,提升了有序回归的表现。
Hongxu Ma, Lin Wang, Chenghou Jin 等
GUI-C²通过难度感知强化学习实现精细化GUI定位,性能提升46.4%。
Junlong Li, Chao Hao, Lap-Pui Chau 等
通过PAJAMA系统将LLM评估逻辑蒸馏为程序,匹配13B模型性能,API成本降低50倍。
Tzu-Heng Huang, Shengqi Qiu, Frederic Sala
LISA结合线性注意力与稀疏索引,显著提升长序列推理速度与性能。
Yu Zhao, Zekun Zhang, Fan Jiang 等
FLAG通过潜变量增强指导实现流政策优化,在高维控制任务中表现出色。
Sungha Kim, Gawon Lee, Jusuk Lee 等
COFT采用对抗性因果推断,结合分布无关的校准保证偏见减缓,提升公平性。
Arya Fayyazi, Mehdi Kamal, Massoud Pedram
本研究分析工具调用的有效性和RL训练效率,发现评估敏感性高,提出两种加速技术。
Tong Liu, Cheng Qian, Matej Cief 等
通过PairSel算法提高选择性分类的准确性和成本效益。
Harsh Vardhan, Sunav Choudhary, Natwar Modani 等
提出CFO算法,通过序贯微调平衡奖励最大化与约束满足,应用于分子设计。
Sven Gutjahr, Riccardo De Santi, Luca Schaufelberger 等
提出一种基于查询条件的具身AI世界模型,解决现有模型物理不准确的问题。
Adam J. Thorpe, Stepan Tretiakov, Cheng-Hsi Hsiao 等
研究表明,填充Transformer在数值精度和模型深度上具有较高的表达能力。
Anej Svete, William Merrill, Ryan Cotterell 等
DisjunctiveNet结合凸包松弛实现硬逻辑规则的神经符号学习,确保规则满足率达100%。
Shraman Pal, Can Li
VideoMLA采用低秩潜在KV缓存,显著降低92.7%的内存,用于长时长视频生成,保持高质量。
Hidir Yesiltepe, Jiazhen Hu, Tuna Han Salih Meral 等
本文提出LLMSurgeon,通过逆问题方法估算大规模语言模型的预训练数据域比例,实验在LLMScan基准上达94.46%的准确率。
Yaxin Luo, Jiacheng Cui, Xiaohan Zhao 等
NeuROK通过学习低维潜在空间实现4D动态模拟,利用变换器编码器-解码器架构在大规模数据集上训练,突破传统物理模型限制。
Chen Geng, Guangzhao He, Yue Gao 等
YoCausal利用逆向视频和认知科学启发的双层指标,评估13个视频扩散模型的因果理解能力。
You-Zhe Xie, Yu-Hsuan Li, Jie-Ying Lee 等