Large Language Model Post-Training: A Unified View of Off-Policy and On-Policy Learning
提出以轨迹来源区分的LLM后训练框架,结合支持扩展与策略重塑,系统性分析多阶段方法。
Shiwan Zhao, Zhihu Wang, Xuyang Zhao 等
提出以轨迹来源区分的LLM后训练框架,结合支持扩展与策略重塑,系统性分析多阶段方法。
Shiwan Zhao, Zhihu Wang, Xuyang Zhao 等
提出语义级UI元素注入攻击,利用黑箱方法在截图上叠加安全无害UI元素,显著破坏GUI代理的视觉定位(成功率提升3.5-6.9倍)
Wenkui Yang, Chao Jin, Haisu Zhu 等
RoboAgent通过能力链式调用,将复杂任务分解为基本视觉-语言问题,提升长远规划能力。
Peiran Xu, Jiaqi Zheng, Yadong Mu
提出无需logits优化的直接分割方法,基于分布差异分析实现零训练开集语义分割。
Jiahao Li, Yang Lu, Yachao Zhang 等
ConfigSpec框架通过分析边缘设备和草稿模型的性能,优化分布式推理配置。
Xiangchen Li, Saeid Ghafouri, Jiakun Fan 等
提出EgoVerse,结合多源人类示范数据,推动机器人从人类行为中学习,涵盖1965任务、80k片段。
Ryan Punamiya, Simar Kareer, Zeyi Liu 等
TAMEn通过触觉感知和闭环数据收集,将双手操作任务成功率从34%提升到75%。
Longyan Wu, Jieji Ren, Chenghang Jiang 等
提出PAMELA数据集与个性化奖励模型,提升文本到图像生成的个人偏好预测。
Anne-Sofie Maerten, Juliane Verwiebe, Shyamgopal Karthik 等
PhyEdit利用显式几何模拟实现3D感知图像编辑,显著提升空间控制精度。
Ruihang Xu, Dewei Zhou, Xiaolong Shen 等
本研究分析多语嵌入模型在预测学习者CEFR水平中的表现,发现跨语料迁移能力不足。
Laurits Lyngbaek, Ross Deans Kristensen-McLachlan
ModuSeg通过解耦目标发现与语义检索,实现无需训练的弱监督分割,性能优越。
Qingze He, Fagui Liu, Dengke Zhang 等
提出MENO框架,结合MeanFlow增强神经算子,实现高分辨率动态系统的高效多尺度预测。
Tianyue Yang, Xiao Xue
提出CLI-Tool-Bench,基于黑盒差异测试评估LLMs从零到一生成CLI工具的能力,成功率仅43.8%。
Ruida Hu, Xinchen Wang, Chao Peng 等
提出DOC-GS框架,通过深度引导Dropout与暗通道先验提升稀疏视角3D高斯点云重建可靠性。
Hantang Li, Qiang Zhu, Xiandong Meng 等
提出一种基于路由器l2范数变化的专家混合精度量化方法,提高模型精度和推理效率。
Mohammed Nowaz Rabbani Chowdhury, Kaoutar El Maghraoui, Hsinyu Tsai 等
提出CMRM,通过分位数校准提升标签噪声下分类性能,无需先验知识。
Yuanjie Shi, Peihong Li, Zijian Zhang 等
本文系统回顾视频生成技术,从GAN到扩散模型,再到自回归和多模态方法,分析其核心原理与创新。
Teng Hu, Jiangning Zhang, Hongrui Huang 等
AgentCE-Bench通过隐藏槽位H和诱饵预算B实现可控难度和任务长度的智能体评估。
Wang Yang, Chaoda Song, Xinpeng Li 等
BOSCH采用黑箱二值优化,针对LLMs短上下文注意力头选择,显著优于静态方法。
Abbas Ghaddar, Ivan Kobyzev, Boxing Chen 等
构建一维Noetherian局部域D,利用Elliott平坦性准则,展示整数值多项式环非平坦,反驳普遍平坦性假设。
Haotian Ma