D-VLA: A High-Concurrency Distributed Asynchronous Reinforcement Learning Framework for Vision-Language-Action Models
D-VLA框架通过“平面解耦”和四线程异步管道显著提升VLA模型的采样效率和吞吐量。
Yucheng Guo, Yongjian Guo, Zhong Guan 等
D-VLA框架通过“平面解耦”和四线程异步管道显著提升VLA模型的采样效率和吞吐量。
Yucheng Guo, Yongjian Guo, Zhong Guan 等
提出BenchJack自动检测奖励黑客,识别8类设计缺陷,提升基准鲁棒性。
Hao Wang, Hanchen Li, Qiuyang Mang 等
ToolCUA通过分阶段训练实现GUI-工具路径选择,提升46.85%准确率。
Xuhao Hu, Xi Zhang, Haiyang Xu 等
研究提出了一种评估基于评分标准的强化学习中奖励欺骗的方法,发现即使在强验证下,奖励欺骗仍然存在。
Anas Mahmoud, MohammadHossein Rezaei, Zihao Wang 等
DR-Gym环境使用强化学习优化电力需求响应,提升电网灵活性和能源可负担性。
Jose E. Aguilar Escamilla, Lingdong Zhou, Xiangqi Zhu 等
提出可执行的代理记忆(EAM),基于知识图谱提升GUI任务的长远规划和效率。
Zerui Qin, Sheng Yue, Xingyuan Hua 等
提出BadSKP,针对知识图增强大模型的软提示后门攻击,通过多阶段优化操控图到提示接口,成功实现高效攻击。
Xiaoting Lyu, Yufei Han, Hangwei Qian 等
AutoLLMResearch通过多层次环境和长远决策模型,实现高成本LLM实验的自动配置,利用低成本试验指导高成本优化。
Taicheng Guo, Nitesh V. Chawla, Olaf Wiest 等
QUIVER框架量化多模态大模型管道中的扰动传播与分岔,基于敏感矩阵和轨迹偏差分析。
Prashanti Nilayam, Sankalp Nayak
PathISE通过学习路径信息量估计,提升知识图问答的准确性与效率。
Shengxiang Gao, Chao Lei, Jey Han Lau 等
RADAR通过条件图扩散生成低冗余通信拓扑,提升准确率和效率。
Zhen Zhang, Wanjing Zhou, Juncheng Li 等
提出EpiGraph,构建包含4.8万篇文献的 epilepsy 领域知识图谱,提升临床推理性能。
Yuyang Dai, Zheng Chen, Jathurshan Pradeepkumar 等
引入PDI指标,通过在线轨迹验证实现技能蒸馏,提升任务转移性。
Yang Zhou, Zihan Dong, Zhenting Wang 等
提出基于LLM的智能代理框架,加速SCIP插件生成,提升MIP求解效率。
Liding Xu, Yugeng Zhou, Sebastian Pokutta
FORTIS基准评估大模型在技能选择和执行中的过度权限行为,发现模型普遍超越最小必要权限,失败率高达62.5%。
Shawn Li, Chenxiao Yu, Han Wang 等
提出单一推理架构优化Alpamayo 1,降低69.23%的推理延迟,保持轨迹多样性。
Yunseong Jeon, Namcheol Lee, Yoonsu Lee 等
EvoMAS框架通过执行时多智能体工作流构建提升复杂任务成功率。
Chengdong Xu, Kaiqiang Ke, Ziheng Liu 等
提出WLDS系统,结合事实与逻辑校准,实现多域紧急事件高精度推演。
Zhengqing Hu, Dong Chen, Junkun Yuan 等
提出“绑定约束论”,强调长远任务中调度器(harness)配置对性能影响大于模型,建议披露调度器信息。
Yunbei Zhang, Janet Wang, Yingqiang Ge 等
提出桥接接口理论,区分预测、压缩与赋能,验证完美预测需识别潜在商与控制能力。
Richard Csaky