Multi-Agent Computer Use
多智能体计算使用系统(MACU)在桌面和网页导航基准上提高3.4-25.5%。
Jing Yu Koh, Ruslan Salakhutdinov, Daniel Fried
多智能体计算使用系统(MACU)在桌面和网页导航基准上提高3.4-25.5%。
Jing Yu Koh, Ruslan Salakhutdinov, Daniel Fried
本论文系统评估了9种神经元模型与3种脉冲编码方案在网络入侵检测中的性能,发现编码方案对检测效果影响更大,Latency编码表现最佳。
Raj Patel, David Amebley, Taye Akinrele 等
提出结构化后检索组装方法,显著提升LLM记忆系统的单多跳准确率,超越现有方法。
Vikas Reddy, Sumanth Reddy Challaram
提出一种基于全域操作的边界条件方法,显著降低量子格子玻尔兹曼法中的资源消耗。
Călin A. Georgescu, Matthias Möller
BenchEvolver通过方案演化自动生成更难任务,提升模型判别能力。
Yangzhen Wu, Aaron J. Li, Wenjie Ma 等
提出Andes框架,通过自我演化树路由提升弱模型的指令对齐效果,达成SOTA性能。
Zhengyang Zhao, Shengjie Ye, Lu Ma 等
研究证明“避免支配”学习代理在市场中不会合谋,包含平均基算法和内部后悔最小化算法。
Noam Nisan, Emmanuel Zerah
TrOPD通过信任域策略提升大模型知识蒸馏的稳定性与效果,超越SOTA方法。
Xingrun Xing, Haoqing Wang, Boyan Gao 等
提出SVHalluc基准,评估音视频大模型中的语音-视觉幻觉,发现模型在语义和时间对齐上表现欠佳。
Chenshuang Zhang, Kyeong Seon Kim, Chengxin Liu 等
BraveGuard通过多轮开源威胁挖掘和轨迹监督,提升计算机代理安全检测,从38.79%到82.38%。
Yunhao Feng, Xiaohu Du, Xinhao Deng 等
提出交互式视频世界建模框架,强调动作控制、长时记忆与实时响应,推动多场景应用。
Jiuming Liu, Chaojun Ni, Mengmeng Liu 等
SkillRevise通过执行条件的技能修订,将LLM代理的成功率从36.05%提高到61.63%。
Yuxuan Liu, Zhaochen Su, Lingyun Xie 等
LeAP以可学习置换和自适应正则,在1.2万维工业模型中零损删去3600+冗余维度。
Yihong Huang, Chen Chu, Fei Chen 等
提出一种用于上下文线性优化的决策聚焦在线学习方法,实验表明其累积遗憾低于基线。
Wyame Benslimane, Tinghan Ye, Pascal Van Hentenryck 等
DAG-MoE通过结构聚合改进专家混合模型,提升了语言模型性能。
Jiarui Feng, Hanqing Zeng, Karish Grover 等
提出解耦残差去噪扩散模型(DRDD),通过两阶段独立扩散实现高效统一图像到图像转换,显著提升数据利用率。
Ziyue Lin, Jiahe Hou, Hongyu Xia 等
提出单层相位调制的编码-解码光学系统,实现非线性函数逼近,无需多层结构,利用干涉和强制偏置提升表达能力。
Yuntian Wang, Alexander Chen, Md Sadman Sakib Rahman 等
$τ_0$-WM是一种统一的视频动作世界模型,在长时间机器人操作任务中表现优异。
Pengfei Zhou, Shengcong Chen, Di Chen 等
论文提出LLMs应学习个性化而非聚合的人类偏好,引用社会选择理论和实验数据。
Cristina Garbacea
MBench通过实体、环境和因果三维度评估视频世界模型的长时记忆能力,涵盖12个子维度。
Shengjun Zhang, Zhang Zhang, Simin Huang 等