Benchmarking LLM-as-a-Judge for Long-Form Output Evaluation
提出LongJudgeBench,评估LLM作为长文本评审的可靠性,平均输出超9000词,结果显示存在显著不稳定性。
Junjie Chen, Yuxi Dong, Haitao Li 等
提出LongJudgeBench,评估LLM作为长文本评审的可靠性,平均输出超9000词,结果显示存在显著不稳定性。
Junjie Chen, Yuxi Dong, Haitao Li 等
TLG通过时间逻辑定位提升视频问答准确率24.5%,达到71.37%。
Ali Alavi
提出四层层次化对象表示,包括点云、网格、超二次曲面及膨胀超二次曲面,用于机器人场景理解与导航。
Ceng Zhang, Wan Su, Mohamed Samshad 等
多智能体计算使用系统(MACU)在桌面和网页导航基准上提高3.4-25.5%。
Jing Yu Koh, Ruslan Salakhutdinov, Daniel Fried
本论文系统评估了9种神经元模型与3种脉冲编码方案在网络入侵检测中的性能,发现编码方案对检测效果影响更大,Latency编码表现最佳。
Raj Patel, David Amebley, Taye Akinrele 等
提出结构化后检索组装方法,显著提升LLM记忆系统的单多跳准确率,超越现有方法。
Vikas Reddy, Sumanth Reddy Challaram
提出一种基于全域操作的边界条件方法,显著降低量子格子玻尔兹曼法中的资源消耗。
Călin A. Georgescu, Matthias Möller
BenchEvolver通过方案演化自动生成更难任务,提升模型判别能力。
Yangzhen Wu, Aaron J. Li, Wenjie Ma 等
提出Andes框架,通过自我演化树路由提升弱模型的指令对齐效果,达成SOTA性能。
Zhengyang Zhao, Shengjie Ye, Lu Ma 等
研究证明“避免支配”学习代理在市场中不会合谋,包含平均基算法和内部后悔最小化算法。
Noam Nisan, Emmanuel Zerah
TrOPD通过信任域策略提升大模型知识蒸馏的稳定性与效果,超越SOTA方法。
Xingrun Xing, Haoqing Wang, Boyan Gao 等
提出SVHalluc基准,评估音视频大模型中的语音-视觉幻觉,发现模型在语义和时间对齐上表现欠佳。
Chenshuang Zhang, Kyeong Seon Kim, Chengxin Liu 等
BraveGuard通过多轮开源威胁挖掘和轨迹监督,提升计算机代理安全检测,从38.79%到82.38%。
Yunhao Feng, Xiaohu Du, Xinhao Deng 等
提出交互式视频世界建模框架,强调动作控制、长时记忆与实时响应,推动多场景应用。
Jiuming Liu, Chaojun Ni, Mengmeng Liu 等
SkillRevise通过执行条件的技能修订,将LLM代理的成功率从36.05%提高到61.63%。
Yuxuan Liu, Zhaochen Su, Lingyun Xie 等
LeAP以可学习置换和自适应正则,在1.2万维工业模型中零损删去3600+冗余维度。
Yihong Huang, Chen Chu, Fei Chen 等
提出一种用于上下文线性优化的决策聚焦在线学习方法,实验表明其累积遗憾低于基线。
Wyame Benslimane, Tinghan Ye, Pascal Van Hentenryck 等
DAG-MoE通过结构聚合改进专家混合模型,提升了语言模型性能。
Jiarui Feng, Hanqing Zeng, Karish Grover 等
提出解耦残差去噪扩散模型(DRDD),通过两阶段独立扩散实现高效统一图像到图像转换,显著提升数据利用率。
Ziyue Lin, Jiahe Hou, Hongyu Xia 等
提出单层相位调制的编码-解码光学系统,实现非线性函数逼近,无需多层结构,利用干涉和强制偏置提升表达能力。
Yuntian Wang, Alexander Chen, Md Sadman Sakib Rahman 等