Question Difficulty Estimation for Large Language Models via Answer Plausibility Scoring
Q-DAPS方法通过计算候选答案的可信度熵来估计问题难度,在四个QA数据集上表现优异。
Jamshid Mozafari, Bhawna Piryani, Adam Jatowt
Q-DAPS方法通过计算候选答案的可信度熵来估计问题难度,在四个QA数据集上表现优异。
Jamshid Mozafari, Bhawna Piryani, Adam Jatowt
SafeManip使用LTLf评估机器人操作中的时间安全性,揭示任务成功不等于安全执行。
Chengyue Huang, Khang Vo Huynh, Sebastian Elbaum 等
MedHopQA通过多跳推理评估生物医学问答,使用1,000个专家策划的问题对。
Rezarta Islamaj, Robert Leaman, Joey Chan 等
提出线性化图序列模型(LGSM),将消息传递与序列建模结合,提升长距离信息捕获能力。
Joël Mathys, Basil Rohner, Saku Peltonen 等
利用Virdyn IMU运动捕捉套装实现实时全身遥操作,成功在Unitree G1机器人上进行Sim2Sim和Sim2Real验证。
Hamza Ahmed Durrani, Suleman Khan
提出可执行的代理记忆(EAM),基于知识图谱提升GUI任务的长远规划和效率。
Zerui Qin, Sheng Yue, Xingyuan Hua 等
提出了一种新的顺序超样本框架,使用顺序CMI控制泛化间隙。
Futoshi Futami, Masahiro Fujisawa
动态认知调和解码(DCRD)通过预测和缓解上下文-记忆冲突,在六个QA数据集上实现了最先进的性能。
Yigeng Zhou, Wu Li, Yifan Lu 等
提出MoLA,通过逆动力学模型将虚拟未来视频转化为可执行动作,提升机器人操控性能。
Yajie Li, Bozhou Zhang, Chun Gu 等
MoCam利用结构化去噪动态在扩散模型中实现几何与外观的统一新视角合成。
Haofeng Liu, Yang Zhou, Ziheng Wang 等
提出感知熵以解决流模型RLHF中的多样性崩溃,提升质量与多样性(PEC score 0.734)
Xiaofeng Tan, Jun Liu, Bin-Bin Gao 等
BARISTA利用密集标注场景图实现多任务场景理解,涵盖185个真实咖啡制作视频。
Patrick Knab, Orgest Xhelili, Inis Buzi 等
提出SkillSafetyBench,基于155个攻击案例评估大模型代理的技能安全性。
Chang Jin, An Wang, Zeming Wei 等
提出BadSKP,针对知识图增强大模型的软提示后门攻击,通过多阶段优化操控图到提示接口,成功实现高效攻击。
Xiaoting Lyu, Yufei Han, Hangwei Qian 等
Chronicles-OCR通过阶段自适应标注范式,评估VLLMs对中国文字演变的跨时空视觉感知能力,包含2800张图像。
Gengluo Li, Shangpin Peng, Xingyu Wan 等
提出多视图潜在先验的动作流形学习方法,在LIBERO等数据集上表现优异。
Junjin Xiao, Dongyang Li, Yandan Yang 等
提出能量-每Token产出模型,强调能耗对推理性能的限制,建议报告能耗指标。
Xiang Liu, Shimiao Yuan, Zhenheng Tang 等
提出COMPOSE框架,通过训练保持对象几何,推理实现组合匹配,显著提升持续少样本学习中的新概念泛化。
Phu-Quy Nguyen-Lam, Phu-Hoa Pham, Dao Sy Duy Minh 等
D-PACE通过动态位置加权改进平行投机解码,提升速度和输出长度。
Tianyu Wu, Yu Yao, Zhenting Qi 等
PointForward通过点对齐表示实现驾驶场景的快速无监督重建,显著提升多视角一致性。
Cheng Chi, Xianqi Wang, Hongcheng Luo 等