MCJudgeBench: A Benchmark for Constraint-Level Judge Evaluation in Multi-Constraint Instruction Following
MCJudgeBench基准评估多约束指令遵循中的判定可靠性,分析判别准确性与稳定性。
Jaeyun Lee, Junyoung Koh, Zeynel Tok 等
MCJudgeBench基准评估多约束指令遵循中的判定可靠性,分析判别准确性与稳定性。
Jaeyun Lee, Junyoung Koh, Zeynel Tok 等
Uni-OPD结合双重视角优化策略,有效提升跨模态和多教师知识蒸馏性能。
Wenjin Hou, Shangpin Peng, Weinong Wang 等
ProgramBench评估语言模型从零构建完整软件的能力,最佳模型仅通过95%测试,任务涵盖从CLI工具到复杂软件。
John Yang, Kilian Lieret, Jeffrey Ma 等
提出FSTM,通过两阶段训练实现室内场景几何与语义高效重建,速度提升2.3倍。
Remi Chierchia, Léo Lebrat, David Ahmedt-Aristizabal 等
通过分解旅行规划任务,研究发现LLMs在隐性约束推理上存在不足。
Bo-Wen Zhang, Jin Ye, Peng-Yu Hua 等
本研究探讨在强化学习中将动作信息引入循环神经网络的状态更新机制,比较不同架构效果。
Matthew Schlegel, Volodymyr Tkachuk, Adam White 等
提出CAFe-DINO,利用DINOv3实现无需RS微调的开域语义分割,性能超越现有方法。
Ryan Faulkenberry, Saurabh Prasad
提出SCPRM模型,结合图谱距离进行风险敏感多跳推理,提升KG问答准确率。
Jiujiu Chen, Yazheng Liu, Sihong Xie 等
PFlowNet通过变分强化学习实现视觉推理,V* Bench达90.6%。
Yangfu Li, Yuning Gong, Hongjian Zhan 等
基于基础模型的工业智能体,利用大语言模型实现自主决策与交互,提升人机协作能力。
Vincent Henkel, Felix Gehlhoff, David Kube 等
Hyp2Former利用超弦空间学习层次语义结构,提升开放集全景分割性能。
Yao Lu, Rohit Mohan, Florian Drews 等
提出六层语义自主框架,结合混合确定性-VLM推理与跨机器人记忆迁移,提升室内机器人自主性。
Bogdan Felician Abaza, Andrei-Alexandru Staicu, Cristian Vasile Doicin
POO算法优化未知光滑性噪声函数,误差与最佳算法相差不超过√ln n。
Jean-Bastien Grill, Michal Valko, Rémi Munos
引入InfoLaw,结合质量加权混合数据与重复,建立信息规模定律,准确预测大模型性能。
Fengze Liu, Weidong Zhou, Binbin Liu 等
NTIRE 2026挑战提出RetinexFormerRefine等方法,在低光照图像增强中实现SSIM提升至0.5654,模型小于1MB。
Jiebin Yan, Chenyu Tu, Weixia Zhang 等
提出了一种以规划者为中心的多智能体框架,显著提高了长时间规划任务的成功率。
Wenyi Wu, Sibo Zhu, Kun Zhou 等
提出MIRA评分,用于评估条件分布的准确性和模型比较,基于样本统计分析。
Sammy Sharief, Justine Zeghal, Gabriel Missael Barco 等
TMD-Bench提出了一个多层评估框架,用于音乐与舞蹈的联合生成,展示了RhyJAM模型在节奏同步上的竞争力。
Xiaoda Yang, Majun Zhang, Changhao Pan 等
提出解耦探索-承诺范式,结合校准感知生成提升长文本事实性,最高提升13%。
Wen Luo, Guangyue Peng, Liang Wang 等
VOFA结合视觉策略与力适应控制,实现 humanoid 推动未知物理属性物体,成功率超90%。
Zichao Hu, Zifan Xu, Dongsik Chang 等