Beyond Scores: Understanding LLM-as-a-Judge Mechanisms in Summarization Evaluation
本研究揭示LLM评估器在摘要评价中的内部机制,发现其在层15后通过注意力和MLP实现错误检测与评分决策。
Himil Vasava, Ming Jiang
本研究揭示LLM评估器在摘要评价中的内部机制,发现其在层15后通过注意力和MLP实现错误检测与评分决策。
Himil Vasava, Ming Jiang
提出PTA-IRT,通过轨迹信息提升软件工程代理评估效率,低预算下优于传统IRT。
Kefeng Duan, Dewu Zheng, Yanlin Wang 等
ACToR通过识别关键Token实现仓库级代码生成的动态目标检索,显著提升性能。
Kefeng Duan, Dewu Zheng, Yanlin Wang 等
CordisBench评估语言模型在动态组件生命周期推理中的表现,涉及1200题,揭示模型在复杂依赖下的局限。
Damien Sileo, Dimitri Kachler
提出单边模仿机制,利用嵌套循环单调性实现多AI代理的激励与控制。
Dirk Bergemann, Andrew Koh, Stephen Morris
提出StudentSim框架,通过池化训练和个性化微调,提升学生模拟器的行为一致性和指导响应性。
Ke Yang, Chenglong Wang, Michel Galley 等
采用因果混合精度干预验证,发现量化损伤分布广泛,全球细粒度调节优于局部修复。
Jundong Hu, Shekar Ramachandran
SpatialGuard通过结构化布局和验证机制,提升复杂3D空间文本到图像生成的空间一致性。
Ziyun Qian, Zizhi Chen, Yizhou Liu 等
SG-AMP结合深度完成、场景图推理与语义感知运动规划,提升辣椒植物感知与主动视角选择。
Rohit Menon, Shiva Rudra Lolla, Niklas Mueller-Goldingen 等
基于35B参数的困难感知数据筛选与质量调整部署,显著降低文档理解成本达80%。
Maksim Evdokimov, Matvey Ivanov, Dmitrii Tsiupin 等
H3-World利用MiniMax-H3视频生成器实现基于自然语言的精确世界控制,无需专门动作模块。
Danze Chen, Zeqing Wang, Ziyue Lin 等
引入SCILAWS-BENCH,利用真实科学数据评估LLMs发现科学定律能力,涵盖118题,291条潜在定律。
Yiming Huang, Ziche Liu, Zhuohang Wu 等
通过层级探测V-JEPA 2和VideoMAE-v2模型中的时空表示,揭示摄像机运动、物理理解和异常检测的编码特性。
Sharon S. Musa, Fereshteh Forghani, Harrish Thasarathan 等
提出LRNBA架构,通过线性重用神经基实现参数高效压缩,训练稳定。
Binshuai Wang
NashDreamer利用集中式模型学习实现零和不完美信息博弈中的策略收敛,显著提升样本效率。
Tomáš Holeček, Viliam Lisý
中期训练中的知识蒸馏提升推理能力但减缓事实回忆,提出Switch Distillation方法。
Jacqueline He, Howard Yen, Shuyue Stella Li 等
Gekko通过比较交叉视图重建误差提升3D特征,无需3D标注,超越CroCo。
Thibaut Loiseau, Guillaume Bourmaud, Vincent Lepetit
VirSqueezer以SenseGlove、MPM和扩散模型生成细粒度挤压变形,但论文未报告具体数值指标。
Qian Zhang, Xiaoming Chen, Xiaorui Ma 等
基于行为树和环境模板的机器人自主 loco-manipulation 系统,实现快速、鲁棒、可调节的 humanoid 行为。
Duncan Calvert, Luigi Penco, Dexton Anderson 等
TempCloze通过视频中缺失中段识别,揭示视频时序推理的主要瓶颈在对齐能力。
Wenqi Pei, Henry Hengyuan Zhao, Yilai Liu 等