Training Language Model to Critique for Better Refinement
提出RCO框架,通过 refinement信号训练批评模型,显著提升多任务评价性能。
Tianshu Yu, Chao Xiang, Mingchuan Yang 等
提出RCO框架,通过 refinement信号训练批评模型,显著提升多任务评价性能。
Tianshu Yu, Chao Xiang, Mingchuan Yang 等
基于随机非互惠相互作用的群体行为模型,发现全局有序与局部集聚现象,揭示复杂集体动力学机制。
Jiwon Choi, Jae Dong Noh, Heiko Rieger
StableCodec实现单步扩散极低比特率图像压缩,FID达7.2,速度媲美传统编码。
Tianyu Zhang, Xin Luo, Li Li 等
提出Image2Net,结合多样数据集和NED评估,实现复杂模拟电路图到网表的高效转换,成功率达80.77%。
Haohang Xu, Chengjie Liu, Qihang Wang 等
ARAG结合多智能体机制,通过用户理解、语义对齐、上下文总结和排序实现个性化推荐,提升NDCG@5至42.1%。
Reza Yousefi Maragheh, Pratheek Vadla, Priyank Gupta 等
DIVE采用迭代推理结合语义分解,在CVRR-ES基准中达81.44%准确率,夺冠。
Umihiro Kamoto, Tatsuya Ishibashi, Noriyuki Kugo
提出IHRUT网络,通过物理退化模型生成数据集并实现干涉高光谱图像重建,PSNR提升36.04dB。
Yuansheng Li, Yunhao Zou, Linwei Chen 等
引入Mind2Web 2基准,结合Agent-as-a-Judge评估130个长时域、真实场景任务,达50-70%人类水平。
Boyu Gou, Zanming Huang, Yuting Ning 等
TR²C以MCR²和时间连续性联合学习表示与亲和矩阵,在五个数据集上达到最高97.96% ACC和98.96% NMI。
Xianghan Meng, Zhengyu Tong, Zhiyuan Huang 等
DFVEdit利用条件差分流向量实现视频零-shot编辑,提升20倍速度,减少85%内存。
Lingling Cai, Kang Zhao, Hangjie Yuan 等
提出基于人类运动学习理论的VLA模型后训练方法,涵盖感知、认知、任务理解与多模态整合。
Tian-Yu Xiang, Ao-Qun Jin, Xiao-Hu Zhou 等
提出FineWeb2数据管线,支持任何语言的预训练数据自动过滤与去重,提升多语模型性能。
Guilherme Penedo, Hynek Kydlíček, Vinko Sabolčec 等
认知模型揭示语言模型中的价值权衡,使用RSA模型分析礼貌言语。
Sonia K. Murthy, Rosie Zhao, Jennifer Hu 等
分析两塔模型的可识别性与偏差影响,提出样本加权缓解偏差。
Philipp Hager, Onno Zoeter, Maarten de Rijke
Mobile-R1通过系统训练提升VLM移动代理的交互能力,显著提高探索与自我纠正能力。
Jihao Gu, Qihang Ai, Yingyao Wang 等
提出多视角软标签模型,提升NLP中主观任务的包容性与性能。
Benedetta Muscato, Lucia Passaro, Gizem Gezici 等
AdaDeDup结合密度与模型反馈,实现大规模目标检测数据的自适应剪枝,有效减少20%数据,性能几乎不变。
Feiyang Kang, Nadine Chang, Maying Shen 等
本研究分析LLM社会模拟的行为多样性限制,强调边界设定的重要性。
Zengqing Wu, Run Peng, Takayuki Ito 等
使用虚拟内存技术实现3D高斯喷溅的大规模场景实时渲染,显著减少内存使用。
Jonathan Haberl, Philipp Fleck, Clemens Arth
提出Surfel-Indexed View Memory(VMem)实现长时场景一致性,提升视频生成效率。
Runjia Li, Philip Torr, Andrea Vedaldi 等