TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs
TimeLens2通过多模态大语言模型实现长视频多区域时间定位,采用基于Wasserstein距离的奖励机制,显著优于现有模型。
Yuhan Zhu, Changlian Ma, Xiangyu Zeng 等
TimeLens2通过多模态大语言模型实现长视频多区域时间定位,采用基于Wasserstein距离的奖励机制,显著优于现有模型。
Yuhan Zhu, Changlian Ma, Xiangyu Zeng 等
EditCLEVR: 提供对象中心表示的组合忠实性基准,评估语义编辑后的表现。
Anuraag Gadehothur Karnam, Tarunesh Sathish
CoDID通过迭代模式发现和元优化协调机制实现了在隐藏相关性下的解缠学习,准确率提升7.8%。
Rong Hu, Ling Chen
本研究系统评估了基于LoRA的代码代理轨迹数据筛选方法,发现数据量对模型性能影响更大。
Yunze Han
引入干预中心的自动科研方法,通过独立轴搜索与外部验证实现材料机器学习决策的可验证性,提升外部转移成功率。
Jingjie Ning, Xiaochuan Li, Shanshan Zhong 等
提出ParaCAD,基于自回归模型直接生成支持原生参数曲面的B-Rep,提升几何精度。
Dafei Qin, Rui Xu, Zeyu Shen 等
WHALE模型结合Wukong和HSTU架构,在大规模推荐中提升性能。
Renqin Cai, Dawei Sun, Yuanjun Yao 等
提出Prim-Dijkstra路由的弱NP完全性,构建高度平衡的(2,2)保证算法HP-RCRST,显著优于现有方法。
Keren Zhu
提出PSDPO方法,在VideoPhy-2上物理合理性提升至2倍,同时保持VBench上的语义一致性。
Siwei Meng, Yawei Luo, Shu Zhang 等
提出跨分支冲突保护框架CCS,有效阻止面部身份被未授权编辑,提升保护强度。
Weiwei Tan, Junxian Li, Rui Wang 等
提出基于图注意网络的深度强化学习算法解决含随机需求与外包的车辆路径问题VRP-SDO。
Mohsen Dastpak, Fausto Errico, Ola Jabali
提出SPARK-VLN,通过逐词流式提取隐藏状态,提升动态社会视觉-语言导航的反应速度与安全性。
Tianshuai Hu, Yangyi Zhong, Zeying Gong 等
Scene-SAM3D在不需微调的情况下,提升多视角3D场景生成质量,Replica数据集上CD减少43.8%。
Yuqi Zhang, Yadan Luo, Xiangyu Sun 等
本研究提出区分客观正确性(OC)与自我判断(SJ),发现SJ方向在跨域迁移中表现优于OC,揭示语义模糊性。
Yi-Long Lu
MultiLoReFT通过低秩表示微调解耦多模态共享与特定信息,提升预测性能与可解释性。
Sana Tonekaboni, Viktoria Schuster, Caroline Uhler
提出基于奇异值分解的训练无关真理方向,揭示知识依赖的维度变化,验证其在多模型中的关系规律。
Francesco Karim Vicidomini
提出多样性导向微调策略(SFT和DPO),提升模型在语义熵检测中的假象识别能力。
Qiuyuan Li, Hongliang Dai, Piji Li
提出PAVXploreRL,通过奖励驱动训练显式优化物理合理性、动作遵循和视觉保真,提升世界模型性能。
Han Wang, Zijun Wang, Shuoshuo Xue 等
基于耦合神经形状(CNS)表示的类别无关3D编辑框架,结合神经特征体积优化。
Jingyu Hu, Weilong Yan, Zhengzhe Liu 等
提出TTCov在部署场景中通过测试条件数据筛选提升自主驾驶性能,显著优于基线。
Nadine Chang, Maying Shen, Shizhe Diao 等