LiDAR Prompted Spatio-Temporal Multi-View Stereo for Autonomous Driving
DriveMVS利用稀疏LiDAR作为几何提示,融合多源信息实现高精度、多视角和时序一致的自主驾驶深度估计。
Qihao Sun, Jiarun Liu, Ziqian Ni 等
DriveMVS利用稀疏LiDAR作为几何提示,融合多源信息实现高精度、多视角和时序一致的自主驾驶深度估计。
Qihao Sun, Jiarun Liu, Ziqian Ni 等
InfinityStory以背景一致与多主体转场实现长视频生成,VBench达88.94/82.11。
Mohamed Elmoghany, Liangbing Zhao, Xiaoqian Shen 等
SafeCRS通过Safe-SFT和Safe-GDPO实现个性化安全对齐,显著降低安全违规率。
Haochang Hao, Yifan Xu, Xinzhuo Li 等
提出PhyPrompt,基于RL的两阶段提示优化框架,提升物理合理性,7B模型实现40.8%联合成功率。
Shang Wu, Chenwei Xu, Zhuofan Xia 等
BeyondSWE基准评估代码智能在跨仓库、领域知识、依赖迁移和文档生成中的表现,最佳模型仅达56.65分。
Guoxin Chen, Fanzhe Meng, Jiale Zhao 等
MoD-DPO通过解耦模态优化减少跨模态幻觉,提升准确率至88.19%。
Ashutosh Chaubey, Jiacheng Pang, Mohammad Soleymani
通过区分声学和期望相关的神经网络表示,提升了基于EEG的音乐识别准确率。
Shogo Noguchi, Taketo Akama, Tai Nakamura 等
提出RL3DEdit,通过强化学习利用VGGT奖励实现多视角一致的3D场景编辑,提升效率与质量。
Jiyuan Wang, Chunyu Lin, Lei Sun 等
本文系统分析了多种块级缓存(CLC)策略的局限性与互补性,提出结合技术提升准确率。
Samuel Cestola, Tianxiang Xia, Zheng Weiyan 等
HRL4PFG利用分层强化学习提高推荐系统中的长尾物品曝光公平性,显著提升用户互动奖励。
Chongjun Xia, Xiaoyu Shi, Hong Xie 等
Retrievit结合Transformer和SSM实现高效上下文检索,提升数据效率。
Georgios Pantazopoulos, Malvina Nikandrou, Ioannis Konstas 等
提出BrandFusion多智能体框架,实现文本生成视频中的品牌无缝嵌入,提升识别度和自然性。
Zihao Zhu, Ruotong Wang, Siwei Lyu 等
ITO通过多重对齐和训练时融合提高图像-文本表示,超越现有基线。
Hanpeng Liu, Yaqian Li, Zidan Wang 等
EvoSkill通过迭代故障分析自动发现和优化多智能体系统中的技能,提升准确率7.3%至12.1%。
Salaheddin Alzubi, Noah Provenzano, Jaydon Bingham 等
提出ADR-VINS,基于误差状态卡尔曼滤波的单目视觉惯性融合,最低两角点实现鲁棒状态估计,平均平移误差0.143米。
Maulana Bisyir Azhari, Donghun Han, Sung Jun Park 等
CPC用保守策略校准似然比,有限样本控制新策略风险并支持安全探索。
Drew Prinster, Clara Fannjiang, Ji Won Park 等
提出策略引导探索(SGE),通过生成高层次自然语言策略提升LLM在复杂任务中的探索效率。
Andrew Szot, Michael Kirchhof, Omar Attia 等
LAD-Drive通过动作感知扩散变换器,将语言与轨迹结合,驾驶评分提高59%。
Fabian Schmidt, Karol Fedurko, Markus Enzweiler 等
提出基于张量分解的高效评估方法,结合自动评分与少量人工标注,显著提高生成模型的细粒度评估能力。
Felipe Maia Polo, Aida Nematzadeh, Virginia Aglietti 等
模块化记忆结合IWL和ICL,解决持续学习中的遗忘问题。
Vaggelis Dorovatas, Malte Schwerin, Andrew D. Bagdanov 等