Event-based Motion Deblurring via Multi-Temporal Granularity Fusion
MTGNet通过多时态粒度融合提升事件相机去模糊效果,超越现有方法。
Xiaopeng Lin, Hongwei Ren, Yulong Huang 等
MTGNet通过多时态粒度融合提升事件相机去模糊效果,超越现有方法。
Xiaopeng Lin, Hongwei Ren, Yulong Huang 等
本研究利用大规模语言模型(GPT-4 mini)在音乐实体识别任务中通过ICL实现优越性能,揭示实体曝光对模型表现的巨大影响。
Simon Hachmeier, Robert Jäschke
提出PEMC框架,结合ML预测与蒙特卡洛,显著降低方差,保持无偏性。
Fengpei Li, Haoxian Chen, Jiahe Lin 等
基于Rasa框架和机器翻译的低资源语言Wolof任务导向对话系统,达成意图分类性能与法语相当。
Derguene Mbaye, Moussa Diallo
提出熵正则化过程奖励模型(ER-PRM),结合KL正则化平衡策略优化,提升数学推理性能。
Hanning Zhang, Pengcheng Wang, Shizhe Diao 等
METIS通过联合调度和配置自适应,显著降低RAG响应延迟(1.64-2.54倍),同时保持高质量。
Siddhant Ray, Rui Pan, Zhuohan Gu 等
DEFAME采用六阶段动态多模态证据检索,超越传统文本方法,显著提升事实核查性能。
Tobias Braun, Mark Rothermel, Marcus Rohrbach 等
提出基于扩散模型的单RGB图像3D场景重建方法,提升AP3D 12.04%、F-Score 13.43%。
Manuel Dahnert, Angela Dai, Norman Müller 等
提出SARA护盾,基于可达性分析实现自主机器人在人类环境中的安全操控,确保接触能量低于伤害阈值。
Jakob Thumm, Julian Balletshofer, Leonardo Maglanoc 等
提出STILL-2框架,通过模仿、探索与自我提升训练慢思考推理系统,达成行业水平性能。
Yingqian Min, Zhipeng Chen, Jinhao Jiang 等
提出WaLLoC结合线性变换和非线性自编码器,实现高效压缩与压缩域学习,超越现有模型。
Dan Jacobellis, Neeraja J. Yadwadkar
提出Score与Distribution Matching方法,将扩散模型转化为单步生成器,提升6倍推理速度,保持优异动作质量。
Bofang Jia, Pengxiang Ding, Can Cui 等
phi-4为14亿参数模型,采用高质量合成数据和创新训练策略,显著超越教师模型GPT-4在STEM问答能力。
Marah Abdin, Jyoti Aneja, Harkirat Behl 等
FlowEdit以无反演ODE编辑SD3/FLUX,获SOTA
Vladimir Kulikov, Matan Kleiner, Inbar Huberman-Spiegelglas 等
Multi-GraspLLM通过多模态LLM生成多手语义引导的抓取姿势,显著提升准确性。
Haosheng Li, Weixin Mao, Weipeng Deng 等
FLIP利用流场生成与视频预测实现长远操控规划,显著提升成功率。
Chongkai Gao, Haozhuo Zhang, Zhixuan Xu 等
CogNav利用大语言模型模拟人类认知状态,显著提升ObjectNav成功率至少14%。
Yihan Cao, Jiazhao Zhang, Zhinan Yu 等
本研究将慢速双向视频扩散模型转化为快速自回归模型,显著提升生成速度和交互性。
Tianwei Yin, Qiang Zhang, Richard Zhang 等
提出基于CVAE的预测运动先验(PMP),实现高精度上肢控制与鲁棒下肢运动的解耦,显著提升 humanoid 机器人操控性能。
Chenhao Lu, Xuxin Cheng, Jialong Li 等
提出3DSRBench基准,评估LMM在复杂3D空间推理中的表现,涵盖2772个标注问答,揭示模型在高度、方向、位置等方面的局限。
Wufei Ma, Haoyu Chen, Guofeng Zhang 等