FlowVLA: Visual Chain of Thought-based Motion Reasoning for Vision-Language-Action Models
FlowVLA引入视觉思维链,通过显式运动推理提升机器人视觉-语言-动作模型性能。
Zhide Zhong, Haodong Yan, Junfeng Li 等
FlowVLA引入视觉思维链,通过显式运动推理提升机器人视觉-语言-动作模型性能。
Zhide Zhong, Haodong Yan, Junfeng Li 等
提出HLLM-Creator,基于层次大模型实现个性化创意生成,提升效率和准确性。
Junyi Chen, Lu Chi, Siliang Xu 等
Pandora利用Python Pandas实现统一结构化知识推理,提升跨任务性能。
Yongrui Chen, Junhao He, Linbo Fu 等
JCo-MVTON通过多模态扩散变换器实现无掩码虚拟试穿,DressCode数据集上性能领先。
Aowen Wang, Wei Li, Hao Luo 等
提出UQ评估模型在未解决问题上的能力,涵盖500个多样化高难度题目,结合社区验证实现持续评估。
Fan Nie, Ken Ziyu Liu, Zihao Wang 等
音乐生成评价缺乏标准化,提出详细分类法和未来研究方向。
Faria Binte Kader, Santu Karmaker
CMASE结合生成代理模型与虚拟民族志,实现实时人机交互与社会机制干预。
Hanzhong Zhang, Muhua Huang, Jindong Wang
UniGen框架通过CoMoE模块和WeaveNet机制实现高效可控图像生成,在Subjects-200K和MultiGen-20M数据集上表现优异。
Guoqing Zhang, Xingtong Ge, Lu Shi 等
CORE-RAG通过性能驱动的上下文压缩,在压缩比例仅3%的情况下,提升EM得分3.3点,超越全文使用。
Ziqiang Cui, Yunpeng Weng, Xing Tang 等
PowerChain用可验证DAG代理自动化配电网分析,性能最高提升约144%。
Emmanuel O. Badmus, Peng Sang, Dimitrios Stamoulis 等
提出PREMIR框架,通过跨模态预问生成实现零样本文档检索,显著优于现有基线。
Yejin Choi, Jaewoo Park, Janghan Yoon 等
提出基于实体导向搜索的表理解方法,显著提升在WikiTableQuestions和TabFact上的性能。
Thi-Nhung Nguyen, Hoang Ngo, Dinh Phung 等
LHM-Humanoid实现了在复杂场景中连续搬运物体的长时间人类运动控制,成功率显著高于基线。
Haozhuo Zhang, Jingkai Sun, Michele Caprio 等
MV-RAG结合检索与多视图扩散,有效提升出域概念的3D生成质量。
Yosef Dayani, Omer Benishu, Sagie Benaim
提出谱表示法扩展插值空间的定义,分析其谱结构和嵌入性质,应用于统计学习误差估计。
Michael Bitzer, Ingo Steinwart
OPERA结合强化学习的规划-执行架构,显著提升多跳推理检索性能,达成57.3%的HotpotQA EM。
Yu Liu, Yanbing Liu, Fangfang Yuan 等
GelSLAM利用触觉表面法线和曲率实现实时高精度长时长物体追踪与三维重建。
Hung-Jui Huang, Mohammad Amin Mirzaee, Michael Kaess 等
HRES数值模型在预测极端天气方面优于AI模型,尤其是破纪录事件。
Zhongwei Zhang, Erich Fischer, Jakob Zscheischler 等
StreamMem采用无查询依赖的KV缓存压缩,提升长视频理解效率,保持固定内存规模。
Yanlai Yang, Zhuokai Zhao, Satya Narayan Shukla 等
提出一种全归纳的SBI方法,结合mini-batch OT与条件正则流,解决模型失配问题。
Ortal Senouf, Antoine Wehenkel, Cédric Vincent-Cuaz 等