ScaMo: Exploring the Scaling Law in Autoregressive Motion Generation Model
提出ScaMo框架,验证运动生成中的缩放定律,模型规模与性能呈对数关系。
Shunlin Lu, Jingbo Wang, Zeyu Lu 等
提出ScaMo框架,验证运动生成中的缩放定律,模型规模与性能呈对数关系。
Shunlin Lu, Jingbo Wang, Zeyu Lu 等
基于24人质性研讨与系统梳理,论文提出LLM4SE的26项挑战框架。
Cuiyun Gao, Xing Hu, Shan Gao 等
提出PA-RAG,通过多视角偏好优化,提升RAG生成器在信息完整性、鲁棒性和引用质量上的表现,实验显示平均提升13.97%。
Jiayi Wu, Hengyi Cai, Lingyong Yan 等
提出VSI-Bench基准,利用视频数据评估多模态大模型的空间推理能力,模型表现次于人类。
Jihan Yang, Shusheng Yang, Anjali W. Gupta 等
提出VideoDPO,通过OmniScore实现视频生成的偏好对齐,显著提升视觉质量与语义一致性。
Runtao Liu, Haoyu Wu, Zheng Ziqiang 等
提出MetaMorph,通过VPiT实现单一模型同时进行视觉理解与生成,性能优越。
Shengbang Tong, David Fan, Jiachen Zhu 等
Rango利用检索增强的自动证明,结合项目相关证明提升自动化水平,达成32%的证明成功率。
Kyle Thompson, Nuno Saavedra, Pedro Carrott 等
InstructSeg结合多模态大语言模型,统一实现图像与视频的指令引导视觉分割,显著优于现有方法。
Cong Wei, Yujie Zhong, Haoxian Tan 等
本文综述了专家混合模型的推理优化技术,涵盖模型、系统和硬件层面的创新。
Jiacheng Liu, Peng Tang, Wenfeng Wang 等
Mix-LN结合Pre-LN和Post-LN,提升深层LLM性能,实验表明在70M到7B模型上表现优异。
Pengxiang Li, Lu Yin, Shiwei Liu
提出开放阿拉伯语ASR排行榜,评估多方言模型,揭示通用性。
Yingzhi Wang, Anas Alhmoud, Muhammad Alqurishi
提出RAG-RewardBench,系统评估45个奖励模型在多场景下的表现,揭示现有模型在偏好对齐方面的局限。
Zhuoran Jin, Hongbang Yuan, Tianyi Men 等
提出基于目标对象、嵌入和VLM的自动图像转化评估指标,达成0.55-0.87的段落级相关性。
Simran Khanuja, Vivek Iyer, Claire He 等
提出Policy Decorator,模型无关的在线微调框架,提升大规模模仿学习策略性能。
Xiu Yuan, Tongzhou Mu, Stone Tao 等
Exbody2采用自动筛选数据和教师-学生策略,实现人形机器人动态表达,追踪误差显著优于现有方法。
Mazeyu Ji, Xuanbin Peng, Fangchen Liu 等
通过图混合分析,揭示去中心化学习中模型交换策略与图结构对会员推断攻击的影响。
Ousmane Touat, Jezekael Brunon, Yacine Belal 等
推荐系统中的遗忘研究,探讨消除特定训练数据记忆的方法和挑战。
Yuyuan Li, Xiaohua Feng, Chaochao Chen 等
CG-Bench是长视频理解的线索问答基准,包含12,129个QA对。
Guo Chen, Yicheng Liu, Yifei Huang 等
提出多模态大语言模型的数学推理能力评估,涵盖基准、方法与挑战。
Yibo Yan, Jiamin Su, Jianxiang He 等
提出了一种通过视觉自对话生成理由的程序错误检测方法,显著提高了透明度和连贯性。
Shane Storks, Itamar Bar-Yossef, Yayuan Li 等