On the Comparison between Multi-modal and Single-modal Contrastive Learning
提出多模态与单模态对比学习的特征学习理论,强调信噪比(SNR)对泛化能力的影响。
Wei Huang, Andi Han, Yongqiang Chen 等
提出多模态与单模态对比学习的特征学习理论,强调信噪比(SNR)对泛化能力的影响。
Wei Huang, Andi Han, Yongqiang Chen 等
MM-Embed利用多模态大模型实现跨任务的普适检索,显著超越SOTA指标。
Sheng-Chieh Lin, Chankyu Lee, Mohammad Shoeybi 等
本论文提出一种基于预训练变换器的非线性低维目标函数学习方法,利用梯度优化实现对单指数模型的高效在语境学习,样本复杂度仅依赖目标函数的低维结构。
Kazusato Oko, Yujin Song, Taiji Suzuki 等
提出可变长度图像标记器,通过递归分配实现图像压缩,范围32-256个标记。
Shivam Duggal, Phillip Isola, Antonio Torralba 等
CRMArena通过模拟真实CRM环境,评估LLM代理在九项专业任务中的表现,发现最优模型成功率不足58%。
Kung-Hsiang Huang, Akshara Prabhakar, Sidharth Dhawan 等
Hunyuan-Large是腾讯开源的MoE模型,拥有52亿激活参数,处理256K tokens。
Xingwu Sun, Yanfeng Chen, Yiqing Huang 等
提出SlowFast框架结合状态空间模型,实现2ms低延迟语音增强,计算降低70%。
Longbiao Cheng, Ashutosh Pandey, Buye Xu 等
TAMA利用大规模多模态模型实现少样本时间序列异常检测,提升准确率。
Jiaxin Zhuang, Leon Yan, Zhenwei Zhang 等
提出基于强化学习的层级分解证明方法ProD-RL,提升自动定理证明成功率。
Kefan Dong, Arvind Mahankali, Tengyu Ma
提出以任务能力和资源限制为界的定义,分析SLMs技术、应用及未来方向。
Fali Wang, Zhiwei Zhang, Xianren Zhang 等
通过知识连续性实现领域无关的认证鲁棒性,独立于输入域。
Alan Sun, Chiyu Ma, Kenneth Ge 等
引入“多样性进展”方法,提升RL目标选择,快速学习可区分技能。
Erik M. Lintunen, Nadia M. Ady, Christian Guckelsberger
提出outer-PPO,通过非单位学习率和动量提升策略改善PPO性能。
Charlie B. Tan, Edan Toledo, Benjamin Ellis 等
提出一种解析型方法,通过有限维近似学习未知连续时间动力系统的生成器。
Yiming Meng, Ruikun Zhou, Melkior Ornik 等
提出EVSNet,通过运动提取与融合实现低光环境下视频语义分割,参数效率提升11倍。
Zhen Yao, Mooi Choo Chuah
研究揭示视觉语言模型在多对象推理任务中的局限性,归因于绑定问题。
Declan Campbell, Sunayana Rane, Tyler Giallanza 等
EgoMimic通过结合人类自我视角视频与3D手部追踪,利用跨域对齐和联合训练实现操控任务性能提升34-228%。
Simar Kareer, Dhruv Patel, Ryan Punamiya 等
本研究利用多样化和信息丰富的语言反馈提升离线强化学习中仿生代理的任务泛化能力。
Jiajun Xi, Yinong He, Jianing Yang 等
TabM利用参数高效集成MLP,显著提升表格数据深度学习性能。
Yury Gorishniy, Akim Kotelnikov, Artem Babenko
NoPoSplat模型从稀疏无姿态图像中实时重建3D高斯场景,超越需姿态方法。
Botao Ye, Sifei Liu, Haofei Xu 等