F2LLM-v2: Inclusive, Performant, and Efficient Embeddings for a Multilingual World
F2LLM-v2通过两阶段训练和套娃学习,提供高效多语言嵌入,支持200多种语言。
Ziyin Zhang, Zihan Liao, Hang Yu 等
F2LLM-v2通过两阶段训练和套娃学习,提供高效多语言嵌入,支持200多种语言。
Ziyin Zhang, Zihan Liao, Hang Yu 等
基于光谱特性的逐像素扩散噪声调度提高了低步数生成质量。
Carlos Esteves, Ameesh Makadia
提出了一种在排名反馈下进行在线学习的新算法,解决了传统数值反馈缺失的问题。
Mingyang Liu, Yongshan Chen, Zhiyuan Fan 等
Nemotron-Cascade 2通过级联RL和多域策略蒸馏在30B MoE模型中实现了顶级推理能力。
Zhuolin Yang, Zihan Liu, Yang Chen 等
DriveTok通过3D可变形交叉注意力实现多视角重建和理解,在nuScenes数据集上表现出色。
Dong Zhuo, Wenzhao Zheng, Sicheng Zuo 等
DreamPartGen通过协同潜在去噪实现语义基础的部分级3D生成,几何保真度提高53%。
Tianjiao Yu, Xinzhuo Li, Muntasir Wahed 等
研究发现状态空间模型(SSM)作为视觉编码器在VLM中表现优于视觉变压器(ViT),尤其在VQA和定位任务中。
Shang-Jui Ray Kuo, Paola Cascante-Bonilla
通过成本感知的规避框架研究钓鱼检测中的鲁棒性,最小规避成本为2,80%以上的攻击集中在三个低成本特征上。
Julian Allagan, Mohamed Elbakary, Zohreh Safari 等
OmniVTA结合预测接触建模与高频触觉反馈,实现接触丰富操控任务的突破。
Yuhang Zheng, Songen Gu, Weize Li 等
FASTER通过引入Horizon-Aware Schedule,显著减少反应延迟,提升VLA模型实时性。
Yuxiang Lu, Zhe Liu, Xianzhe Fan 等
研究探讨LLM在音频语言模型中的听觉知识编码,揭示文本训练对音频性能的影响。
Ke-Han Lu, Szu-Wei Fu, Chao-Han Huck Yang 等
OS-Themis框架在AndroidWorld上提升10.3%,通过多代理批判机制优化GUI奖励。
Zehao Li, Zhenyu Wu, Yibo Zhao 等
稀疏自编码器揭示VLA模型中的可解释和可操控特征,提升模型在LIBERO基准上的泛化能力。
Aiden Swann, Lachlain McGranahan, Hugo Buurmeijer 等
Box Maze框架通过内存锚定、结构化推理和边界执行三层结构,显著降低LLM推理错误率至1%。
Zou Qiang
基于ADMM的分布式MPC框架结合控制障碍函数,实现四足机器人安全运动,规划时间减少51%。
Yicheng Zeng, Ruturaj S. Sambhus, Basit Muhammad Imran 等
ARIADNE利用DPO和RL实现冠状动脉造影分析,中心线Dice达到0.838。
Zhan Jin, Yu Luo, Yizhou Zhang 等
MAPG通过多代理概率推理实现视觉语言导航中的度量语义目标定位,在HM-EQA基准上表现优异。
Swagat Padhan, Lakshya Jain, Bhavya Minesh Shah 等
PPI估计器与Cassel等人的差异估计器等价,结合机器学习预测和少量标签进行统计推断。
Reagan Mozer
VEPO通过可验证奖励的强化学习提升低资源语言模型的翻译质量和分词效率。
Chonghan Liu, Yimin Du, Qi An 等
通过Fredholm积分方程构建Karhunen-Loève展开,结合SVD实现一致解。
Cosmin Safta, Habib N. Najm