Inverse Entropic Optimal Transport Solves Semi-supervised Learning via Data Likelihood Maximization
提出EBiEOT结合半监督数据,通过逆熵最优传输实现条件分布最大化。
Mikhail Persiianov, Arip Asadulaev, Nikita Andreev 等
提出EBiEOT结合半监督数据,通过逆熵最优传输实现条件分布最大化。
Mikhail Persiianov, Arip Asadulaev, Nikita Andreev 等
自解释AI结合注意力机制提升医学图像分析透明度,覆盖200篇论文。
Junlin Hou, Sicen Liu, Yequan Bie 等
提出基于CTMC的离散扩散模型收敛界,KL误差线性增长,算法理论保证。
Zikun Zhang, Zixiang Chen, Quanquan Gu
提出基于梯度无关切割平面的方法,用于深度ReLU网络的主动学习,证明收敛性。
Erica Zhang, Fangzhao Zhang, Mert Pilanci
使用LLM增强的MetaScore数据集生成符号音乐,提供文本和标签控制。
Weihan Xu, Julian McAuley, Taylor Berg-Kirkpatrick 等
ExACT方法结合R-MCTS与探索性学习,在VisualWebArena基准上提升6%-30%。
Xiao Yu, Baolin Peng, Vineeth Vajipey 等
提出FeelAnyForce,通过多头Transformer实现视觉触觉传感器的3D接触力估计,误差4%。
Amir-Hossein Shahidzadeh, Gabriele Caddeo, Koushik Alapati 等
LS-HAR结合语言引导骨架和视觉特征,利用Salient Fusion提升施工现场人类动作识别准确率。
Mohammad Mahdavian, Mohammad Loni, Ted Samuelsson 等
引入矩阵版本的随机热方程(MSHE),在一维空间中获得其不变测度,展现其在弱噪声极限下的经典可积性。
Alexandre Krajenbrink, Pierre Le Doussal
Leopard模型解决多图像文本任务,超越Llama-3.2等,使用1.2M开源数据。
Mengzhao Jia, Wenhao Yu, Kaixin Ma 等
提出无训练的概率性猜测雅可比解码(SJD),在文本到图像生成中实现约2倍加速,保持图像质量。
Yao Teng, Han Shi, Xian Liu 等
提出CTDN方法,通过文本监督实现自我中心语义分割,显著提升精度。
Zhaofeng Shi, Heqian Qiu, Lanxiao Wang 等
提出VideoCLIP-XL,利用大规模长描述视频数据集和TPCM,显著提升视频长描述理解能力。
Jiapeng Wang, Chengyu Wang, Kunzhe Huang 等
提出ManiSkill3,GPU并行模拟与渲染,支持12类任务,提升速度至30,000FPS,显存降低2-3倍。
Stone Tao, Fanbo Xiang, Arth Shukla 等
提出COGIS,通过高斯过程隐式表面在线估算环境障碍,优化机器人操控。
Abhinav Kumar, Peter Mitrano, Dmitry Berenson
DeSTA2利用自动生成语音文本对,无需指令调优,提升语音理解能力。
Ke-Han Lu, Zhehuai Chen, Szu-Wei Fu 等
EndoDepth基准评估单目深度预测模型在内窥镜中的鲁棒性,提出mDERS指标和SCARED-C数据集。
Ivan Reyes-Amezcua, Ricardo Espinosa, Christian Daul 等
UniSumEval通过细粒度、多维度标注,评估9种最新LLM的摘要性能,填补现有基准不足。
Yuho Lee, Taewon Yun, Jason Cai 等
提出基于领域适应的反事实奖励模型,用于广告排序模型的离线评估,优于IPS和非泛化模型。
Mohamed A. Radwan, Himaghna Bhattacharjee, Quinn Lanners 等
基于人本设计的四足导盲机器人,结合强化学习与视觉模型,提升安全性与用户信任。
Hochul Hwang, Ken Suzuki, Nicholas A Giudice 等