Rate analysis of dual averaging for nonconvex distributed optimization
提出非凸分布式优化的双重平均算法,证明收敛速率为O(1/t),适用于随机通信网络。
Changxin Liu, Xuyang Wu, Xinlei Yi 等
提出非凸分布式优化的双重平均算法,证明收敛速率为O(1/t),适用于随机通信网络。
Changxin Liu, Xuyang Wu, Xinlei Yi 等
提出CRINGE损失,通过负例对比提升模型安全性和一致性,实验显示优于多项基线。
Leonard Adolphs, Tianyu Gao, Jing Xu 等
提出统一的深度匹配模型,结合Transformer实现光流、立体匹配与深度估计,显著提升性能。
Haofei Xu, Jing Zhang, Jianfei Cai 等
提出基于深度学习的时间序列异常检测模型分类体系,涵盖预测、重建、表示与混合方法。
Zahra Zamanzadeh Darban, Geoffrey I. Webb, Shirui Pan 等
提出多维分区策略优化TPU v4上大规模Transformer推理,显著提升效率。
Reiner Pope, Sholto Douglas, Aakanksha Chowdhery 等
BLOOM为176B参数的开源多语种大模型,采用Transformer架构,训练于ROOTS语料库,性能优异。
BigScience Workshop, :, Teven Le Scao 等
PASTA通过句子-表格填空预训练,利用6类操作任务,显著提升表格事实验证性能,达成85.6%准确率。
Zihui Gu, Ju Fan, Nan Tang 等
使用教师强制和课程学习提高FNO和UNet模型的准确性超过50%。
Lalit Ghule, Rishikesh Ranade, Jay Pathak
基于CFEAR的雷达里程计,融合运动补偿和多扫描匹配,实现高精度大规模定位。
Daniel Adolfsson, Martin Magnusson, Anas Alhashimi 等
Waveformer采用扩张因果卷积和Transformer,实时提取目标声源,提升SI-SNRi达3.3dB。
Bandhav Veluri, Justin Chan, Malek Itani 等
DPM-Solver++:基于数据预测的高阶快速引导采样器,15步内生成高质量图像。
Cheng Lu, Yuhao Zhou, Fan Bao 等
提出LADDER框架,自动从CTI报告中提取攻击模式,结合MITRE ATT&CK分类。
Md Tanvirul Alam, Dipkamal Bhusal, Youngja Park 等
自我纠正方法提高序列生成质量,数学程序合成正确率提升99%。
Sean Welleck, Ximing Lu, Peter West 等
SSD-LM是一种基于扩散的语言模型,在文本生成和模块化控制上表现优异。
Xiaochuang Han, Sachin Kumar, Yulia Tsvetkov
GPTQ是一种基于二阶信息的单次量化方法,可将1750亿参数模型压缩至4比特,保持高精度。
Elias Frantar, Saleh Ashkboos, Torsten Hoefler 等
CoRe方法通过合作推理提升数学题解决能力,提升9.6%。
Xinyu Zhu, Junjie Wang, Lin Zhang 等
提出自适应物理信息神经算子,最大相对误差4.5%,加速一倍。
Ivan Zanardi, Simone Venturi, Marco Panesi
本文系统综述了基于深度神经网络(DNN)求解偏微分方程(PDEs)的方法,涵盖PINNs、Neural Operators等,强调其算法机制与应用潜力。
Shudong Huang, Wentao Feng, Chenwei Tang 等
提出对比解码(Contrastive Decoding, CD),利用大模型与小模型的概率差异优化文本生成,显著提升文本质量。
Xiang Lisa Li, Ari Holtzman, Daniel Fried 等
引入6.5TB规模的DiffusionDB,分析文本提示与生成模型关系,揭示模型误差与潜在滥用。
Zijie J. Wang, Evan Montoya, David Munechika 等