SubZero+: Efficient Zeroth-Order LLM Fine-Tuning via Large Learning Rates
SubZero+通过大学习率提升零阶优化稳定性,在SuperGLUE上优于现有基线。
Ziming Yu, Shuyao Xiao, Xingyu Zhao 等
SubZero+通过大学习率提升零阶优化稳定性,在SuperGLUE上优于现有基线。
Ziming Yu, Shuyao Xiao, Xingyu Zhao 等
提出AATC,通过变换编码实现KV缓存压缩,达5.8×无损效果。
Hannah Laus, Claudio Mayrink Verdun, Hao Wang 等
提出CForce,通过一致性强制提升dLLMs的早期预测可靠性,显著改善高并行解码性能。
Yuji Ren, Chenkai Xu, Zhuocheng Gong 等
提出基于事件驱动Transformer的多仓库动态车辆路径优化框架,结合行为克隆与PPO训练,显著提升调度稳定性。
Faezeh Ardali, Gerald M. Knapp
Vero基准评估AI在多模块仓库中联合实现与验证能力,43个实例中最强模型仅解决27个。
Zhe Ye, Hantao Lou, Yuechun Sun 等
提出一种基于结构化潜在状态的干预感知临床世界模型,用于心脏手术后长期复发风险预测,在DECAAF-II数据集上实现AUROC 0.756。
Yunsung Chung, Yingshuo Liu, Abboud F. Hassan 等
通过SbCD模型,利用马尔可夫跳跃扩散生成完整晶体结构,在MP20上表现优异。
Van Khoa Nguyen, Alexandros Kalousis
提出LOPD,将教师的特权上下文由固定转为可端到端学习,显著提升多任务性能。
Guibin Zhang, Jiayang Lyu, Ran Sun 等
引入动作条件预测一致性(ACPC)诊断JEPA世界模型的鲁棒性,验证其对视觉扰动的敏感性。
Guo An, Zijing Wu, Honghua Dong 等
提出WMRL,通过世界模型替代环境执行,提升自动研究代理训练速度3-4倍,超越标准RL。
Xiyuan Yang, Sheikh Sarwar, Jingru Cheng 等
提出一种基于目标、特征到人类对齐奖励函数的设计框架,结合因果关系和偏好查询,确保无冲突的线性奖励参数空间。
Di Yang Shi, W. Bradley Knox
提出一种高效近似最优的对抗性m-集合多臂赌博算法,保证在d维空间中以O(√dT log(K/δ))的高概率遗憾界,避免指数空间复杂度。
Francesco Bacchiocchi, Tommaso Cesari, Roberto Colomboni
ScreenShot采用层次Transformer模型,基于40个药物筛选数据集,支持少样本预测和主动学习,显著提升组合药物筛选效率。
Antoine de Mathelin, Christopher Tosh, Wesley Tansey
MARCH通过内容路由机制扩展长序列记忆,提升长距离依赖捕获能力。
Ming Zhang, Kaisen Yang, Shu Yu 等
提出低交互秩函数框架,统一多模态双编码器设计,验证谱衰减与正则化效果。
Zijian Zhao, Sen Li
使用Transformer和贝叶斯神经网络的因果优化框架提升推荐系统增量效果,提升7.20%。
Changshuai Wei, John Bencina, Phuc Nguyen 等
Macaron-V1结合Mixture-of-LoRA架构,实现开放式持续学习,提升模型自我改进能力。
Mind Lab, :, Vin Bo 等
本研究展示随机变换器通过软提示实现泛化逼近,无需训练,结合核方法提供理论保证。
Alexander Hsu, Rongjie Lai
提出TrackEFG算法,达成切换遗憾$ ilde{O}((1/ρ+ρK)√HAT)$,每轮复杂度仅为$O(HB)$。
Stephen Pasteris, Rahul Savani, Theodore Turocy
本研究对五种梯度优化器(SGD、Adam、Adagrad、Adadelta、CGD)在三种内存策略(标准、检查点、累积)下,结合四种变换器架构(ViT、ModernBERT、Llama 3.1 1B、NanoVLM)进行性能 benchmarking,发现梯度累积最具鲁棒性,优化器表现因架构而异。
Sarthak Mahapatra, Zihan Zhou, Khatoon Khedri 等