SubZero+: Efficient Zeroth-Order LLM Fine-Tuning via Large Learning Rates
SubZero+通过大学习率提升零阶优化稳定性,在SuperGLUE上优于现有基线。
Ziming Yu, Shuyao Xiao, Xingyu Zhao 等
SubZero+通过大学习率提升零阶优化稳定性,在SuperGLUE上优于现有基线。
Ziming Yu, Shuyao Xiao, Xingyu Zhao 等
ADMITOR通过无标签认证提高优化建模精度,候选精度达0.927。
Junbo Jacob Lian, Huiling Chen, Hanzhang Qin 等
提出同步感知稀疏注意机制,有效加速音视频生成,保持同步与质量。
Shengchuan Gao, Teng Hu, Bohao Feng 等
采用关联任务和陈述任务,验证模型对当前年份的编码,发现两者机制不同,更新困难。
Suze van Adrichem, Aditi Bhaskar, Diyi Yang 等
提出Q-First方法,仅需查询即可实现LLM解码中的注意力并行,验证误差3.2×10^-3。
WenJie Fan
提出多字预测(MBP)结合层次模型,利用变长窗口与注意力掩码提升推理速度,性能与吞吐达最优平衡。
Abraham Toluwase Owodunni, Chibuzor Okocha, Christan Grant 等
提出StructFlow,通过空间相关的噪声分布改善图像生成的局部结构和编辑能力。
Arman Zarei, Mahdi M. Kalayeh
本文揭示大型语言模型中的歧义之祸,分析其在模型容量、嵌入维度和学习难度上的根源,强调其在实际训练中的表现限制。
Nicolas Zucchet, Hyun Dong Lee, Scott Linderman
采用蜂群优化(BSO)进行特征选择,提升大规模无线传感器网络中外部陷洞攻击检测准确率至0.997,特征数从16降至8。
Seungwoo Han, Sawako Kitagata, Ingon Chanpornpakdi 等
提出了一种显式电路构造方法,能在O(d log d)时间内构建矩阵多项式的块编码。
Taehee Ko
提出统一骨干-专家框架,在RML2016.10b上达到67.28%的准确率。
Zhixiang Deng, Houbiao Li, Zongyong Cui
提出低秩动态有效潜在载体,通过单次干预实现自主反事实轨迹,验证Rank4载体在192维循环模型中的有效性。
Yang Liu, Yuming Chen
本研究通过192个人工语言和多样自然语言,比较解码器模型的词序偏好,发现人工语言偏左,自然语言偏右,数据驱动偏差明显。
Varvara Arzt, Allan Hanbury, Terra Blevins
FoT通过早期投票与路径修剪,减少28.8%推理成本,保持32轨道准确率。
Chanhee Park, Sungbin Han, Jeongho Yoon 等
MOSS-VL是一款支持实时交互的开源视觉-语言模型,采用门控交叉注意力实现感知与生成同步,参数11.3B。
Pengyu Wang, Chenkun Tan, Shaojun Zhou 等
S2-MoE通过路由感知自我投机扩展与专家重用优化边缘设备上的MoE推理,达成最高5.3×加速。
Haochen Huang, Shengxuan Qiu, Meng Li
本研究通过控制性评估不同记忆底层结构(如密集索引、结构存储等)在多模型、多任务中的性能差异,提出多样化记忆路由策略。
Wei-Chieh Huang, Weizhi Zhang, Yuchen Wu 等
提出影响校准(ICSD)改善自我蒸馏中的信任-效用失配,显著提升多任务性能。
Qizhen Lan, Xi Xiao, Xiangchen Guan 等
利用预训练扩散模型进行粒子能量缺失区域的贝叶斯修复,验证其统计校准。
Himanshu Raj, Roli Esha
本论文系统综述了大规模语言与视觉-语言模型的解码方法,强调其在提升生成质量、效率和控制能力方面的创新。
Haoran Wang, Xiongxiao Xu, Philip S. Yu 等