Unlocking Efficiency in Large Language Model Inference: A Comprehensive Survey of Speculative Decoding
提出推测解码(Speculative Decoding)以提升大规模语言模型推理效率,结合draft-verify策略实现约5倍加速。
Heming Xia, Zhe Yang, Qingxiu Dong 等
提出推测解码(Speculative Decoding)以提升大规模语言模型推理效率,结合draft-verify策略实现约5倍加速。
Heming Xia, Zhe Yang, Qingxiu Dong 等
利用大规模语言模型(GPT-3.5、GPT-4、DepGPT)结合深度学习和Transformer模型,精准检测孟加拉语社交媒体中的抑郁文本。
Ahmadul Karim Chowdhury, Md. Saidur Rahman Sujon, Md. Shirajus Salekin Shafi 等
提出桥接模型BGM,利用监督和强化学习优化检索器与LLMs的连接,显著提升问答和个性化生成性能。
Zixuan Ke, Weize Kong, Cheng Li 等
本研究揭示多模态大模型在视觉理解中的系统性短板,提出结合自监督特征的混合方法以提升视觉定位。
Shengbang Tong, Zhuang Liu, Yuexiang Zhai 等
DeepSeekMoE通过细分专家和共享专家隔离,实现了专家的终极专精,性能接近密集模型。
Damai Dai, Chengqi Deng, Chenggang Zhao 等
EASYTOOL通过提取工具文档核心信息,生成简洁统一的工具指令,提升LLM工具利用效率。
Siyu Yuan, Kaitao Song, Jiangjie Chen 等
调查NLP在方言数据集上的表现,提出改进方法。
Aditya Joshi, Raj Dabre, Diptesh Kanojia 等
提出马尔可夫鞅Schrödinger桥,利用潜在函数实现最小相对熵耦合
Marcel Nutz, Johannes Wiesel
CTNeRF结合时频域特征聚合,提升动态场景单目视频的高质量新视角生成。
Xingyu Miao, Yang Bai, Haoran Duan 等
MAGNeT采用单阶段非自回归Transformer进行音频生成,速度提升7倍。
Alon Ziv, Itai Gat, Gael Le Lan 等
提出基于动态规划的最优生存树SurTree,保证全局最优,提升可扩展性。
Tim Huisman, Jacobus G. M. van der Linden, Emir Demirović
利用Marabou验证Airbus跑道目标分类DNN的鲁棒性,发现对噪声最敏感。
Yizhak Elboher, Raya Elsaleh, Omri Isac 等
提出DRFR指标和InFoBench基准,评估大模型指令遵循能力,显著提升评估可靠性。
Yiwei Qin, Kaiqiang Song, Yebowen Hu 等
提出Activation Beacon,通过逐步压缩激活实现长文本高效处理,压缩比最高达8倍。
Peitian Zhang, Zheng Liu, Shitao Xiao 等
GRAM方法在多页文档VQA中实现了73.68%的ANLS,提升了处理长序列的效率。
Tsachi Blau, Sharon Fogel, Roi Ronen 等
DeepSeek LLM通过扩展开源语言模型,67B模型在代码、数学和推理上超越LLaMA-2 70B。
DeepSeek-AI, :, Xiao Bi 等
提出LLM与Tulving记忆理论的二元性假设,探讨意识作为一种涌现能力。
Jitang Li, Jinzheng Li
TinyLlama以Llama 2架构训练1.1B模型,处理约3万亿token并超越同规模基线。
Peiyuan Zhang, Guangtao Zeng, Tianduo Wang 等
提出CRVPINN,通过点碰撞加速鲁棒变分PINN,解决多类PDE问题。
Marcin Łoś, Tomasz Służalec, Paweł Maczuga 等
提出GUESS框架,利用逐步抽象的多尺度骨架和级联潜扩散模型实现文本引导的人体动作生成。
Xuehao Gao, Yang Yang, Zhenyu Xie 等