A Systematic Study of Cross-Layer KV Sharing for Efficient LLM Inference
统一框架系统比较LCKV、YOCO与CLA:KV缓存减半时多数配置兼顾速度与性能。
You Wu, Haoyi Wu, Kewei Tu
统一框架系统比较LCKV、YOCO与CLA:KV缓存减半时多数配置兼顾速度与性能。
You Wu, Haoyi Wu, Kewei Tu
提出Feedback Schrödinger Bridge匹配(FSBM),结合少量预对齐样本提升效率与泛化。
Panagiotis Theodoropoulos, Nikolaos Komianos, Vincent Pacelli 等
提出MemTree,采用动态树状记忆结构,显著提升长时记忆管理,适用于多轮对话与文档问答。
Alireza Rezazadeh, Zichao Li, Wei Wei 等
提出基于生物学动机的评估框架,发现scVI和PCA在转录组扰动分析中优于新兴基础模型。
Ihab Bendidi, Shawn Whitfield, Kian Kenyon-Dean 等
DreamVideo-2实现零样本主体驱动视频定制,结合参考注意力与掩码引导运动,无需测试时微调。
Yujie Wei, Shiwei Zhang, Hangjie Yuan 等
V-GPS利用离线强化学习的价值函数对多种机器人策略进行测试时重新排序,有效提升12项任务的性能,平均提升82.8%。
Mitsuhiko Nakamoto, Oier Mees, Aviral Kumar 等
本文首次提出评分偏差扩散模型的性能保证,分析零样本条件采样中的偏差与收敛,提供明确的维度依赖关系。
Yuchen Liang, Peizhong Ju, Yingbin Liang 等
本研究采用统一的检索增强生成(RAG)框架,评估了24个多语言大模型在印度患者医疗问答中的表现,重点关注事实正确性和文化适应性。
Varun Gumma, Ananditha Raghunath, Mohit Jain 等
OpenAI的o1模型在数学、编码等推理任务中表现最佳,使用Test-time Compute方法。
Siwei Wu, Zhongyuan Peng, Xinrun Du 等
深度模型合并通过损失景观几何连接模型合并与神经网络训练现象,揭示模型可解释性的新方向。
Arham Khan, Todd Nief, Nathaniel Hudson 等
本研究评估10个顶级智能代理在GitHub实际问题中的补丁生成表现,涵盖补丁模式、代码质量与复杂度。
Zhi Chen, Lingxiao Jiang
提出多场景视觉定位基准MC-Bench,评估多模态大模型在多图环境中的实例定位能力。
Yunqiu Xu, Linchao Zhu, Yi Yang
FlashAudio通过校正流实现快速高保真文本到音频生成,速度提升400倍。
Huadai Liu, Jialei Wang, Rongjie Huang 等
提出DeCo动态校正解码方法,有效降低多模态大语言模型的幻觉率。
Chenxi Wang, Xiang Chen, Ningyu Zhang 等
使用ASP生成树集成学习方法的全局和局部解释,提升模型可解释性。
Akihiro Takemura, Katsumi Inoue
Li和 Zhou发现MoE大模型的路由权重(RW)可作为无需微调的优质嵌入,结合HS提升性能。
Ziyue Li, Tianyi Zhou
SANA采用深度压缩自编码器与线性DiT,能在单GPU上高效生成4096×4096图像。
Enze Xie, Junsong Chen, Junyu Chen 等
VisRAG利用视觉-语言模型(VLM)实现多模态文档的检索增强生成,提升性能20-40%。
Shi Yu, Chaoyue Tang, Bokai Xu 等
SimBa通过引入简洁偏差,扩展深度RL网络参数,提升样本效率和性能。
Hojoon Lee, Dongyoon Hwang, Donghu Kim 等
FlatQuant通过可学习的仿射变换显著提升LLM量化的平坦性,达成W4A4精度误差<1%。
Yuxuan Sun, Ruikang Liu, Haoli Bai 等