LayerSkip: Enabling Early Exit Inference and Self-Speculative Decoding
LayerSkip结合层丢弃与早期退出,提升大模型推理速度达2.16倍,创新自我猜测解码。
Mostafa Elhoushi, Akshat Shrivastava, Diana Liskovich 等
LayerSkip结合层丢弃与早期退出,提升大模型推理速度达2.16倍,创新自我猜测解码。
Mostafa Elhoushi, Akshat Shrivastava, Diana Liskovich 等
数据到论文平台自动生成可验证研究,80-90%准确率。
Tal Ifargan, Lukas Hafner, Maor Kern 等
GraphRAG利用图结构实现大规模文本的全局理解,显著优于传统RAG。
Darren Edge, Ha Trinh, Newman Cheng 等
提出一种基于监督学习的LLMs不确定性估计方法,利用隐藏层激活信息,提升在不同任务中的表现。
Linyu Liu, Yu Pan, Xiaocheng Li 等
ViViDex利用人类视频,通过强化学习和轨迹引导,实现多指机器人手的视觉操控,显著优于现有方法。
Zerui Chen, Shizhe Chen, Etienne Arlaud 等
提出CoST,通过对比学习实现语义标记,提升生成推荐的Recall@5达43%。
Jieming Zhu, Mengqun Jin, Qijiong Liu 等
提出“Align Your Steps”优化扩散模型采样调度,显著提升少步采样质量。
Amirmojtaba Sabour, Sanja Fidler, Karsten Kreis
SnapKV通过观察窗口自动压缩LLM的KV缓存,提升长序列处理效率。
Yuhong Li, Yingbing Huang, Bowen Yang 等
采用Retinexformer和多尺度融合技术,提升低光照图像质量,PSNR达25.52dB。
Xiaoning Liu, Zongwei Wu, Ao Li 等
phi-3-mini为3.8亿参数模型,训练数据达3.3万亿,性能媲美GPT-3.5,能在手机端部署。
Marah Abdin, Jyoti Aneja, Hany Awadalla 等
LLaMA3量化研究揭示低位宽下性能下降问题,使用GPTQ和AWQ等方法。
Wei Huang, Xingyu Zheng, Xudong Ma 等
提出指令层级机制,训练大模型优先处理特权指令,显著提升鲁棒性。
Eric Wallace, Kai Xiao, Reimar Leike 等
MoVA通过粗到细机制适应多模态上下文,提升视觉专家组合的性能。
Zhuofan Zong, Bingqi Ma, Dazhong Shen 等
PhysDreamer通过视频生成学习物理先验,实现静态3D物体的交互动态模拟。
Tianyuan Zhang, Hong-Xing Yu, Rundi Wu 等
本文分析了Fréchet Video Distance(FVD)在内容偏差上的表现,发现其偏重于单帧质量而忽视运动连续性,主要源于特征提取模型的内容偏向。
Songwei Ge, Aniruddha Mahapatra, Gaurav Parmar 等
Blink基准测试14项核心视觉感知任务,采用多模态大模型(如GPT-4V、Gemini)进行评估,平均准确率仅51.26%,远低于人类的95.70%。
Xingyu Fu, Yushi Hu, Bangzheng Li 等
提出PROSE-PDE,结合多算子学习与符号编码,具强泛化与外推能力。
Jingmin Sun, Yuxuan Liu, Zecheng Zhang 等
论文提出Viewpoint Control,用多视图3D特征控制定制对象视角,但摘要未报告具体数值。
Nupur Kumari, Grace Su, Richard Zhang 等
提出基于概率提升的批量贝叶斯优化框架SOBER,结合核求积实现多变量、多空间的高效优化。
Masaki Adachi, Satoshi Hayakawa, Martin Jørgensen 等
利用多义一致性检测语言模型的语义深度,基于Frege感知理论,评估GPT-3.5在五语种中的表现。
Xenia Ohmer, Elia Bruni, Dieuwke Hupkes