A Simple and Effective Pruning Approach for Large Language Models
Wanda通过输入激活与权重乘积实现无训练剪枝,显著优于传统幅值剪枝。
Mingjie Sun, Zhuang Liu, Anna Bair 等
Wanda通过输入激活与权重乘积实现无训练剪枝,显著优于传统幅值剪枝。
Mingjie Sun, Zhuang Liu, Anna Bair 等
MotionGPT通过微调大模型实现多模态人类运动生成,支持文本和单帧姿势控制。
Yaqi Zhang, Di Huang, Bin Liu 等
提出RealImpact数据集,包含50个日常物体的15万条冲击声记录,用于音频视觉学习与模拟校准。
Samuel Clarke, Ruohan Gao, Mason Wang 等
Block-State Transformer结合SSM和Block Transformer,提升语言建模性能和速度。
Mahan Fathi, Jonathan Pilault, Orhan Firat 等
R2A框架在零样本视频问答中超越Flamingo-80B,参数仅1.3B。
Junting Pan, Ziyi Lin, Yuying Ge 等
DreamSim利用合成数据训练,提升对人类视觉相似度的感知,超越传统像素级指标。
Stephanie Fu, Netanel Tamir, Shobhita Sundaram 等
LVLM-eHub评估8个大型视觉语言模型,揭示过拟合和对象幻觉问题,提出多轮推理框架。
Peng Xu, Wenqi Shao, Kaipeng Zhang 等
NAVI是一个类别无关的图像集,配备高质量3D模型和精确摄像机参数,支持多场景3D重建与对应任务。
Varun Jampani, Kevis-Kokitsi Maninis, Andreas Engelhardt 等
提出基于TTFS编码的深度SNN,训练实现与ReLU网络等效,性能超越以往,平均每神经元仅0.3个脉冲。
Ana Stanojevic, Stanisław Woźniak, Guillaume Bellec 等
提出ARGO1M数据集和CIR方法,实现跨场景、地点动作识别的泛化,优于现有方法。
Chiara Plizzari, Toby Perrett, Barbara Caputo 等
AssistGPT结合PEIL策略,通过多模态工具实现复杂视觉任务的自主规划与学习。
Difei Gao, Lei Ji, Luowei Zhou 等
MiniLLM以反向KLD和在策略蒸馏训练小模型;LLaMA-7B在SelfInst达73.1 GPT-4分、23.2 Rouge-L。
Yuxian Gu, Li Dong, Furu Wei 等
提出三类框架融合大规模语言模型与知识图谱,提升知识理解与推理能力。
Shirui Pan, Linhao Luo, Yufei Wang 等
提出Fast-Grasp’D,基于可微模拟的多指抓取生成,生成一百万高质量抓取样本。
Dylan Turpin, Tao Zhong, Shutong Zhang 等
提出TF++,解决端到端驾驶模型中的偏见,提升Longest6得分11分。
Bernhard Jaeger, Kashyap Chitta, Andreas Geiger
WebGLM结合GLM和网络搜索,提升问答系统效率,10B参数模型优于13B WebGPT。
Xiao Liu, Hanyu Lai, Hao Yu 等
iPDP扩展PDP以处理动态建模,适应概念漂移。
Maximilian Muschalik, Fabian Fumagalli, Rohit Jagtani 等
提出VoxMol,一种基于得分函数的3D分子生成方法,利用体素网格实现高效、逼真的药物分子模拟。
Pedro O. Pinheiro, Joshua Rackers, Joseph Kleinhenz 等
Valley模型结合ViT-L/14与三种时间建模模块,构建702k视频文本对齐和73k指令数据,显著提升视频理解能力。
Ruipu Luo, Ziwang Zhao, Min Yang 等
MiROCL方法在工业和合成数据上表现优异,提升超30%。
Haozhe Wang, Chao Du, Panyan Fang 等