SGLang: Efficient Execution of Structured Language Model Programs
提出SGLang系统,通过RadixAttention和压缩有限状态机实现大规模语言模型程序的高效执行,提升吞吐达6.4倍。
Lianmin Zheng, Liangsheng Yin, Zhiqiang Xie 等
提出SGLang系统,通过RadixAttention和压缩有限状态机实现大规模语言模型程序的高效执行,提升吞吐达6.4倍。
Lianmin Zheng, Liangsheng Yin, Zhiqiang Xie 等
W.A.L.T采用因果编码和窗口注意力,实现高效逼真视频生成,达SOTA性能。
Agrim Gupta, Lijun Yu, Kihyuk Sohn 等
提出Upscale-A-Video,基于潜在扩散模型实现具有时间一致性的视频超分,融合局部短序列和全局长序列机制。
Shangchen Zhou, Peiqing Yang, Jianyi Wang 等
提出LLM360框架,全面开源7B模型及训练细节,提升透明度和可复现性。
Zhengzhong Liu, Aurick Qiao, Willie Neiswanger 等
DiffVL结合视觉和语言扩展软体操控,使用可微物理求解复杂任务。
Zhiao Huang, Feng Chen, Yewen Pu 等
EQ-Bench通过对话情感强度预测评估大模型情商,相关性高达0.97。
Samuel J. Paech
Vary方法扩展视觉词汇,实现DocVQA 78.2% ANLS和MMVet 36.2%。
Haoran Wei, Lingyu Kong, Jinyue Chen 等
音视频LLM通过模态增强训练实现视频理解,在MSRVTT-QA上准确率达53.7%。
Fangxun Shu, Lei Zhang, Hao Jiang 等
ASH采用二维纹理空间参数化的可动画高斯点云,实现实时高保真人体渲染。
Haokai Pang, Heming Zhu, Adam Kortylewski 等
DiffMatte利用扩散模型多步迭代优化自然图像抠图,SAD提升8%。
Yihan Hu, Yiheng Lin, Wei Wang 等
提出Pensieve系统,通过多层GPU-CPU缓存实现多轮对话中LLM状态保持,提升吞吐量达3倍。
Lingfan Yu, Jinkun Lin, Jinyang Li
基于Transformer的HaMeR模型,从单目图像重建高精度3D手部网格,显著优于现有方法。
Georgios Pavlakos, Dandan Shan, Ilija Radosavovic 等
提出基于层级主动推理的空间-时间导航模型,结合视觉观察与路径规划。
Daria de Tinguy, Toon van de Maele, Tim Verbelen 等
Llama Guard利用LLM进行输入输出内容安全分类,基于风险分类体系,性能优越。
Hakan Inan, Kartikeya Upasani, Jianfeng Chi 等
利用大规模语言模型(如GPT-4)进行超参数优化,在预算有限时表现优于贝叶斯优化。
Michael R. Zhang, Nishkrit Desai, Juhan Bae 等
RAVE利用噪声随机洗牌,实现无需训练的高效视频编辑,保持时间一致性。
Ozgur Kara, Bariscan Kurtkaya, Hidir Yesiltepe 等
提出LLMCompiler,实现多工具并行调用,提升速度至3.7倍,成本降低6.7倍。
Sehoon Kim, Suhong Moon, Ryan Tabrizi 等
DreamVideo利用文本逆转和轻量适配器实现个性化视频生成,融合主体细节与运动模式。
Yujie Wei, Shiwei Zhang, Zhiwu Qing 等
提出Representation-Conditioned Generation(RCG)框架,通过自监督编码器生成语义表示,显著提升无条件图像生成的质量,FID降至2.15。
Tianhong Li, Dina Katabi, Kaiming He
OneLLM通过统一框架将八种模态与语言对齐,提升多模态理解能力。
Jiaming Han, Kaixiong Gong, Yiyuan Zhang 等