Android in the Wild: A Large-Scale Dataset for Android Device Control
Android in the Wild (AITW)数据集提供了715k个设备交互示例,支持多版本和多设备类型。
Christopher Rawles, Alice Li, Daniel Rodriguez 等
Android in the Wild (AITW)数据集提供了715k个设备交互示例,支持多版本和多设备类型。
Christopher Rawles, Alice Li, Daniel Rodriguez 等
提出层级模仿学习系统,实现多阶段电缆路径规划,显著提升鲁棒性。
Jianlan Luo, Charles Xu, Xinyang Geng 等
提出FlashAttention-2,通过优化工作划分实现Attention速度提升2倍,达成50-73%的GPU最大FLOPs利用率。
Tri Dao
提出nPOLO框架,通过多次散射实现低功耗光学非线性,结合线性光学实现多层神经网络。
Mustafa Yildirim, Niyazi Ulas Dinc, Ilker Oguz 等
提出流式CTR预测任务,分析模型在动态数据中的表现差异,采用参数调优与样本回放提升效果。
Qi-Wei Wang, Hongyu Lu, Yu Chen 等
InternVid利用大规模视频文本数据和多尺度生成策略,训练出ViCLIP模型,实现零-shot动作识别和多模态理解。
Yi Wang, Yinan He, Yizhuo Li 等
利用检索增强的视频生成方法,生成连贯的故事视频。
Yingqing He, Menghan Xia, Haoxin Chen 等
DecompEval利用指令式问答和句子分解,基于指令调优的预训练模型实现无监督文本评价。
Pei Ke, Fei Huang, Fei Mi 等
本文综述了大语言模型(LLM)的最新进展,涵盖架构创新和多模态应用。
Humza Naveed, Asad Ullah Khan, Shi Qiu 等
NaViT通过序列打包处理任意分辨率图像,提升训练效率和性能。
Mostafa Dehghani, Basil Mustafa, Josip Djolonga 等
提出MMBench,基于CircularEval的多模态模型评估基准,涵盖3000+题,支持中英双语。
Yuan Liu, Haodong Duan, Yuanhan Zhang 等
HIMOS通过分层强化学习实现机器人在未知环境中的多物体搜索,成功率超90%。
Fabian Schmalstieg, Daniel Honerkamp, Tim Welschehold 等
预测流水线解码(PPD)通过并行化减少LLM解码延迟,保持输出一致。
Seongjun Yang, Gibbeum Lee, Jaewoong Cho 等
引入生态系统分析,揭示部署模型中的系统性失败和群体性偏差,涵盖文本、图像、语音11数据集。
Connor Toups, Rishi Bommasani, Kathleen A. Creel 等
提出基于可微渲染的3D原语分解方法,利用纹理超二次曲面实现场景解析。
Tom Monnier, Jake Austin, Angjoo Kanazawa 等
提出Objaverse-XL,包含超1000万3D模型,显著提升3D视觉任务性能。
Matt Deitke, Ruoshi Liu, Matthew Wallingford 等
AnimateDiff利用迁移学习和MotionLoRA,无需模型微调,实现个性化文本到动画生成,提升动画质量和多样性。
Yuwei Guo, Ceyuan Yang, Anyi Rao 等
提出BeaverTails数据集,通过区分有用性与无害性提升大模型安全对齐,包含33万QA对和36万偏好标注。
Jiaming Ji, Mickel Liu, Juntao Dai 等
RLTF通过多粒度单元测试反馈在线优化大语言模型,提升代码生成性能。
Jiate Liu, Yiqin Zhu, Kaiwen Xiao 等
SVIT提出了一个包含420万高质量视觉指令数据集的方法,显著超越当前多模态大模型性能。
Bo Zhao, Boya Wu, Muyang He 等