Persona-centric Metamorphic Relation guided Robustness Evaluation for Multi-turn Dialogue Modelling
提出以人格为中心的变形关系,用于多轮对话模型的鲁棒性评估,显示prompt学习更强。
Yanbing Chen, Lin Li, Xiaohui Tao 等
提出以人格为中心的变形关系,用于多轮对话模型的鲁棒性评估,显示prompt学习更强。
Yanbing Chen, Lin Li, Xiaohui Tao 等
SpatialVLM通过大规模互联网数据训练,显著提升VLM的3D空间推理能力,达成距离估算准确率99%。
Boyuan Chen, Zhuo Xu, Sean Kirmani 等
基于LLMs的多智能体系统通过合作、通信与能力演化实现复杂任务,关键算法包括DyLAN、ProAgent等。
Taicheng Guo, Xiuying Chen, Yaqi Wang 等
提出缺失模态令牌(MMT),在Ego4D等数据集上减少性能损失至10%。
Merey Ramazanova, Alejandro Pardo, Humam Alwassel 等
Medusa通过添加多解码头实现LLM推理加速,达2.2-3.6倍提升,采用树状注意机制和多头预测。
Tianle Cai, Yuhong Li, Zhengyang Geng 等
提出OFMS-FT算法,通过联邦学习实现内存受限设备的在线模型选择和微调,实验显示回归和分类任务中表现优异。
Pouya M. Ghari, Yanning Shen
ChatQA通过两阶段指令调优和密集检索器,超越GPT-4在对话问答和RAG上的表现。
Zihan Liu, Wei Ping, Rajarshi Roy 等
提出自我奖励语言模型,通过迭代DPO训练,Llama 2 70B在AlpacaEval 2.0中超越Claude 2、Gemini Pro和GPT-4 0613。
Weizhe Yuan, Richard Yuanzhe Pang, Kyunghyun Cho 等
提出R-Judge基准,评估大模型在多场景下的安全风险识别能力,最佳模型达74.42%。
Tongxin Yuan, Zhiwei He, Lingzhong Dong 等
SymbolNet通过自适应动态剪枝实现神经符号回归,提升压缩效率。
Ho Fung Tsoi, Vladimir Loncar, Sridhara Dasu 等
引入几何平滑动量的随机Kaczmarz算法,提升小奇异向量方向的收敛速度。
Seth J. Alderman, Roan W. Luikart, Nicholas F. Marshall
Vlogger结合大模型与扩散模型,实现长视频vlog自动生成,达5分钟,保持脚本与演员一致。
Shaobin Zhuang, Kunchang Li, Xinyuan Chen 等
POP-3D提出基于图像的开集词汇3D占据预测模型,利用自监督学习实现无需手工标注的多模态训练。
Antonin Vobecky, Oriane Siméoni, David Hurych 等
SceneVerse通过大规模3D场景-语言数据集和GPS预训练框架,实现3D场景理解的突破。
Baoxiong Jia, Yixin Chen, Huangyue Yu 等
本研究提出通过微调空间模块,利用低质量视频和高质量图片,训练高质量视频扩散模型。
Haoxin Chen, Yong Zhang, Xiaodong Cun 等
SeeClick利用GUI定位预训练,显著提升视觉GUI代理性能,达成多平台任务自动化。
Kanzhi Cheng, Qiushi Sun, Yougang Chu 等
提出IQC方法生成MMIQC数据集,Qwen-72B-MMIQC在MATH基准上达45.0%准确率。
Haoxiong Liu, Yifan Zhang, Yifan Luo 等
提出多模态心智理论问答(MMToM-QA)基准,结合贝叶斯逆向规划与语言模型,提升机器心智推理能力。
Chuanyang Jin, Yutong Wu, Jing Cao 等
提出多轨时间线控制方法,结合预训练扩散模型实现多动作细粒度生成。
Mathis Petrovich, Or Litany, Umar Iqbal 等
提出对比偏好优化(CPO)提升7B/13B模型翻译性能,显著超越SFT,匹配GPT-4。
Haoran Xu, Amr Sharaf, Yunmo Chen 等